diff --git "a/trainer_state.json" "b/trainer_state.json" new file mode 100644--- /dev/null +++ "b/trainer_state.json" @@ -0,0 +1,40427 @@ +{ + "best_metric": 0.4587233364582062, + "best_model_checkpoint": "models/qwen2.5-3b-dpo-vanilla-no-tools/checkpoint-10000", + "epoch": 0.9999813887699838, + "eval_steps": 5000, + "global_step": 26865, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 3.722246003238354e-05, + "grad_norm": 1.9097327730480331, + "learning_rate": 1.8608113137327875e-10, + "logits/chosen": -2.65625, + "logits/rejected": -2.1875, + "logps/chosen": -128.0, + "logps/rejected": -128.0, + "loss": 0.6914, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 1 + }, + { + "epoch": 0.0003722246003238354, + "grad_norm": 2.2702518248859556, + "learning_rate": 1.8608113137327875e-09, + "logits/chosen": -2.484375, + "logits/rejected": -2.28125, + "logps/chosen": -166.0, + "logps/rejected": -165.0, + "loss": 0.6921, + "rewards/accuracies": 0.0833333358168602, + "rewards/chosen": -0.000522613525390625, + "rewards/margins": -0.000904083251953125, + "rewards/rejected": 0.0003833770751953125, + "step": 10 + }, + { + "epoch": 0.0007444492006476708, + "grad_norm": 1.9495617640862475, + "learning_rate": 3.721622627465575e-09, + "logits/chosen": -2.4375, + "logits/rejected": -2.46875, + "logps/chosen": -196.0, + "logps/rejected": -175.0, + "loss": 0.6925, + "rewards/accuracies": 0.3375000059604645, + "rewards/chosen": -4.57763671875e-05, + "rewards/margins": 0.00084686279296875, + "rewards/rejected": -0.00089263916015625, + "step": 20 + }, + { + "epoch": 0.0011166738009715062, + "grad_norm": 1.6726810534860268, + "learning_rate": 5.5824339411983625e-09, + "logits/chosen": -2.515625, + "logits/rejected": -2.28125, + "logps/chosen": -182.0, + "logps/rejected": -163.0, + "loss": 0.6924, + "rewards/accuracies": 0.28125, + "rewards/chosen": -0.0004825592041015625, + "rewards/margins": -0.000640869140625, + "rewards/rejected": 0.000156402587890625, + "step": 30 + }, + { + "epoch": 0.0014888984012953416, + "grad_norm": 1.6462117598724253, + "learning_rate": 7.44324525493115e-09, + "logits/chosen": -2.53125, + "logits/rejected": -2.375, + "logps/chosen": -188.0, + "logps/rejected": -162.0, + "loss": 0.6922, + "rewards/accuracies": 0.36250001192092896, + "rewards/chosen": 0.0002956390380859375, + "rewards/margins": 0.000934600830078125, + "rewards/rejected": -0.000640869140625, + "step": 40 + }, + { + "epoch": 0.001861123001619177, + "grad_norm": 1.8766243763315376, + "learning_rate": 9.304056568663937e-09, + "logits/chosen": -2.484375, + "logits/rejected": -2.28125, + "logps/chosen": -177.0, + "logps/rejected": -153.0, + "loss": 0.6927, + "rewards/accuracies": 0.36250001192092896, + "rewards/chosen": 0.0012054443359375, + "rewards/margins": 0.000690460205078125, + "rewards/rejected": 0.000518798828125, + "step": 50 + }, + { + "epoch": 0.0022333476019430125, + "grad_norm": 1.8802283859316804, + "learning_rate": 1.1164867882396725e-08, + "logits/chosen": -2.65625, + "logits/rejected": -2.46875, + "logps/chosen": -170.0, + "logps/rejected": -145.0, + "loss": 0.6928, + "rewards/accuracies": 0.35624998807907104, + "rewards/chosen": 0.0004062652587890625, + "rewards/margins": -2.9802322387695312e-05, + "rewards/rejected": 0.000438690185546875, + "step": 60 + }, + { + "epoch": 0.002605572202266848, + "grad_norm": 2.01305504328485, + "learning_rate": 1.3025679196129512e-08, + "logits/chosen": -2.5, + "logits/rejected": -2.328125, + "logps/chosen": -181.0, + "logps/rejected": -169.0, + "loss": 0.6928, + "rewards/accuracies": 0.2874999940395355, + "rewards/chosen": -0.00029754638671875, + "rewards/margins": 0.00016021728515625, + "rewards/rejected": -0.000453948974609375, + "step": 70 + }, + { + "epoch": 0.002977796802590683, + "grad_norm": 1.8073154622979284, + "learning_rate": 1.48864905098623e-08, + "logits/chosen": -2.421875, + "logits/rejected": -2.234375, + "logps/chosen": -161.0, + "logps/rejected": -142.0, + "loss": 0.6929, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": -0.00177001953125, + "rewards/margins": 0.0014190673828125, + "rewards/rejected": -0.0031890869140625, + "step": 80 + }, + { + "epoch": 0.0033500214029145185, + "grad_norm": 1.8421541102872958, + "learning_rate": 1.6747301823595087e-08, + "logits/chosen": -2.515625, + "logits/rejected": -2.359375, + "logps/chosen": -196.0, + "logps/rejected": -186.0, + "loss": 0.6929, + "rewards/accuracies": 0.3125, + "rewards/chosen": 0.0001392364501953125, + "rewards/margins": -0.00021648406982421875, + "rewards/rejected": 0.0003604888916015625, + "step": 90 + }, + { + "epoch": 0.003722246003238354, + "grad_norm": 1.9929974368949581, + "learning_rate": 1.8608113137327873e-08, + "logits/chosen": -2.484375, + "logits/rejected": -2.359375, + "logps/chosen": -212.0, + "logps/rejected": -179.0, + "loss": 0.6926, + "rewards/accuracies": 0.35624998807907104, + "rewards/chosen": -0.00028228759765625, + "rewards/margins": 0.00028228759765625, + "rewards/rejected": -0.0005645751953125, + "step": 100 + }, + { + "epoch": 0.004094470603562189, + "grad_norm": 1.7727687424813967, + "learning_rate": 2.0468924451060663e-08, + "logits/chosen": -2.484375, + "logits/rejected": -2.328125, + "logps/chosen": -196.0, + "logps/rejected": -176.0, + "loss": 0.6926, + "rewards/accuracies": 0.3062500059604645, + "rewards/chosen": -0.00115966796875, + "rewards/margins": -0.0005035400390625, + "rewards/rejected": -0.0006561279296875, + "step": 110 + }, + { + "epoch": 0.004466695203886025, + "grad_norm": 1.7306721315573685, + "learning_rate": 2.232973576479345e-08, + "logits/chosen": -2.546875, + "logits/rejected": -2.3125, + "logps/chosen": -182.0, + "logps/rejected": -173.0, + "loss": 0.6927, + "rewards/accuracies": 0.26875001192092896, + "rewards/chosen": -0.00148773193359375, + "rewards/margins": -0.00162506103515625, + "rewards/rejected": 0.000141143798828125, + "step": 120 + }, + { + "epoch": 0.00483891980420986, + "grad_norm": 1.9897990343864889, + "learning_rate": 2.4190547078526237e-08, + "logits/chosen": -2.59375, + "logits/rejected": -2.328125, + "logps/chosen": -187.0, + "logps/rejected": -180.0, + "loss": 0.6927, + "rewards/accuracies": 0.36250001192092896, + "rewards/chosen": -0.000782012939453125, + "rewards/margins": 0.0002498626708984375, + "rewards/rejected": -0.00102996826171875, + "step": 130 + }, + { + "epoch": 0.005211144404533696, + "grad_norm": 1.731446878836939, + "learning_rate": 2.6051358392259023e-08, + "logits/chosen": -2.515625, + "logits/rejected": -2.203125, + "logps/chosen": -188.0, + "logps/rejected": -167.0, + "loss": 0.6924, + "rewards/accuracies": 0.3687500059604645, + "rewards/chosen": -3.818422555923462e-07, + "rewards/margins": 0.000812530517578125, + "rewards/rejected": -0.000812530517578125, + "step": 140 + }, + { + "epoch": 0.005583369004857531, + "grad_norm": 2.0915462289977245, + "learning_rate": 2.791216970599181e-08, + "logits/chosen": -2.53125, + "logits/rejected": -2.28125, + "logps/chosen": -180.0, + "logps/rejected": -158.0, + "loss": 0.6924, + "rewards/accuracies": 0.35624998807907104, + "rewards/chosen": 1.4126300811767578e-05, + "rewards/margins": 0.0002956390380859375, + "rewards/rejected": -0.0002803802490234375, + "step": 150 + }, + { + "epoch": 0.005955593605181366, + "grad_norm": 1.974633221074281, + "learning_rate": 2.97729810197246e-08, + "logits/chosen": -2.578125, + "logits/rejected": -2.34375, + "logps/chosen": -176.0, + "logps/rejected": -156.0, + "loss": 0.6926, + "rewards/accuracies": 0.3375000059604645, + "rewards/chosen": 4.5299530029296875e-05, + "rewards/margins": 1.6450881958007812e-05, + "rewards/rejected": 3.170967102050781e-05, + "step": 160 + }, + { + "epoch": 0.006327818205505202, + "grad_norm": 1.8969490991497713, + "learning_rate": 3.163379233345739e-08, + "logits/chosen": -2.484375, + "logits/rejected": -2.21875, + "logps/chosen": -171.0, + "logps/rejected": -158.0, + "loss": 0.6925, + "rewards/accuracies": 0.3125, + "rewards/chosen": -0.00147247314453125, + "rewards/margins": 0.00012493133544921875, + "rewards/rejected": -0.00159454345703125, + "step": 170 + }, + { + "epoch": 0.006700042805829037, + "grad_norm": 1.744630438934527, + "learning_rate": 3.3494603647190173e-08, + "logits/chosen": -2.46875, + "logits/rejected": -2.40625, + "logps/chosen": -189.0, + "logps/rejected": -159.0, + "loss": 0.6924, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": -0.0002307891845703125, + "rewards/margins": 0.0001697540283203125, + "rewards/rejected": -0.0004062652587890625, + "step": 180 + }, + { + "epoch": 0.007072267406152873, + "grad_norm": 1.9454954155767545, + "learning_rate": 3.535541496092296e-08, + "logits/chosen": -2.53125, + "logits/rejected": -2.3125, + "logps/chosen": -166.0, + "logps/rejected": -157.0, + "loss": 0.6926, + "rewards/accuracies": 0.33125001192092896, + "rewards/chosen": -0.0006256103515625, + "rewards/margins": -0.000751495361328125, + "rewards/rejected": 0.0001239776611328125, + "step": 190 + }, + { + "epoch": 0.007444492006476708, + "grad_norm": 1.9102221997085012, + "learning_rate": 3.721622627465575e-08, + "logits/chosen": -2.640625, + "logits/rejected": -2.375, + "logps/chosen": -195.0, + "logps/rejected": -182.0, + "loss": 0.6924, + "rewards/accuracies": 0.34375, + "rewards/chosen": -2.9802322387695312e-05, + "rewards/margins": 0.0004863739013671875, + "rewards/rejected": -0.000514984130859375, + "step": 200 + }, + { + "epoch": 0.007816716606800543, + "grad_norm": 2.0951816134962806, + "learning_rate": 3.9077037588388533e-08, + "logits/chosen": -2.46875, + "logits/rejected": -2.25, + "logps/chosen": -176.0, + "logps/rejected": -163.0, + "loss": 0.6924, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.002655029296875, + "rewards/margins": 0.0017242431640625, + "rewards/rejected": 0.0009307861328125, + "step": 210 + }, + { + "epoch": 0.008188941207124378, + "grad_norm": 1.7457974140727253, + "learning_rate": 4.093784890212133e-08, + "logits/chosen": -2.4375, + "logits/rejected": -2.1875, + "logps/chosen": -180.0, + "logps/rejected": -160.0, + "loss": 0.6926, + "rewards/accuracies": 0.3687500059604645, + "rewards/chosen": 0.0011444091796875, + "rewards/margins": 0.00115203857421875, + "rewards/rejected": -1.6808509826660156e-05, + "step": 220 + }, + { + "epoch": 0.008561165807448215, + "grad_norm": 1.8752016004850744, + "learning_rate": 4.2798660215854113e-08, + "logits/chosen": -2.53125, + "logits/rejected": -2.25, + "logps/chosen": -172.0, + "logps/rejected": -153.0, + "loss": 0.6926, + "rewards/accuracies": 0.41874998807907104, + "rewards/chosen": -0.0004711151123046875, + "rewards/margins": -0.0005950927734375, + "rewards/rejected": 0.000125885009765625, + "step": 230 + }, + { + "epoch": 0.00893339040777205, + "grad_norm": 1.597670525095004, + "learning_rate": 4.46594715295869e-08, + "logits/chosen": -2.5, + "logits/rejected": -2.375, + "logps/chosen": -187.0, + "logps/rejected": -156.0, + "loss": 0.6922, + "rewards/accuracies": 0.46875, + "rewards/chosen": 0.00151824951171875, + "rewards/margins": 0.00341796875, + "rewards/rejected": -0.0019073486328125, + "step": 240 + }, + { + "epoch": 0.009305615008095885, + "grad_norm": 1.8259095323565484, + "learning_rate": 4.652028284331969e-08, + "logits/chosen": -2.4375, + "logits/rejected": -2.265625, + "logps/chosen": -183.0, + "logps/rejected": -177.0, + "loss": 0.6922, + "rewards/accuracies": 0.4312500059604645, + "rewards/chosen": 0.00213623046875, + "rewards/margins": 0.00145721435546875, + "rewards/rejected": 0.000690460205078125, + "step": 250 + }, + { + "epoch": 0.00967783960841972, + "grad_norm": 1.8886451886739373, + "learning_rate": 4.8381094157052473e-08, + "logits/chosen": -2.578125, + "logits/rejected": -2.296875, + "logps/chosen": -181.0, + "logps/rejected": -178.0, + "loss": 0.6922, + "rewards/accuracies": 0.38749998807907104, + "rewards/chosen": 0.00156402587890625, + "rewards/margins": 0.00145721435546875, + "rewards/rejected": 0.00010967254638671875, + "step": 260 + }, + { + "epoch": 0.010050064208743556, + "grad_norm": 1.8776534107788239, + "learning_rate": 5.024190547078526e-08, + "logits/chosen": -2.5625, + "logits/rejected": -2.1875, + "logps/chosen": -183.0, + "logps/rejected": -185.0, + "loss": 0.6915, + "rewards/accuracies": 0.38749998807907104, + "rewards/chosen": 0.001953125, + "rewards/margins": 0.0012664794921875, + "rewards/rejected": 0.0006866455078125, + "step": 270 + }, + { + "epoch": 0.010422288809067391, + "grad_norm": 1.8604464869011383, + "learning_rate": 5.210271678451805e-08, + "logits/chosen": -2.5, + "logits/rejected": -2.265625, + "logps/chosen": -187.0, + "logps/rejected": -178.0, + "loss": 0.6918, + "rewards/accuracies": 0.4124999940395355, + "rewards/chosen": 0.00177001953125, + "rewards/margins": 0.001953125, + "rewards/rejected": -0.000186920166015625, + "step": 280 + }, + { + "epoch": 0.010794513409391226, + "grad_norm": 1.9017588370457659, + "learning_rate": 5.3963528098250833e-08, + "logits/chosen": -2.53125, + "logits/rejected": -2.265625, + "logps/chosen": -185.0, + "logps/rejected": -163.0, + "loss": 0.6918, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0027618408203125, + "rewards/margins": 0.00225830078125, + "rewards/rejected": 0.000499725341796875, + "step": 290 + }, + { + "epoch": 0.011166738009715063, + "grad_norm": 1.795678440130463, + "learning_rate": 5.582433941198362e-08, + "logits/chosen": -2.46875, + "logits/rejected": -2.3125, + "logps/chosen": -185.0, + "logps/rejected": -174.0, + "loss": 0.6916, + "rewards/accuracies": 0.41874998807907104, + "rewards/chosen": 0.0028228759765625, + "rewards/margins": 0.000949859619140625, + "rewards/rejected": 0.0018768310546875, + "step": 300 + }, + { + "epoch": 0.011538962610038898, + "grad_norm": 1.8500049991168492, + "learning_rate": 5.7685150725716413e-08, + "logits/chosen": -2.5625, + "logits/rejected": -2.421875, + "logps/chosen": -186.0, + "logps/rejected": -162.0, + "loss": 0.6916, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.003448486328125, + "rewards/margins": 0.0016937255859375, + "rewards/rejected": 0.00176239013671875, + "step": 310 + }, + { + "epoch": 0.011911187210362733, + "grad_norm": 1.7819307818272416, + "learning_rate": 5.95459620394492e-08, + "logits/chosen": -2.65625, + "logits/rejected": -2.375, + "logps/chosen": -177.0, + "logps/rejected": -162.0, + "loss": 0.6912, + "rewards/accuracies": 0.4937500059604645, + "rewards/chosen": 0.00445556640625, + "rewards/margins": 0.003448486328125, + "rewards/rejected": 0.00099945068359375, + "step": 320 + }, + { + "epoch": 0.012283411810686568, + "grad_norm": 1.9329725404869653, + "learning_rate": 6.140677335318198e-08, + "logits/chosen": -2.484375, + "logits/rejected": -2.390625, + "logps/chosen": -168.0, + "logps/rejected": -152.0, + "loss": 0.6915, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.003936767578125, + "rewards/margins": 0.00262451171875, + "rewards/rejected": 0.0012969970703125, + "step": 330 + }, + { + "epoch": 0.012655636411010404, + "grad_norm": 1.808538628844211, + "learning_rate": 6.326758466691477e-08, + "logits/chosen": -2.53125, + "logits/rejected": -2.1875, + "logps/chosen": -187.0, + "logps/rejected": -164.0, + "loss": 0.6912, + "rewards/accuracies": 0.5062500238418579, + "rewards/chosen": 0.00531005859375, + "rewards/margins": 0.00347900390625, + "rewards/rejected": 0.0018310546875, + "step": 340 + }, + { + "epoch": 0.013027861011334239, + "grad_norm": 1.91375836254956, + "learning_rate": 6.512839598064757e-08, + "logits/chosen": -2.515625, + "logits/rejected": -2.265625, + "logps/chosen": -200.0, + "logps/rejected": -181.0, + "loss": 0.6906, + "rewards/accuracies": 0.45625001192092896, + "rewards/chosen": 0.007080078125, + "rewards/margins": 0.0029296875, + "rewards/rejected": 0.004150390625, + "step": 350 + }, + { + "epoch": 0.013400085611658074, + "grad_norm": 1.9145884011568952, + "learning_rate": 6.698920729438035e-08, + "logits/chosen": -2.578125, + "logits/rejected": -2.421875, + "logps/chosen": -182.0, + "logps/rejected": -167.0, + "loss": 0.6902, + "rewards/accuracies": 0.518750011920929, + "rewards/chosen": 0.007537841796875, + "rewards/margins": 0.0050048828125, + "rewards/rejected": 0.0025482177734375, + "step": 360 + }, + { + "epoch": 0.01377231021198191, + "grad_norm": 1.670827816536535, + "learning_rate": 6.885001860811314e-08, + "logits/chosen": -2.609375, + "logits/rejected": -2.359375, + "logps/chosen": -174.0, + "logps/rejected": -171.0, + "loss": 0.6902, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0093994140625, + "rewards/margins": 0.0054931640625, + "rewards/rejected": 0.00390625, + "step": 370 + }, + { + "epoch": 0.014144534812305746, + "grad_norm": 1.8291731872457426, + "learning_rate": 7.071082992184592e-08, + "logits/chosen": -2.46875, + "logits/rejected": -2.21875, + "logps/chosen": -171.0, + "logps/rejected": -161.0, + "loss": 0.6901, + "rewards/accuracies": 0.41874998807907104, + "rewards/chosen": 0.0108642578125, + "rewards/margins": 0.002960205078125, + "rewards/rejected": 0.0079345703125, + "step": 380 + }, + { + "epoch": 0.01451675941262958, + "grad_norm": 1.8166615721058887, + "learning_rate": 7.257164123557871e-08, + "logits/chosen": -2.59375, + "logits/rejected": -2.4375, + "logps/chosen": -188.0, + "logps/rejected": -156.0, + "loss": 0.6899, + "rewards/accuracies": 0.53125, + "rewards/chosen": 0.0091552734375, + "rewards/margins": 0.00457763671875, + "rewards/rejected": 0.00457763671875, + "step": 390 + }, + { + "epoch": 0.014888984012953415, + "grad_norm": 1.977920783596711, + "learning_rate": 7.44324525493115e-08, + "logits/chosen": -2.625, + "logits/rejected": -2.484375, + "logps/chosen": -200.0, + "logps/rejected": -183.0, + "loss": 0.6893, + "rewards/accuracies": 0.5562499761581421, + "rewards/chosen": 0.0111083984375, + "rewards/margins": 0.00823974609375, + "rewards/rejected": 0.002838134765625, + "step": 400 + }, + { + "epoch": 0.015261208613277252, + "grad_norm": 1.7431636454878188, + "learning_rate": 7.629326386304429e-08, + "logits/chosen": -2.625, + "logits/rejected": -2.4375, + "logps/chosen": -193.0, + "logps/rejected": -166.0, + "loss": 0.6891, + "rewards/accuracies": 0.5375000238418579, + "rewards/chosen": 0.01141357421875, + "rewards/margins": 0.0059814453125, + "rewards/rejected": 0.00543212890625, + "step": 410 + }, + { + "epoch": 0.015633433213601087, + "grad_norm": 1.8562135125891985, + "learning_rate": 7.815407517677707e-08, + "logits/chosen": -2.59375, + "logits/rejected": -2.28125, + "logps/chosen": -183.0, + "logps/rejected": -169.0, + "loss": 0.6889, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.01318359375, + "rewards/margins": 0.010498046875, + "rewards/rejected": 0.0026702880859375, + "step": 420 + }, + { + "epoch": 0.016005657813924924, + "grad_norm": 1.6984781110832412, + "learning_rate": 8.001488649050986e-08, + "logits/chosen": -2.5625, + "logits/rejected": -2.234375, + "logps/chosen": -179.0, + "logps/rejected": -168.0, + "loss": 0.6885, + "rewards/accuracies": 0.5687500238418579, + "rewards/chosen": 0.01409912109375, + "rewards/margins": 0.00836181640625, + "rewards/rejected": 0.005767822265625, + "step": 430 + }, + { + "epoch": 0.016377882414248757, + "grad_norm": 1.8713009411972057, + "learning_rate": 8.187569780424265e-08, + "logits/chosen": -2.5, + "logits/rejected": -2.5, + "logps/chosen": -184.0, + "logps/rejected": -172.0, + "loss": 0.6882, + "rewards/accuracies": 0.59375, + "rewards/chosen": 0.010498046875, + "rewards/margins": 0.00811767578125, + "rewards/rejected": 0.00238037109375, + "step": 440 + }, + { + "epoch": 0.016750107014572593, + "grad_norm": 1.844265594023156, + "learning_rate": 8.373650911797543e-08, + "logits/chosen": -2.609375, + "logits/rejected": -2.46875, + "logps/chosen": -179.0, + "logps/rejected": -164.0, + "loss": 0.6874, + "rewards/accuracies": 0.606249988079071, + "rewards/chosen": 0.01458740234375, + "rewards/margins": 0.01092529296875, + "rewards/rejected": 0.0036468505859375, + "step": 450 + }, + { + "epoch": 0.01712233161489643, + "grad_norm": 1.9249036266165669, + "learning_rate": 8.559732043170823e-08, + "logits/chosen": -2.359375, + "logits/rejected": -2.328125, + "logps/chosen": -193.0, + "logps/rejected": -162.0, + "loss": 0.6881, + "rewards/accuracies": 0.512499988079071, + "rewards/chosen": 0.0174560546875, + "rewards/margins": 0.0086669921875, + "rewards/rejected": 0.0087890625, + "step": 460 + }, + { + "epoch": 0.017494556215220263, + "grad_norm": 1.8947444885679214, + "learning_rate": 8.745813174544101e-08, + "logits/chosen": -2.5, + "logits/rejected": -2.25, + "logps/chosen": -176.0, + "logps/rejected": -171.0, + "loss": 0.6881, + "rewards/accuracies": 0.5687500238418579, + "rewards/chosen": 0.0164794921875, + "rewards/margins": 0.01177978515625, + "rewards/rejected": 0.00469970703125, + "step": 470 + }, + { + "epoch": 0.0178667808155441, + "grad_norm": 1.8137950655296489, + "learning_rate": 8.93189430591738e-08, + "logits/chosen": -2.578125, + "logits/rejected": -2.53125, + "logps/chosen": -194.0, + "logps/rejected": -185.0, + "loss": 0.6865, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.01068115234375, + "rewards/margins": 0.005340576171875, + "rewards/rejected": 0.005340576171875, + "step": 480 + }, + { + "epoch": 0.018239005415867936, + "grad_norm": 1.6754250068159429, + "learning_rate": 9.117975437290658e-08, + "logits/chosen": -2.578125, + "logits/rejected": -2.359375, + "logps/chosen": -187.0, + "logps/rejected": -169.0, + "loss": 0.6867, + "rewards/accuracies": 0.6187499761581421, + "rewards/chosen": 0.01470947265625, + "rewards/margins": 0.01171875, + "rewards/rejected": 0.00299072265625, + "step": 490 + }, + { + "epoch": 0.01861123001619177, + "grad_norm": 1.876860789975684, + "learning_rate": 9.304056568663937e-08, + "logits/chosen": -2.59375, + "logits/rejected": -2.390625, + "logps/chosen": -202.0, + "logps/rejected": -182.0, + "loss": 0.6858, + "rewards/accuracies": 0.668749988079071, + "rewards/chosen": 0.01123046875, + "rewards/margins": 0.0150146484375, + "rewards/rejected": -0.003753662109375, + "step": 500 + }, + { + "epoch": 0.018983454616515606, + "grad_norm": 1.9274375900677172, + "learning_rate": 9.490137700037215e-08, + "logits/chosen": -2.5, + "logits/rejected": -2.328125, + "logps/chosen": -194.0, + "logps/rejected": -170.0, + "loss": 0.6852, + "rewards/accuracies": 0.637499988079071, + "rewards/chosen": 0.011474609375, + "rewards/margins": 0.01483154296875, + "rewards/rejected": -0.0033111572265625, + "step": 510 + }, + { + "epoch": 0.01935567921683944, + "grad_norm": 1.9795674434848012, + "learning_rate": 9.676218831410495e-08, + "logits/chosen": -2.515625, + "logits/rejected": -2.46875, + "logps/chosen": -200.0, + "logps/rejected": -182.0, + "loss": 0.6851, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.0106201171875, + "rewards/margins": 0.01458740234375, + "rewards/rejected": -0.003997802734375, + "step": 520 + }, + { + "epoch": 0.019727903817163276, + "grad_norm": 1.7867038683646506, + "learning_rate": 9.862299962783774e-08, + "logits/chosen": -2.671875, + "logits/rejected": -2.359375, + "logps/chosen": -191.0, + "logps/rejected": -174.0, + "loss": 0.6851, + "rewards/accuracies": 0.5687500238418579, + "rewards/chosen": 0.0107421875, + "rewards/margins": 0.01385498046875, + "rewards/rejected": -0.0030975341796875, + "step": 530 + }, + { + "epoch": 0.020100128417487113, + "grad_norm": 2.321635422204204, + "learning_rate": 1.0048381094157052e-07, + "logits/chosen": -2.671875, + "logits/rejected": -2.390625, + "logps/chosen": -180.0, + "logps/rejected": -166.0, + "loss": 0.6842, + "rewards/accuracies": 0.6312500238418579, + "rewards/chosen": 0.006866455078125, + "rewards/margins": 0.016845703125, + "rewards/rejected": -0.00994873046875, + "step": 540 + }, + { + "epoch": 0.020472353017810946, + "grad_norm": 1.8781699668032819, + "learning_rate": 1.0234462225530331e-07, + "logits/chosen": -2.59375, + "logits/rejected": -2.4375, + "logps/chosen": -191.0, + "logps/rejected": -186.0, + "loss": 0.6823, + "rewards/accuracies": 0.637499988079071, + "rewards/chosen": 0.00433349609375, + "rewards/margins": 0.0206298828125, + "rewards/rejected": -0.0162353515625, + "step": 550 + }, + { + "epoch": 0.020844577618134782, + "grad_norm": 1.918664286905337, + "learning_rate": 1.042054335690361e-07, + "logits/chosen": -2.59375, + "logits/rejected": -2.421875, + "logps/chosen": -179.0, + "logps/rejected": -147.0, + "loss": 0.6837, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.0087890625, + "rewards/margins": 0.01458740234375, + "rewards/rejected": -0.00579833984375, + "step": 560 + }, + { + "epoch": 0.02121680221845862, + "grad_norm": 1.8305005682367024, + "learning_rate": 1.0606624488276889e-07, + "logits/chosen": -2.5625, + "logits/rejected": -2.484375, + "logps/chosen": -177.0, + "logps/rejected": -168.0, + "loss": 0.6809, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.0096435546875, + "rewards/margins": 0.020263671875, + "rewards/rejected": -0.01055908203125, + "step": 570 + }, + { + "epoch": 0.021589026818782452, + "grad_norm": 1.8811354607810746, + "learning_rate": 1.0792705619650167e-07, + "logits/chosen": -2.71875, + "logits/rejected": -2.5, + "logps/chosen": -188.0, + "logps/rejected": -180.0, + "loss": 0.681, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.00518798828125, + "rewards/margins": 0.0255126953125, + "rewards/rejected": -0.020263671875, + "step": 580 + }, + { + "epoch": 0.02196125141910629, + "grad_norm": 1.8518048043763524, + "learning_rate": 1.0978786751023446e-07, + "logits/chosen": -2.640625, + "logits/rejected": -2.265625, + "logps/chosen": -180.0, + "logps/rejected": -182.0, + "loss": 0.6793, + "rewards/accuracies": 0.6625000238418579, + "rewards/chosen": 0.015625, + "rewards/margins": 0.0286865234375, + "rewards/rejected": -0.01312255859375, + "step": 590 + }, + { + "epoch": 0.022333476019430126, + "grad_norm": 1.959429186032332, + "learning_rate": 1.1164867882396724e-07, + "logits/chosen": -2.671875, + "logits/rejected": -2.6875, + "logps/chosen": -203.0, + "logps/rejected": -179.0, + "loss": 0.6792, + "rewards/accuracies": 0.6875, + "rewards/chosen": 0.0062255859375, + "rewards/margins": 0.030517578125, + "rewards/rejected": -0.0242919921875, + "step": 600 + }, + { + "epoch": 0.02270570061975396, + "grad_norm": 1.6860387154068144, + "learning_rate": 1.1350949013770003e-07, + "logits/chosen": -2.65625, + "logits/rejected": -2.453125, + "logps/chosen": -171.0, + "logps/rejected": -149.0, + "loss": 0.6794, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.00469970703125, + "rewards/margins": 0.03271484375, + "rewards/rejected": -0.0279541015625, + "step": 610 + }, + { + "epoch": 0.023077925220077795, + "grad_norm": 1.9592725878142587, + "learning_rate": 1.1537030145143283e-07, + "logits/chosen": -2.703125, + "logits/rejected": -2.46875, + "logps/chosen": -170.0, + "logps/rejected": -165.0, + "loss": 0.6775, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -0.007049560546875, + "rewards/margins": 0.035400390625, + "rewards/rejected": -0.042236328125, + "step": 620 + }, + { + "epoch": 0.023450149820401632, + "grad_norm": 1.8802838684827163, + "learning_rate": 1.1723111276516561e-07, + "logits/chosen": -2.609375, + "logits/rejected": -2.34375, + "logps/chosen": -176.0, + "logps/rejected": -159.0, + "loss": 0.675, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": 0.004730224609375, + "rewards/margins": 0.034423828125, + "rewards/rejected": -0.02978515625, + "step": 630 + }, + { + "epoch": 0.023822374420725465, + "grad_norm": 2.05762157911921, + "learning_rate": 1.190919240788984e-07, + "logits/chosen": -2.671875, + "logits/rejected": -2.421875, + "logps/chosen": -171.0, + "logps/rejected": -178.0, + "loss": 0.6758, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -0.005828857421875, + "rewards/margins": 0.0419921875, + "rewards/rejected": -0.047607421875, + "step": 640 + }, + { + "epoch": 0.024194599021049302, + "grad_norm": 1.9890772989214731, + "learning_rate": 1.2095273539263117e-07, + "logits/chosen": -2.625, + "logits/rejected": -2.421875, + "logps/chosen": -192.0, + "logps/rejected": -180.0, + "loss": 0.6754, + "rewards/accuracies": 0.6187499761581421, + "rewards/chosen": -0.01953125, + "rewards/margins": 0.038330078125, + "rewards/rejected": -0.057861328125, + "step": 650 + }, + { + "epoch": 0.024566823621373135, + "grad_norm": 1.9761320863608818, + "learning_rate": 1.2281354670636396e-07, + "logits/chosen": -2.671875, + "logits/rejected": -2.46875, + "logps/chosen": -193.0, + "logps/rejected": -180.0, + "loss": 0.673, + "rewards/accuracies": 0.668749988079071, + "rewards/chosen": -0.025634765625, + "rewards/margins": 0.039306640625, + "rewards/rejected": -0.06494140625, + "step": 660 + }, + { + "epoch": 0.02493904822169697, + "grad_norm": 2.0911143498909963, + "learning_rate": 1.2467435802009675e-07, + "logits/chosen": -2.65625, + "logits/rejected": -2.515625, + "logps/chosen": -192.0, + "logps/rejected": -182.0, + "loss": 0.6727, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -0.035400390625, + "rewards/margins": 0.05078125, + "rewards/rejected": -0.0859375, + "step": 670 + }, + { + "epoch": 0.02531127282202081, + "grad_norm": 2.1226219039408925, + "learning_rate": 1.2653516933382955e-07, + "logits/chosen": -2.75, + "logits/rejected": -2.734375, + "logps/chosen": -215.0, + "logps/rejected": -187.0, + "loss": 0.6691, + "rewards/accuracies": 0.637499988079071, + "rewards/chosen": -0.043212890625, + "rewards/margins": 0.0299072265625, + "rewards/rejected": -0.0732421875, + "step": 680 + }, + { + "epoch": 0.02568349742234464, + "grad_norm": 2.0052089494235776, + "learning_rate": 1.2839598064756231e-07, + "logits/chosen": -2.75, + "logits/rejected": -2.671875, + "logps/chosen": -191.0, + "logps/rejected": -171.0, + "loss": 0.6688, + "rewards/accuracies": 0.6875, + "rewards/chosen": -0.05078125, + "rewards/margins": 0.050048828125, + "rewards/rejected": -0.10107421875, + "step": 690 + }, + { + "epoch": 0.026055722022668478, + "grad_norm": 1.9629218976934022, + "learning_rate": 1.3025679196129513e-07, + "logits/chosen": -2.765625, + "logits/rejected": -2.546875, + "logps/chosen": -174.0, + "logps/rejected": -175.0, + "loss": 0.6673, + "rewards/accuracies": 0.6625000238418579, + "rewards/chosen": -0.0615234375, + "rewards/margins": 0.045654296875, + "rewards/rejected": -0.107421875, + "step": 700 + }, + { + "epoch": 0.026427946622992315, + "grad_norm": 2.0838379595135574, + "learning_rate": 1.321176032750279e-07, + "logits/chosen": -2.75, + "logits/rejected": -2.59375, + "logps/chosen": -186.0, + "logps/rejected": -172.0, + "loss": 0.6667, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": -0.06005859375, + "rewards/margins": 0.0478515625, + "rewards/rejected": -0.10791015625, + "step": 710 + }, + { + "epoch": 0.026800171223316148, + "grad_norm": 2.06780227169773, + "learning_rate": 1.339784145887607e-07, + "logits/chosen": -2.78125, + "logits/rejected": -2.578125, + "logps/chosen": -172.0, + "logps/rejected": -168.0, + "loss": 0.665, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -0.06396484375, + "rewards/margins": 0.07568359375, + "rewards/rejected": -0.1396484375, + "step": 720 + }, + { + "epoch": 0.027172395823639985, + "grad_norm": 2.0958108327517255, + "learning_rate": 1.3583922590249346e-07, + "logits/chosen": -2.75, + "logits/rejected": -2.546875, + "logps/chosen": -194.0, + "logps/rejected": -192.0, + "loss": 0.6608, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -0.07861328125, + "rewards/margins": 0.09033203125, + "rewards/rejected": -0.1689453125, + "step": 730 + }, + { + "epoch": 0.02754462042396382, + "grad_norm": 1.924679809717578, + "learning_rate": 1.3770003721622628e-07, + "logits/chosen": -2.6875, + "logits/rejected": -2.609375, + "logps/chosen": -187.0, + "logps/rejected": -158.0, + "loss": 0.6573, + "rewards/accuracies": 0.643750011920929, + "rewards/chosen": -0.10791015625, + "rewards/margins": 0.0595703125, + "rewards/rejected": -0.1669921875, + "step": 740 + }, + { + "epoch": 0.027916845024287654, + "grad_norm": 1.9997145682786945, + "learning_rate": 1.3956084852995905e-07, + "logits/chosen": -2.8125, + "logits/rejected": -2.640625, + "logps/chosen": -226.0, + "logps/rejected": -191.0, + "loss": 0.6542, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -0.11572265625, + "rewards/margins": 0.09765625, + "rewards/rejected": -0.2138671875, + "step": 750 + }, + { + "epoch": 0.02828906962461149, + "grad_norm": 2.1187152286547537, + "learning_rate": 1.4142165984369184e-07, + "logits/chosen": -2.78125, + "logits/rejected": -2.515625, + "logps/chosen": -187.0, + "logps/rejected": -203.0, + "loss": 0.6512, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -0.1357421875, + "rewards/margins": 0.10546875, + "rewards/rejected": -0.2412109375, + "step": 760 + }, + { + "epoch": 0.028661294224935328, + "grad_norm": 2.070753688487636, + "learning_rate": 1.432824711574246e-07, + "logits/chosen": -2.75, + "logits/rejected": -2.640625, + "logps/chosen": -194.0, + "logps/rejected": -179.0, + "loss": 0.6522, + "rewards/accuracies": 0.6625000238418579, + "rewards/chosen": -0.1669921875, + "rewards/margins": 0.0859375, + "rewards/rejected": -0.251953125, + "step": 770 + }, + { + "epoch": 0.02903351882525916, + "grad_norm": 2.1226967473795466, + "learning_rate": 1.4514328247115743e-07, + "logits/chosen": -2.796875, + "logits/rejected": -2.734375, + "logps/chosen": -203.0, + "logps/rejected": -210.0, + "loss": 0.6444, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -0.2060546875, + "rewards/margins": 0.119140625, + "rewards/rejected": -0.326171875, + "step": 780 + }, + { + "epoch": 0.029405743425582997, + "grad_norm": 2.2539166318970545, + "learning_rate": 1.470040937848902e-07, + "logits/chosen": -2.890625, + "logits/rejected": -2.671875, + "logps/chosen": -217.0, + "logps/rejected": -225.0, + "loss": 0.6374, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -0.2294921875, + "rewards/margins": 0.1181640625, + "rewards/rejected": -0.34765625, + "step": 790 + }, + { + "epoch": 0.02977796802590683, + "grad_norm": 2.210526412343009, + "learning_rate": 1.48864905098623e-07, + "logits/chosen": -2.84375, + "logits/rejected": -2.625, + "logps/chosen": -237.0, + "logps/rejected": -240.0, + "loss": 0.6451, + "rewards/accuracies": 0.71875, + "rewards/chosen": -0.203125, + "rewards/margins": 0.2060546875, + "rewards/rejected": -0.408203125, + "step": 800 + }, + { + "epoch": 0.030150192626230667, + "grad_norm": 2.3093810768281626, + "learning_rate": 1.5072571641235578e-07, + "logits/chosen": -2.890625, + "logits/rejected": -2.71875, + "logps/chosen": -222.0, + "logps/rejected": -224.0, + "loss": 0.6382, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -0.3046875, + "rewards/margins": 0.142578125, + "rewards/rejected": -0.4453125, + "step": 810 + }, + { + "epoch": 0.030522417226554504, + "grad_norm": 2.2902573111551523, + "learning_rate": 1.5258652772608857e-07, + "logits/chosen": -2.859375, + "logits/rejected": -2.671875, + "logps/chosen": -202.0, + "logps/rejected": -198.0, + "loss": 0.6368, + "rewards/accuracies": 0.6187499761581421, + "rewards/chosen": -0.35546875, + "rewards/margins": 0.0966796875, + "rewards/rejected": -0.451171875, + "step": 820 + }, + { + "epoch": 0.030894641826878337, + "grad_norm": 2.4108673549172104, + "learning_rate": 1.5444733903982134e-07, + "logits/chosen": -2.890625, + "logits/rejected": -2.625, + "logps/chosen": -206.0, + "logps/rejected": -209.0, + "loss": 0.6277, + "rewards/accuracies": 0.6937500238418579, + "rewards/chosen": -0.359375, + "rewards/margins": 0.158203125, + "rewards/rejected": -0.515625, + "step": 830 + }, + { + "epoch": 0.031266866427202174, + "grad_norm": 2.3517127798546222, + "learning_rate": 1.5630815035355413e-07, + "logits/chosen": -2.890625, + "logits/rejected": -2.65625, + "logps/chosen": -218.0, + "logps/rejected": -216.0, + "loss": 0.6243, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -0.404296875, + "rewards/margins": 0.2041015625, + "rewards/rejected": -0.609375, + "step": 840 + }, + { + "epoch": 0.03163909102752601, + "grad_norm": 2.2021853287907036, + "learning_rate": 1.5816896166728693e-07, + "logits/chosen": -2.984375, + "logits/rejected": -2.734375, + "logps/chosen": -197.0, + "logps/rejected": -207.0, + "loss": 0.6235, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -0.41796875, + "rewards/margins": 0.1904296875, + "rewards/rejected": -0.609375, + "step": 850 + }, + { + "epoch": 0.03201131562784985, + "grad_norm": 2.4382852409843205, + "learning_rate": 1.6002977298101972e-07, + "logits/chosen": -2.828125, + "logits/rejected": -2.75, + "logps/chosen": -231.0, + "logps/rejected": -204.0, + "loss": 0.6281, + "rewards/accuracies": 0.637499988079071, + "rewards/chosen": -0.42578125, + "rewards/margins": 0.1240234375, + "rewards/rejected": -0.546875, + "step": 860 + }, + { + "epoch": 0.03238354022817368, + "grad_norm": 2.6006060997416434, + "learning_rate": 1.618905842947525e-07, + "logits/chosen": -3.046875, + "logits/rejected": -2.828125, + "logps/chosen": -238.0, + "logps/rejected": -245.0, + "loss": 0.6242, + "rewards/accuracies": 0.6875, + "rewards/chosen": -0.4765625, + "rewards/margins": 0.19921875, + "rewards/rejected": -0.67578125, + "step": 870 + }, + { + "epoch": 0.03275576482849751, + "grad_norm": 2.3624817402980183, + "learning_rate": 1.637513956084853e-07, + "logits/chosen": -2.84375, + "logits/rejected": -2.640625, + "logps/chosen": -234.0, + "logps/rejected": -224.0, + "loss": 0.6268, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -0.50390625, + "rewards/margins": 0.158203125, + "rewards/rejected": -0.6640625, + "step": 880 + }, + { + "epoch": 0.03312798942882135, + "grad_norm": 2.6704496844783945, + "learning_rate": 1.6561220692221807e-07, + "logits/chosen": -2.875, + "logits/rejected": -2.8125, + "logps/chosen": -221.0, + "logps/rejected": -223.0, + "loss": 0.616, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -0.474609375, + "rewards/margins": 0.2001953125, + "rewards/rejected": -0.67578125, + "step": 890 + }, + { + "epoch": 0.03350021402914519, + "grad_norm": 2.8514281391575014, + "learning_rate": 1.6747301823595087e-07, + "logits/chosen": -3.015625, + "logits/rejected": -2.84375, + "logps/chosen": -232.0, + "logps/rejected": -238.0, + "loss": 0.6084, + "rewards/accuracies": 0.6625000238418579, + "rewards/chosen": -0.53515625, + "rewards/margins": 0.2451171875, + "rewards/rejected": -0.78125, + "step": 900 + }, + { + "epoch": 0.03387243862946902, + "grad_norm": 2.731006607142271, + "learning_rate": 1.6933382954968363e-07, + "logits/chosen": -3.0, + "logits/rejected": -2.828125, + "logps/chosen": -244.0, + "logps/rejected": -262.0, + "loss": 0.5866, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -0.59765625, + "rewards/margins": 0.33984375, + "rewards/rejected": -0.9375, + "step": 910 + }, + { + "epoch": 0.03424466322979286, + "grad_norm": 2.7206444933470157, + "learning_rate": 1.7119464086341645e-07, + "logits/chosen": -3.09375, + "logits/rejected": -3.0, + "logps/chosen": -241.0, + "logps/rejected": -249.0, + "loss": 0.5963, + "rewards/accuracies": 0.65625, + "rewards/chosen": -0.65234375, + "rewards/margins": 0.2470703125, + "rewards/rejected": -0.8984375, + "step": 920 + }, + { + "epoch": 0.03461688783011669, + "grad_norm": 2.772360417113917, + "learning_rate": 1.7305545217714922e-07, + "logits/chosen": -2.953125, + "logits/rejected": -2.953125, + "logps/chosen": -252.0, + "logps/rejected": -248.0, + "loss": 0.597, + "rewards/accuracies": 0.71875, + "rewards/chosen": -0.609375, + "rewards/margins": 0.279296875, + "rewards/rejected": -0.88671875, + "step": 930 + }, + { + "epoch": 0.034989112430440526, + "grad_norm": 3.3559248071850027, + "learning_rate": 1.7491626349088201e-07, + "logits/chosen": -3.0625, + "logits/rejected": -2.953125, + "logps/chosen": -252.0, + "logps/rejected": -264.0, + "loss": 0.594, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -0.6953125, + "rewards/margins": 0.263671875, + "rewards/rejected": -0.95703125, + "step": 940 + }, + { + "epoch": 0.03536133703076436, + "grad_norm": 3.254191846218812, + "learning_rate": 1.767770748046148e-07, + "logits/chosen": -3.15625, + "logits/rejected": -2.984375, + "logps/chosen": -255.0, + "logps/rejected": -276.0, + "loss": 0.5861, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -0.71875, + "rewards/margins": 0.306640625, + "rewards/rejected": -1.0234375, + "step": 950 + }, + { + "epoch": 0.0357335616310882, + "grad_norm": 3.6457190559943125, + "learning_rate": 1.786378861183476e-07, + "logits/chosen": -3.09375, + "logits/rejected": -2.96875, + "logps/chosen": -251.0, + "logps/rejected": -268.0, + "loss": 0.5851, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -0.75390625, + "rewards/margins": 0.310546875, + "rewards/rejected": -1.0625, + "step": 960 + }, + { + "epoch": 0.036105786231412036, + "grad_norm": 3.210391264144676, + "learning_rate": 1.8049869743208037e-07, + "logits/chosen": -3.125, + "logits/rejected": -3.0625, + "logps/chosen": -268.0, + "logps/rejected": -274.0, + "loss": 0.5865, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -0.7421875, + "rewards/margins": 0.2578125, + "rewards/rejected": -1.0, + "step": 970 + }, + { + "epoch": 0.03647801083173587, + "grad_norm": 3.2479937962128496, + "learning_rate": 1.8235950874581316e-07, + "logits/chosen": -3.1875, + "logits/rejected": -3.09375, + "logps/chosen": -268.0, + "logps/rejected": -278.0, + "loss": 0.5786, + "rewards/accuracies": 0.75, + "rewards/chosen": -0.7109375, + "rewards/margins": 0.35546875, + "rewards/rejected": -1.0703125, + "step": 980 + }, + { + "epoch": 0.0368502354320597, + "grad_norm": 3.2026336219407185, + "learning_rate": 1.8422032005954595e-07, + "logits/chosen": -3.15625, + "logits/rejected": -3.046875, + "logps/chosen": -278.0, + "logps/rejected": -300.0, + "loss": 0.5763, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -0.76171875, + "rewards/margins": 0.375, + "rewards/rejected": -1.1328125, + "step": 990 + }, + { + "epoch": 0.03722246003238354, + "grad_norm": 3.3934216128285093, + "learning_rate": 1.8608113137327875e-07, + "logits/chosen": -3.359375, + "logits/rejected": -3.234375, + "logps/chosen": -270.0, + "logps/rejected": -318.0, + "loss": 0.5695, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -0.82421875, + "rewards/margins": 0.3828125, + "rewards/rejected": -1.2109375, + "step": 1000 + }, + { + "epoch": 0.037594684632707376, + "grad_norm": 4.811197922294435, + "learning_rate": 1.8794194268701151e-07, + "logits/chosen": -3.28125, + "logits/rejected": -3.15625, + "logps/chosen": -270.0, + "logps/rejected": -302.0, + "loss": 0.5625, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -0.8359375, + "rewards/margins": 0.419921875, + "rewards/rejected": -1.2578125, + "step": 1010 + }, + { + "epoch": 0.03796690923303121, + "grad_norm": 3.557646799500176, + "learning_rate": 1.898027540007443e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.21875, + "logps/chosen": -274.0, + "logps/rejected": -292.0, + "loss": 0.5716, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -0.91015625, + "rewards/margins": 0.5, + "rewards/rejected": -1.4140625, + "step": 1020 + }, + { + "epoch": 0.03833913383335505, + "grad_norm": 4.040727373831442, + "learning_rate": 1.916635653144771e-07, + "logits/chosen": -3.359375, + "logits/rejected": -3.203125, + "logps/chosen": -272.0, + "logps/rejected": -318.0, + "loss": 0.5626, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -0.921875, + "rewards/margins": 0.50390625, + "rewards/rejected": -1.4296875, + "step": 1030 + }, + { + "epoch": 0.03871135843367888, + "grad_norm": 3.476235870062827, + "learning_rate": 1.935243766282099e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.0625, + "logps/chosen": -262.0, + "logps/rejected": -302.0, + "loss": 0.5734, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -0.8984375, + "rewards/margins": 0.44921875, + "rewards/rejected": -1.34375, + "step": 1040 + }, + { + "epoch": 0.039083583034002715, + "grad_norm": 3.6266634291480746, + "learning_rate": 1.9538518794194266e-07, + "logits/chosen": -3.25, + "logits/rejected": -3.15625, + "logps/chosen": -276.0, + "logps/rejected": -330.0, + "loss": 0.5739, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -0.9140625, + "rewards/margins": 0.4453125, + "rewards/rejected": -1.359375, + "step": 1050 + }, + { + "epoch": 0.03945580763432655, + "grad_norm": 3.6956901467135386, + "learning_rate": 1.9724599925567548e-07, + "logits/chosen": -3.359375, + "logits/rejected": -3.203125, + "logps/chosen": -266.0, + "logps/rejected": -304.0, + "loss": 0.563, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -0.88671875, + "rewards/margins": 0.427734375, + "rewards/rejected": -1.3125, + "step": 1060 + }, + { + "epoch": 0.03982803223465039, + "grad_norm": 4.964415877760095, + "learning_rate": 1.9910681056940825e-07, + "logits/chosen": -3.328125, + "logits/rejected": -3.1875, + "logps/chosen": -282.0, + "logps/rejected": -344.0, + "loss": 0.5557, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -0.953125, + "rewards/margins": 0.57421875, + "rewards/rejected": -1.5234375, + "step": 1070 + }, + { + "epoch": 0.040200256834974225, + "grad_norm": 4.328769581569679, + "learning_rate": 2.0096762188314104e-07, + "logits/chosen": -3.296875, + "logits/rejected": -3.234375, + "logps/chosen": -298.0, + "logps/rejected": -310.0, + "loss": 0.565, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -1.0078125, + "rewards/margins": 0.419921875, + "rewards/rejected": -1.4296875, + "step": 1080 + }, + { + "epoch": 0.04057248143529806, + "grad_norm": 4.561685664853453, + "learning_rate": 2.028284331968738e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.25, + "logps/chosen": -288.0, + "logps/rejected": -320.0, + "loss": 0.566, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -0.94921875, + "rewards/margins": 0.447265625, + "rewards/rejected": -1.390625, + "step": 1090 + }, + { + "epoch": 0.04094470603562189, + "grad_norm": 4.33784550368845, + "learning_rate": 2.0468924451060663e-07, + "logits/chosen": -3.359375, + "logits/rejected": -3.234375, + "logps/chosen": -276.0, + "logps/rejected": -314.0, + "loss": 0.5366, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -0.97265625, + "rewards/margins": 0.5859375, + "rewards/rejected": -1.5546875, + "step": 1100 + }, + { + "epoch": 0.04131693063594573, + "grad_norm": 4.505216621962622, + "learning_rate": 2.065500558243394e-07, + "logits/chosen": -3.28125, + "logits/rejected": -3.1875, + "logps/chosen": -276.0, + "logps/rejected": -324.0, + "loss": 0.5354, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -1.0234375, + "rewards/margins": 0.62109375, + "rewards/rejected": -1.640625, + "step": 1110 + }, + { + "epoch": 0.041689155236269565, + "grad_norm": 4.277688507231565, + "learning_rate": 2.084108671380722e-07, + "logits/chosen": -3.359375, + "logits/rejected": -3.203125, + "logps/chosen": -280.0, + "logps/rejected": -306.0, + "loss": 0.5761, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -1.0859375, + "rewards/margins": 0.482421875, + "rewards/rejected": -1.5703125, + "step": 1120 + }, + { + "epoch": 0.0420613798365934, + "grad_norm": 4.88849420841731, + "learning_rate": 2.1027167845180498e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.15625, + "logps/chosen": -272.0, + "logps/rejected": -328.0, + "loss": 0.5408, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -0.87890625, + "rewards/margins": 0.66796875, + "rewards/rejected": -1.546875, + "step": 1130 + }, + { + "epoch": 0.04243360443691724, + "grad_norm": 4.6659299965403624, + "learning_rate": 2.1213248976553777e-07, + "logits/chosen": -3.328125, + "logits/rejected": -3.21875, + "logps/chosen": -290.0, + "logps/rejected": -312.0, + "loss": 0.5596, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -1.0859375, + "rewards/margins": 0.431640625, + "rewards/rejected": -1.515625, + "step": 1140 + }, + { + "epoch": 0.04280582903724107, + "grad_norm": 4.792599988977468, + "learning_rate": 2.1399330107927054e-07, + "logits/chosen": -3.421875, + "logits/rejected": -3.15625, + "logps/chosen": -274.0, + "logps/rejected": -312.0, + "loss": 0.5505, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -1.125, + "rewards/margins": 0.48046875, + "rewards/rejected": -1.6015625, + "step": 1150 + }, + { + "epoch": 0.043178053637564905, + "grad_norm": 4.90368027547217, + "learning_rate": 2.1585411239300333e-07, + "logits/chosen": -3.5, + "logits/rejected": -3.34375, + "logps/chosen": -294.0, + "logps/rejected": -334.0, + "loss": 0.5472, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -1.078125, + "rewards/margins": 0.515625, + "rewards/rejected": -1.59375, + "step": 1160 + }, + { + "epoch": 0.04355027823788874, + "grad_norm": 4.668380375082959, + "learning_rate": 2.1771492370673613e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.15625, + "logps/chosen": -274.0, + "logps/rejected": -320.0, + "loss": 0.5541, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -0.98828125, + "rewards/margins": 0.53125, + "rewards/rejected": -1.515625, + "step": 1170 + }, + { + "epoch": 0.04392250283821258, + "grad_norm": 5.313103441687499, + "learning_rate": 2.1957573502046892e-07, + "logits/chosen": -3.375, + "logits/rejected": -3.03125, + "logps/chosen": -272.0, + "logps/rejected": -326.0, + "loss": 0.5322, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -0.9453125, + "rewards/margins": 0.55859375, + "rewards/rejected": -1.5078125, + "step": 1180 + }, + { + "epoch": 0.044294727438536415, + "grad_norm": 4.434797396632511, + "learning_rate": 2.214365463342017e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.25, + "logps/chosen": -294.0, + "logps/rejected": -326.0, + "loss": 0.5541, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -1.1015625, + "rewards/margins": 0.53125, + "rewards/rejected": -1.6328125, + "step": 1190 + }, + { + "epoch": 0.04466695203886025, + "grad_norm": 5.283461502011228, + "learning_rate": 2.2329735764793448e-07, + "logits/chosen": -3.5, + "logits/rejected": -3.34375, + "logps/chosen": -286.0, + "logps/rejected": -338.0, + "loss": 0.5415, + "rewards/accuracies": 0.71875, + "rewards/chosen": -1.0859375, + "rewards/margins": 0.57421875, + "rewards/rejected": -1.65625, + "step": 1200 + }, + { + "epoch": 0.04503917663918408, + "grad_norm": 5.146962919353201, + "learning_rate": 2.2515816896166727e-07, + "logits/chosen": -3.4375, + "logits/rejected": -3.328125, + "logps/chosen": -292.0, + "logps/rejected": -324.0, + "loss": 0.5497, + "rewards/accuracies": 0.668749988079071, + "rewards/chosen": -1.1015625, + "rewards/margins": 0.453125, + "rewards/rejected": -1.5546875, + "step": 1210 + }, + { + "epoch": 0.04541140123950792, + "grad_norm": 5.646450830202028, + "learning_rate": 2.2701898027540007e-07, + "logits/chosen": -3.359375, + "logits/rejected": -3.296875, + "logps/chosen": -294.0, + "logps/rejected": -334.0, + "loss": 0.5337, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": -1.1171875, + "rewards/margins": 0.42578125, + "rewards/rejected": -1.546875, + "step": 1220 + }, + { + "epoch": 0.045783625839831754, + "grad_norm": 4.85076328578327, + "learning_rate": 2.2887979158913283e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.328125, + "logps/chosen": -302.0, + "logps/rejected": -344.0, + "loss": 0.5377, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -1.1015625, + "rewards/margins": 0.62890625, + "rewards/rejected": -1.7265625, + "step": 1230 + }, + { + "epoch": 0.04615585044015559, + "grad_norm": 4.281822784521038, + "learning_rate": 2.3074060290286565e-07, + "logits/chosen": -3.390625, + "logits/rejected": -3.234375, + "logps/chosen": -316.0, + "logps/rejected": -346.0, + "loss": 0.5678, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": -1.1484375, + "rewards/margins": 0.423828125, + "rewards/rejected": -1.5703125, + "step": 1240 + }, + { + "epoch": 0.04652807504047943, + "grad_norm": 4.683379355406632, + "learning_rate": 2.3260141421659842e-07, + "logits/chosen": -3.390625, + "logits/rejected": -3.234375, + "logps/chosen": -308.0, + "logps/rejected": -354.0, + "loss": 0.5461, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": -1.109375, + "rewards/margins": 0.55859375, + "rewards/rejected": -1.6640625, + "step": 1250 + }, + { + "epoch": 0.046900299640803264, + "grad_norm": 7.902170570489184, + "learning_rate": 2.3446222553033121e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.296875, + "logps/chosen": -310.0, + "logps/rejected": -338.0, + "loss": 0.565, + "rewards/accuracies": 0.5874999761581421, + "rewards/chosen": -1.171875, + "rewards/margins": 0.45703125, + "rewards/rejected": -1.625, + "step": 1260 + }, + { + "epoch": 0.047272524241127094, + "grad_norm": 4.587829490700819, + "learning_rate": 2.3632303684406398e-07, + "logits/chosen": -3.3125, + "logits/rejected": -3.25, + "logps/chosen": -314.0, + "logps/rejected": -322.0, + "loss": 0.5364, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -1.1484375, + "rewards/margins": 0.46875, + "rewards/rejected": -1.6171875, + "step": 1270 + }, + { + "epoch": 0.04764474884145093, + "grad_norm": 4.9856893229597326, + "learning_rate": 2.381838481577968e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.359375, + "logps/chosen": -300.0, + "logps/rejected": -332.0, + "loss": 0.5293, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -1.078125, + "rewards/margins": 0.59765625, + "rewards/rejected": -1.671875, + "step": 1280 + }, + { + "epoch": 0.04801697344177477, + "grad_norm": 4.580889853163873, + "learning_rate": 2.4004465947152957e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.265625, + "logps/chosen": -318.0, + "logps/rejected": -352.0, + "loss": 0.5359, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -1.234375, + "rewards/margins": 0.58984375, + "rewards/rejected": -1.8203125, + "step": 1290 + }, + { + "epoch": 0.048389198042098604, + "grad_norm": 6.7019225186330456, + "learning_rate": 2.4190547078526233e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.40625, + "logps/chosen": -320.0, + "logps/rejected": -372.0, + "loss": 0.5438, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -1.2109375, + "rewards/margins": 0.7421875, + "rewards/rejected": -1.953125, + "step": 1300 + }, + { + "epoch": 0.04876142264242244, + "grad_norm": 5.250533761484681, + "learning_rate": 2.4376628209899515e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.28125, + "logps/chosen": -286.0, + "logps/rejected": -322.0, + "loss": 0.5272, + "rewards/accuracies": 0.78125, + "rewards/chosen": -1.0859375, + "rewards/margins": 0.66015625, + "rewards/rejected": -1.75, + "step": 1310 + }, + { + "epoch": 0.04913364724274627, + "grad_norm": 6.263136875889413, + "learning_rate": 2.456270934127279e-07, + "logits/chosen": -3.5625, + "logits/rejected": -3.4375, + "logps/chosen": -314.0, + "logps/rejected": -360.0, + "loss": 0.527, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -1.2265625, + "rewards/margins": 0.6328125, + "rewards/rejected": -1.8515625, + "step": 1320 + }, + { + "epoch": 0.04950587184307011, + "grad_norm": 6.531224260550454, + "learning_rate": 2.4748790472646074e-07, + "logits/chosen": -3.46875, + "logits/rejected": -3.359375, + "logps/chosen": -310.0, + "logps/rejected": -340.0, + "loss": 0.5573, + "rewards/accuracies": 0.6625000238418579, + "rewards/chosen": -1.3125, + "rewards/margins": 0.40234375, + "rewards/rejected": -1.71875, + "step": 1330 + }, + { + "epoch": 0.04987809644339394, + "grad_norm": 5.769891227252786, + "learning_rate": 2.493487160401935e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.21875, + "logps/chosen": -288.0, + "logps/rejected": -354.0, + "loss": 0.5312, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -1.0859375, + "rewards/margins": 0.61328125, + "rewards/rejected": -1.703125, + "step": 1340 + }, + { + "epoch": 0.05025032104371778, + "grad_norm": 6.0555869835672125, + "learning_rate": 2.5120952735392633e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.375, + "logps/chosen": -314.0, + "logps/rejected": -360.0, + "loss": 0.5384, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -1.265625, + "rewards/margins": 0.59375, + "rewards/rejected": -1.859375, + "step": 1350 + }, + { + "epoch": 0.05062254564404162, + "grad_norm": 4.5935735855677, + "learning_rate": 2.530703386676591e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.46875, + "logps/chosen": -334.0, + "logps/rejected": -366.0, + "loss": 0.5466, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -1.296875, + "rewards/margins": 0.515625, + "rewards/rejected": -1.8125, + "step": 1360 + }, + { + "epoch": 0.05099477024436545, + "grad_norm": 4.819563724248301, + "learning_rate": 2.5493114998139186e-07, + "logits/chosen": -3.421875, + "logits/rejected": -3.234375, + "logps/chosen": -300.0, + "logps/rejected": -352.0, + "loss": 0.521, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -1.2265625, + "rewards/margins": 0.62109375, + "rewards/rejected": -1.8515625, + "step": 1370 + }, + { + "epoch": 0.05136699484468928, + "grad_norm": 5.997867654446387, + "learning_rate": 2.5679196129512463e-07, + "logits/chosen": -3.546875, + "logits/rejected": -3.453125, + "logps/chosen": -318.0, + "logps/rejected": -354.0, + "loss": 0.5521, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -1.25, + "rewards/margins": 0.62890625, + "rewards/rejected": -1.875, + "step": 1380 + }, + { + "epoch": 0.05173921944501312, + "grad_norm": 6.842483364035436, + "learning_rate": 2.5865277260885745e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.375, + "logps/chosen": -308.0, + "logps/rejected": -378.0, + "loss": 0.5401, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -1.2734375, + "rewards/margins": 0.7421875, + "rewards/rejected": -2.015625, + "step": 1390 + }, + { + "epoch": 0.052111444045336956, + "grad_norm": 6.086281607964243, + "learning_rate": 2.6051358392259027e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.4375, + "logps/chosen": -346.0, + "logps/rejected": -386.0, + "loss": 0.5179, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -1.53125, + "rewards/margins": 0.609375, + "rewards/rejected": -2.140625, + "step": 1400 + }, + { + "epoch": 0.05248366864566079, + "grad_norm": 7.925102827724738, + "learning_rate": 2.6237439523632303e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.296875, + "logps/chosen": -350.0, + "logps/rejected": -378.0, + "loss": 0.5349, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": -1.5078125, + "rewards/margins": 0.62109375, + "rewards/rejected": -2.125, + "step": 1410 + }, + { + "epoch": 0.05285589324598463, + "grad_norm": 5.562523376985507, + "learning_rate": 2.642352065500558e-07, + "logits/chosen": -3.390625, + "logits/rejected": -3.328125, + "logps/chosen": -330.0, + "logps/rejected": -378.0, + "loss": 0.5158, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -1.453125, + "rewards/margins": 0.73046875, + "rewards/rejected": -2.1875, + "step": 1420 + }, + { + "epoch": 0.05322811784630846, + "grad_norm": 6.273726179376068, + "learning_rate": 2.660960178637886e-07, + "logits/chosen": -3.296875, + "logits/rejected": -3.234375, + "logps/chosen": -348.0, + "logps/rejected": -382.0, + "loss": 0.5082, + "rewards/accuracies": 0.6937500238418579, + "rewards/chosen": -1.484375, + "rewards/margins": 0.65625, + "rewards/rejected": -2.140625, + "step": 1430 + }, + { + "epoch": 0.053600342446632296, + "grad_norm": 5.899521967641372, + "learning_rate": 2.679568291775214e-07, + "logits/chosen": -3.453125, + "logits/rejected": -3.1875, + "logps/chosen": -342.0, + "logps/rejected": -400.0, + "loss": 0.5071, + "rewards/accuracies": 0.75, + "rewards/chosen": -1.5703125, + "rewards/margins": 0.8125, + "rewards/rejected": -2.375, + "step": 1440 + }, + { + "epoch": 0.05397256704695613, + "grad_norm": 7.590023994842796, + "learning_rate": 2.6981764049125415e-07, + "logits/chosen": -3.359375, + "logits/rejected": -3.1875, + "logps/chosen": -338.0, + "logps/rejected": -404.0, + "loss": 0.502, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -1.5625, + "rewards/margins": 0.77734375, + "rewards/rejected": -2.34375, + "step": 1450 + }, + { + "epoch": 0.05434479164727997, + "grad_norm": 7.0787501168142075, + "learning_rate": 2.716784518049869e-07, + "logits/chosen": -3.265625, + "logits/rejected": -3.1875, + "logps/chosen": -368.0, + "logps/rejected": -404.0, + "loss": 0.5381, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -1.7421875, + "rewards/margins": 0.6015625, + "rewards/rejected": -2.34375, + "step": 1460 + }, + { + "epoch": 0.054717016247603806, + "grad_norm": 5.524203931396336, + "learning_rate": 2.735392631187198e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.296875, + "logps/chosen": -342.0, + "logps/rejected": -382.0, + "loss": 0.5106, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -1.4453125, + "rewards/margins": 0.70703125, + "rewards/rejected": -2.15625, + "step": 1470 + }, + { + "epoch": 0.05508924084792764, + "grad_norm": 6.607050954002419, + "learning_rate": 2.7540007443245256e-07, + "logits/chosen": -3.3125, + "logits/rejected": -3.1875, + "logps/chosen": -372.0, + "logps/rejected": -436.0, + "loss": 0.5041, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -1.7734375, + "rewards/margins": 0.765625, + "rewards/rejected": -2.546875, + "step": 1480 + }, + { + "epoch": 0.05546146544825147, + "grad_norm": 5.8497032295822144, + "learning_rate": 2.7726088574618533e-07, + "logits/chosen": -3.484375, + "logits/rejected": -3.265625, + "logps/chosen": -328.0, + "logps/rejected": -408.0, + "loss": 0.5119, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -1.609375, + "rewards/margins": 0.78125, + "rewards/rejected": -2.390625, + "step": 1490 + }, + { + "epoch": 0.05583369004857531, + "grad_norm": 6.730674517789158, + "learning_rate": 2.791216970599181e-07, + "logits/chosen": -3.5, + "logits/rejected": -3.296875, + "logps/chosen": -322.0, + "logps/rejected": -380.0, + "loss": 0.5142, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -1.4140625, + "rewards/margins": 0.83984375, + "rewards/rejected": -2.25, + "step": 1500 + }, + { + "epoch": 0.056205914648899145, + "grad_norm": 8.257861813501814, + "learning_rate": 2.809825083736509e-07, + "logits/chosen": -3.484375, + "logits/rejected": -3.234375, + "logps/chosen": -368.0, + "logps/rejected": -468.0, + "loss": 0.5097, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -1.84375, + "rewards/margins": 0.91015625, + "rewards/rejected": -2.75, + "step": 1510 + }, + { + "epoch": 0.05657813924922298, + "grad_norm": 5.752371300767705, + "learning_rate": 2.828433196873837e-07, + "logits/chosen": -3.4375, + "logits/rejected": -3.25, + "logps/chosen": -344.0, + "logps/rejected": -408.0, + "loss": 0.5177, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -1.609375, + "rewards/margins": 0.8046875, + "rewards/rejected": -2.40625, + "step": 1520 + }, + { + "epoch": 0.05695036384954682, + "grad_norm": 9.313332091007915, + "learning_rate": 2.8470413100111645e-07, + "logits/chosen": -3.296875, + "logits/rejected": -3.1875, + "logps/chosen": -334.0, + "logps/rejected": -406.0, + "loss": 0.5, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -1.53125, + "rewards/margins": 0.76171875, + "rewards/rejected": -2.28125, + "step": 1530 + }, + { + "epoch": 0.057322588449870655, + "grad_norm": 7.674209413267227, + "learning_rate": 2.865649423148492e-07, + "logits/chosen": -3.484375, + "logits/rejected": -3.296875, + "logps/chosen": -378.0, + "logps/rejected": -448.0, + "loss": 0.5129, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -1.9296875, + "rewards/margins": 0.703125, + "rewards/rejected": -2.625, + "step": 1540 + }, + { + "epoch": 0.057694813050194485, + "grad_norm": 5.42621251994026, + "learning_rate": 2.884257536285821e-07, + "logits/chosen": -3.390625, + "logits/rejected": -3.28125, + "logps/chosen": -346.0, + "logps/rejected": -400.0, + "loss": 0.5054, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -1.515625, + "rewards/margins": 0.91015625, + "rewards/rejected": -2.4375, + "step": 1550 + }, + { + "epoch": 0.05806703765051832, + "grad_norm": 5.398220335499412, + "learning_rate": 2.9028656494231485e-07, + "logits/chosen": -3.375, + "logits/rejected": -3.203125, + "logps/chosen": -344.0, + "logps/rejected": -408.0, + "loss": 0.5208, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -1.6796875, + "rewards/margins": 0.8359375, + "rewards/rejected": -2.515625, + "step": 1560 + }, + { + "epoch": 0.05843926225084216, + "grad_norm": 7.249550264624127, + "learning_rate": 2.921473762560476e-07, + "logits/chosen": -3.375, + "logits/rejected": -3.203125, + "logps/chosen": -346.0, + "logps/rejected": -414.0, + "loss": 0.5091, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -1.6953125, + "rewards/margins": 0.88671875, + "rewards/rejected": -2.578125, + "step": 1570 + }, + { + "epoch": 0.058811486851165995, + "grad_norm": 6.7555584084417175, + "learning_rate": 2.940081875697804e-07, + "logits/chosen": -3.3125, + "logits/rejected": -3.234375, + "logps/chosen": -408.0, + "logps/rejected": -450.0, + "loss": 0.504, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -1.9921875, + "rewards/margins": 0.7578125, + "rewards/rejected": -2.75, + "step": 1580 + }, + { + "epoch": 0.05918371145148983, + "grad_norm": 6.757377075014917, + "learning_rate": 2.958689988835132e-07, + "logits/chosen": -3.3125, + "logits/rejected": -3.203125, + "logps/chosen": -368.0, + "logps/rejected": -464.0, + "loss": 0.4881, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -1.84375, + "rewards/margins": 0.82421875, + "rewards/rejected": -2.671875, + "step": 1590 + }, + { + "epoch": 0.05955593605181366, + "grad_norm": 6.082845891238061, + "learning_rate": 2.97729810197246e-07, + "logits/chosen": -3.515625, + "logits/rejected": -3.21875, + "logps/chosen": -338.0, + "logps/rejected": -416.0, + "loss": 0.5036, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -1.765625, + "rewards/margins": 0.8828125, + "rewards/rejected": -2.65625, + "step": 1600 + }, + { + "epoch": 0.0599281606521375, + "grad_norm": 6.427557821854768, + "learning_rate": 2.9959062151097874e-07, + "logits/chosen": -3.390625, + "logits/rejected": -3.203125, + "logps/chosen": -360.0, + "logps/rejected": -436.0, + "loss": 0.4992, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -1.796875, + "rewards/margins": 0.84765625, + "rewards/rejected": -2.640625, + "step": 1610 + }, + { + "epoch": 0.060300385252461335, + "grad_norm": 6.3336369858688055, + "learning_rate": 3.0145143282471156e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.265625, + "logps/chosen": -356.0, + "logps/rejected": -430.0, + "loss": 0.5053, + "rewards/accuracies": 0.75, + "rewards/chosen": -1.6640625, + "rewards/margins": 0.77734375, + "rewards/rejected": -2.4375, + "step": 1620 + }, + { + "epoch": 0.06067260985278517, + "grad_norm": 6.53782796114545, + "learning_rate": 3.033122441384444e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.125, + "logps/chosen": -374.0, + "logps/rejected": -476.0, + "loss": 0.4971, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -2.078125, + "rewards/margins": 0.890625, + "rewards/rejected": -2.96875, + "step": 1630 + }, + { + "epoch": 0.06104483445310901, + "grad_norm": 5.872611276225177, + "learning_rate": 3.0517305545217715e-07, + "logits/chosen": -3.375, + "logits/rejected": -3.25, + "logps/chosen": -364.0, + "logps/rejected": -428.0, + "loss": 0.4923, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -1.8203125, + "rewards/margins": 0.86328125, + "rewards/rejected": -2.6875, + "step": 1640 + }, + { + "epoch": 0.061417059053432844, + "grad_norm": 5.485636557023713, + "learning_rate": 3.070338667659099e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.328125, + "logps/chosen": -390.0, + "logps/rejected": -446.0, + "loss": 0.5244, + "rewards/accuracies": 0.6625000238418579, + "rewards/chosen": -2.0, + "rewards/margins": 0.7578125, + "rewards/rejected": -2.765625, + "step": 1650 + }, + { + "epoch": 0.061789283653756674, + "grad_norm": 12.16446146603116, + "learning_rate": 3.088946780796427e-07, + "logits/chosen": -3.421875, + "logits/rejected": -3.234375, + "logps/chosen": -402.0, + "logps/rejected": -470.0, + "loss": 0.4816, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -2.09375, + "rewards/margins": 0.88671875, + "rewards/rejected": -2.984375, + "step": 1660 + }, + { + "epoch": 0.06216150825408051, + "grad_norm": 7.067013845513051, + "learning_rate": 3.107554893933755e-07, + "logits/chosen": -3.3125, + "logits/rejected": -3.1875, + "logps/chosen": -394.0, + "logps/rejected": -450.0, + "loss": 0.5243, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -1.9375, + "rewards/margins": 0.890625, + "rewards/rejected": -2.828125, + "step": 1670 + }, + { + "epoch": 0.06253373285440435, + "grad_norm": 5.530567691349678, + "learning_rate": 3.1261630070710827e-07, + "logits/chosen": -3.28125, + "logits/rejected": -3.1875, + "logps/chosen": -386.0, + "logps/rejected": -428.0, + "loss": 0.5085, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -1.90625, + "rewards/margins": 0.6875, + "rewards/rejected": -2.59375, + "step": 1680 + }, + { + "epoch": 0.06290595745472818, + "grad_norm": 7.007034753902651, + "learning_rate": 3.144771120208411e-07, + "logits/chosen": -3.3125, + "logits/rejected": -3.21875, + "logps/chosen": -384.0, + "logps/rejected": -450.0, + "loss": 0.4898, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -1.875, + "rewards/margins": 0.98046875, + "rewards/rejected": -2.859375, + "step": 1690 + }, + { + "epoch": 0.06327818205505202, + "grad_norm": 5.9945544048762835, + "learning_rate": 3.1633792333457385e-07, + "logits/chosen": -3.34375, + "logits/rejected": -3.28125, + "logps/chosen": -382.0, + "logps/rejected": -464.0, + "loss": 0.4971, + "rewards/accuracies": 0.75, + "rewards/chosen": -1.953125, + "rewards/margins": 0.9375, + "rewards/rejected": -2.890625, + "step": 1700 + }, + { + "epoch": 0.06365040665537586, + "grad_norm": 7.539162609616699, + "learning_rate": 3.181987346483067e-07, + "logits/chosen": -3.5, + "logits/rejected": -3.3125, + "logps/chosen": -406.0, + "logps/rejected": -468.0, + "loss": 0.5071, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -2.203125, + "rewards/margins": 0.80078125, + "rewards/rejected": -3.0, + "step": 1710 + }, + { + "epoch": 0.0640226312556997, + "grad_norm": 6.758590827074712, + "learning_rate": 3.2005954596203944e-07, + "logits/chosen": -3.390625, + "logits/rejected": -3.234375, + "logps/chosen": -398.0, + "logps/rejected": -472.0, + "loss": 0.4796, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -2.25, + "rewards/margins": 0.84765625, + "rewards/rejected": -3.09375, + "step": 1720 + }, + { + "epoch": 0.06439485585602353, + "grad_norm": 6.7152082532075115, + "learning_rate": 3.219203572757722e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.21875, + "logps/chosen": -364.0, + "logps/rejected": -434.0, + "loss": 0.511, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -1.9296875, + "rewards/margins": 0.82421875, + "rewards/rejected": -2.75, + "step": 1730 + }, + { + "epoch": 0.06476708045634735, + "grad_norm": 5.736720629813318, + "learning_rate": 3.23781168589505e-07, + "logits/chosen": -3.484375, + "logits/rejected": -3.28125, + "logps/chosen": -364.0, + "logps/rejected": -442.0, + "loss": 0.4983, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -1.7890625, + "rewards/margins": 0.9609375, + "rewards/rejected": -2.75, + "step": 1740 + }, + { + "epoch": 0.06513930505667119, + "grad_norm": 6.211718793245078, + "learning_rate": 3.256419799032378e-07, + "logits/chosen": -3.40625, + "logits/rejected": -3.265625, + "logps/chosen": -358.0, + "logps/rejected": -406.0, + "loss": 0.5174, + "rewards/accuracies": 0.6937500238418579, + "rewards/chosen": -1.6640625, + "rewards/margins": 0.6640625, + "rewards/rejected": -2.328125, + "step": 1750 + }, + { + "epoch": 0.06551152965699503, + "grad_norm": 5.632562755835517, + "learning_rate": 3.275027912169706e-07, + "logits/chosen": -3.375, + "logits/rejected": -3.265625, + "logps/chosen": -412.0, + "logps/rejected": -486.0, + "loss": 0.4903, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -2.015625, + "rewards/margins": 0.87109375, + "rewards/rejected": -2.890625, + "step": 1760 + }, + { + "epoch": 0.06588375425731886, + "grad_norm": 5.578480380124134, + "learning_rate": 3.293636025307034e-07, + "logits/chosen": -3.453125, + "logits/rejected": -3.359375, + "logps/chosen": -426.0, + "logps/rejected": -496.0, + "loss": 0.4979, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -2.328125, + "rewards/margins": 0.91015625, + "rewards/rejected": -3.25, + "step": 1770 + }, + { + "epoch": 0.0662559788576427, + "grad_norm": 6.8437171680878714, + "learning_rate": 3.3122441384443615e-07, + "logits/chosen": -3.484375, + "logits/rejected": -3.328125, + "logps/chosen": -368.0, + "logps/rejected": -428.0, + "loss": 0.5024, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -1.8046875, + "rewards/margins": 0.875, + "rewards/rejected": -2.671875, + "step": 1780 + }, + { + "epoch": 0.06662820345796654, + "grad_norm": 6.0818060385390265, + "learning_rate": 3.3308522515816897e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.359375, + "logps/chosen": -380.0, + "logps/rejected": -448.0, + "loss": 0.4947, + "rewards/accuracies": 0.75, + "rewards/chosen": -1.9765625, + "rewards/margins": 0.8828125, + "rewards/rejected": -2.859375, + "step": 1790 + }, + { + "epoch": 0.06700042805829037, + "grad_norm": 9.832087595188957, + "learning_rate": 3.3494603647190173e-07, + "logits/chosen": -3.59375, + "logits/rejected": -3.40625, + "logps/chosen": -454.0, + "logps/rejected": -516.0, + "loss": 0.5041, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -2.5625, + "rewards/margins": 0.890625, + "rewards/rejected": -3.453125, + "step": 1800 + }, + { + "epoch": 0.06737265265861421, + "grad_norm": 6.901409024521085, + "learning_rate": 3.368068477856345e-07, + "logits/chosen": -3.46875, + "logits/rejected": -3.328125, + "logps/chosen": -416.0, + "logps/rejected": -480.0, + "loss": 0.4787, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -2.421875, + "rewards/margins": 0.8203125, + "rewards/rejected": -3.234375, + "step": 1810 + }, + { + "epoch": 0.06774487725893805, + "grad_norm": 7.4474348220804485, + "learning_rate": 3.3866765909936727e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.53125, + "logps/chosen": -396.0, + "logps/rejected": -460.0, + "loss": 0.4891, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -1.9296875, + "rewards/margins": 1.0078125, + "rewards/rejected": -2.9375, + "step": 1820 + }, + { + "epoch": 0.06811710185926188, + "grad_norm": 6.50288727444381, + "learning_rate": 3.4052847041310014e-07, + "logits/chosen": -3.46875, + "logits/rejected": -3.1875, + "logps/chosen": -386.0, + "logps/rejected": -466.0, + "loss": 0.4927, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -2.171875, + "rewards/margins": 0.921875, + "rewards/rejected": -3.09375, + "step": 1830 + }, + { + "epoch": 0.06848932645958572, + "grad_norm": 7.608497450368566, + "learning_rate": 3.423892817268329e-07, + "logits/chosen": -3.5, + "logits/rejected": -3.234375, + "logps/chosen": -416.0, + "logps/rejected": -494.0, + "loss": 0.4963, + "rewards/accuracies": 0.71875, + "rewards/chosen": -2.125, + "rewards/margins": 0.98828125, + "rewards/rejected": -3.125, + "step": 1840 + }, + { + "epoch": 0.06886155105990954, + "grad_norm": 10.258817701612603, + "learning_rate": 3.442500930405657e-07, + "logits/chosen": -3.578125, + "logits/rejected": -3.46875, + "logps/chosen": -434.0, + "logps/rejected": -502.0, + "loss": 0.4814, + "rewards/accuracies": 0.71875, + "rewards/chosen": -2.40625, + "rewards/margins": 0.91015625, + "rewards/rejected": -3.3125, + "step": 1850 + }, + { + "epoch": 0.06923377566023338, + "grad_norm": 6.196807090101503, + "learning_rate": 3.4611090435429844e-07, + "logits/chosen": -3.453125, + "logits/rejected": -3.421875, + "logps/chosen": -422.0, + "logps/rejected": -492.0, + "loss": 0.4911, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -2.25, + "rewards/margins": 0.89453125, + "rewards/rejected": -3.140625, + "step": 1860 + }, + { + "epoch": 0.06960600026055722, + "grad_norm": 7.770073521207905, + "learning_rate": 3.4797171566803126e-07, + "logits/chosen": -3.375, + "logits/rejected": -3.28125, + "logps/chosen": -416.0, + "logps/rejected": -476.0, + "loss": 0.4657, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -2.1875, + "rewards/margins": 0.8671875, + "rewards/rejected": -3.046875, + "step": 1870 + }, + { + "epoch": 0.06997822486088105, + "grad_norm": 11.94458655741529, + "learning_rate": 3.4983252698176403e-07, + "logits/chosen": -3.421875, + "logits/rejected": -3.109375, + "logps/chosen": -454.0, + "logps/rejected": -520.0, + "loss": 0.5099, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -2.640625, + "rewards/margins": 0.8984375, + "rewards/rejected": -3.53125, + "step": 1880 + }, + { + "epoch": 0.07035044946120489, + "grad_norm": 8.647210574831504, + "learning_rate": 3.516933382954968e-07, + "logits/chosen": -3.453125, + "logits/rejected": -3.421875, + "logps/chosen": -408.0, + "logps/rejected": -486.0, + "loss": 0.4792, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -2.171875, + "rewards/margins": 0.9140625, + "rewards/rejected": -3.09375, + "step": 1890 + }, + { + "epoch": 0.07072267406152873, + "grad_norm": 8.253805566712586, + "learning_rate": 3.535541496092296e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.5, + "logps/chosen": -482.0, + "logps/rejected": -548.0, + "loss": 0.4916, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -2.8125, + "rewards/margins": 0.89453125, + "rewards/rejected": -3.703125, + "step": 1900 + }, + { + "epoch": 0.07109489866185256, + "grad_norm": 6.8734464309524475, + "learning_rate": 3.5541496092296243e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.53125, + "logps/chosen": -454.0, + "logps/rejected": -544.0, + "loss": 0.4968, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -2.65625, + "rewards/margins": 0.94921875, + "rewards/rejected": -3.609375, + "step": 1910 + }, + { + "epoch": 0.0714671232621764, + "grad_norm": 6.19491556402742, + "learning_rate": 3.572757722366952e-07, + "logits/chosen": -3.625, + "logits/rejected": -3.46875, + "logps/chosen": -392.0, + "logps/rejected": -462.0, + "loss": 0.5004, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -2.265625, + "rewards/margins": 0.75390625, + "rewards/rejected": -3.015625, + "step": 1920 + }, + { + "epoch": 0.07183934786250024, + "grad_norm": 7.196402223453586, + "learning_rate": 3.5913658355042797e-07, + "logits/chosen": -3.578125, + "logits/rejected": -3.390625, + "logps/chosen": -436.0, + "logps/rejected": -498.0, + "loss": 0.5028, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -2.53125, + "rewards/margins": 0.7265625, + "rewards/rejected": -3.265625, + "step": 1930 + }, + { + "epoch": 0.07221157246282407, + "grad_norm": 8.42899046845527, + "learning_rate": 3.6099739486416073e-07, + "logits/chosen": -3.453125, + "logits/rejected": -3.3125, + "logps/chosen": -490.0, + "logps/rejected": -548.0, + "loss": 0.5011, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -2.875, + "rewards/margins": 0.85546875, + "rewards/rejected": -3.734375, + "step": 1940 + }, + { + "epoch": 0.07258379706314791, + "grad_norm": 5.646083907129506, + "learning_rate": 3.6285820617789355e-07, + "logits/chosen": -3.421875, + "logits/rejected": -3.234375, + "logps/chosen": -432.0, + "logps/rejected": -496.0, + "loss": 0.5065, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -2.390625, + "rewards/margins": 0.8359375, + "rewards/rejected": -3.21875, + "step": 1950 + }, + { + "epoch": 0.07295602166347175, + "grad_norm": 7.9137815262402516, + "learning_rate": 3.647190174916263e-07, + "logits/chosen": -3.46875, + "logits/rejected": -3.46875, + "logps/chosen": -426.0, + "logps/rejected": -498.0, + "loss": 0.5025, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -2.28125, + "rewards/margins": 0.76171875, + "rewards/rejected": -3.046875, + "step": 1960 + }, + { + "epoch": 0.07332824626379557, + "grad_norm": 7.919156114148352, + "learning_rate": 3.665798288053591e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.375, + "logps/chosen": -416.0, + "logps/rejected": -478.0, + "loss": 0.4789, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -2.46875, + "rewards/margins": 0.91796875, + "rewards/rejected": -3.375, + "step": 1970 + }, + { + "epoch": 0.0737004708641194, + "grad_norm": 6.235589300184533, + "learning_rate": 3.684406401190919e-07, + "logits/chosen": -3.515625, + "logits/rejected": -3.4375, + "logps/chosen": -406.0, + "logps/rejected": -474.0, + "loss": 0.516, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -2.21875, + "rewards/margins": 0.8359375, + "rewards/rejected": -3.0625, + "step": 1980 + }, + { + "epoch": 0.07407269546444324, + "grad_norm": 7.351757597986148, + "learning_rate": 3.7030145143282473e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.4375, + "logps/chosen": -432.0, + "logps/rejected": -508.0, + "loss": 0.4791, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -2.5625, + "rewards/margins": 0.94921875, + "rewards/rejected": -3.515625, + "step": 1990 + }, + { + "epoch": 0.07444492006476708, + "grad_norm": 6.655521716946184, + "learning_rate": 3.721622627465575e-07, + "logits/chosen": -3.46875, + "logits/rejected": -3.390625, + "logps/chosen": -476.0, + "logps/rejected": -552.0, + "loss": 0.4716, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -2.734375, + "rewards/margins": 0.99609375, + "rewards/rejected": -3.734375, + "step": 2000 + }, + { + "epoch": 0.07481714466509091, + "grad_norm": 7.419440727048614, + "learning_rate": 3.7402307406029026e-07, + "logits/chosen": -3.46875, + "logits/rejected": -3.28125, + "logps/chosen": -408.0, + "logps/rejected": -470.0, + "loss": 0.5067, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -2.3125, + "rewards/margins": 0.87890625, + "rewards/rejected": -3.1875, + "step": 2010 + }, + { + "epoch": 0.07518936926541475, + "grad_norm": 6.808603030463394, + "learning_rate": 3.7588388537402303e-07, + "logits/chosen": -3.515625, + "logits/rejected": -3.34375, + "logps/chosen": -406.0, + "logps/rejected": -468.0, + "loss": 0.4797, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -2.21875, + "rewards/margins": 0.97265625, + "rewards/rejected": -3.1875, + "step": 2020 + }, + { + "epoch": 0.07556159386573859, + "grad_norm": 9.804937954471944, + "learning_rate": 3.7774469668775585e-07, + "logits/chosen": -3.484375, + "logits/rejected": -3.3125, + "logps/chosen": -434.0, + "logps/rejected": -500.0, + "loss": 0.483, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -2.75, + "rewards/margins": 0.92578125, + "rewards/rejected": -3.6875, + "step": 2030 + }, + { + "epoch": 0.07593381846606242, + "grad_norm": 7.011321899662242, + "learning_rate": 3.796055080014886e-07, + "logits/chosen": -3.46875, + "logits/rejected": -3.515625, + "logps/chosen": -456.0, + "logps/rejected": -524.0, + "loss": 0.4951, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -2.71875, + "rewards/margins": 0.83984375, + "rewards/rejected": -3.546875, + "step": 2040 + }, + { + "epoch": 0.07630604306638626, + "grad_norm": 8.34674921558812, + "learning_rate": 3.8146631931522143e-07, + "logits/chosen": -3.453125, + "logits/rejected": -3.375, + "logps/chosen": -454.0, + "logps/rejected": -552.0, + "loss": 0.4668, + "rewards/accuracies": 0.78125, + "rewards/chosen": -2.71875, + "rewards/margins": 1.15625, + "rewards/rejected": -3.875, + "step": 2050 + }, + { + "epoch": 0.0766782676667101, + "grad_norm": 7.914453901846385, + "learning_rate": 3.833271306289542e-07, + "logits/chosen": -3.5, + "logits/rejected": -3.328125, + "logps/chosen": -450.0, + "logps/rejected": -540.0, + "loss": 0.4623, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -2.859375, + "rewards/margins": 1.109375, + "rewards/rejected": -3.953125, + "step": 2060 + }, + { + "epoch": 0.07705049226703393, + "grad_norm": 8.048084008154206, + "learning_rate": 3.85187941942687e-07, + "logits/chosen": -3.515625, + "logits/rejected": -3.3125, + "logps/chosen": -472.0, + "logps/rejected": -556.0, + "loss": 0.4928, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -2.625, + "rewards/margins": 0.99609375, + "rewards/rejected": -3.625, + "step": 2070 + }, + { + "epoch": 0.07742271686735776, + "grad_norm": 7.206841484214931, + "learning_rate": 3.870487532564198e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.515625, + "logps/chosen": -462.0, + "logps/rejected": -536.0, + "loss": 0.4883, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -2.796875, + "rewards/margins": 0.890625, + "rewards/rejected": -3.6875, + "step": 2080 + }, + { + "epoch": 0.0777949414676816, + "grad_norm": 6.3124275295264685, + "learning_rate": 3.8890956457015255e-07, + "logits/chosen": -3.640625, + "logits/rejected": -3.453125, + "logps/chosen": -430.0, + "logps/rejected": -516.0, + "loss": 0.4787, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -2.625, + "rewards/margins": 0.796875, + "rewards/rejected": -3.421875, + "step": 2090 + }, + { + "epoch": 0.07816716606800543, + "grad_norm": 6.387969253344187, + "learning_rate": 3.907703758838853e-07, + "logits/chosen": -3.484375, + "logits/rejected": -3.484375, + "logps/chosen": -484.0, + "logps/rejected": -568.0, + "loss": 0.4716, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -2.875, + "rewards/margins": 1.1015625, + "rewards/rejected": -3.96875, + "step": 2100 + }, + { + "epoch": 0.07853939066832927, + "grad_norm": 7.3661811834257085, + "learning_rate": 3.9263118719761814e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.4375, + "logps/chosen": -466.0, + "logps/rejected": -572.0, + "loss": 0.4716, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -2.828125, + "rewards/margins": 1.109375, + "rewards/rejected": -3.9375, + "step": 2110 + }, + { + "epoch": 0.0789116152686531, + "grad_norm": 7.830049539836104, + "learning_rate": 3.9449199851135096e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.390625, + "logps/chosen": -476.0, + "logps/rejected": -544.0, + "loss": 0.4993, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -3.03125, + "rewards/margins": 0.8984375, + "rewards/rejected": -3.9375, + "step": 2120 + }, + { + "epoch": 0.07928383986897694, + "grad_norm": 7.433179362073206, + "learning_rate": 3.9635280982508373e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.46875, + "logps/chosen": -440.0, + "logps/rejected": -512.0, + "loss": 0.4601, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -2.609375, + "rewards/margins": 0.92578125, + "rewards/rejected": -3.53125, + "step": 2130 + }, + { + "epoch": 0.07965606446930078, + "grad_norm": 7.361658833026729, + "learning_rate": 3.982136211388165e-07, + "logits/chosen": -3.546875, + "logits/rejected": -3.453125, + "logps/chosen": -488.0, + "logps/rejected": -568.0, + "loss": 0.4654, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -2.953125, + "rewards/margins": 1.078125, + "rewards/rejected": -4.03125, + "step": 2140 + }, + { + "epoch": 0.08002828906962461, + "grad_norm": 6.64152297996465, + "learning_rate": 4.000744324525493e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.359375, + "logps/chosen": -462.0, + "logps/rejected": -564.0, + "loss": 0.483, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -2.8125, + "rewards/margins": 1.0859375, + "rewards/rejected": -3.90625, + "step": 2150 + }, + { + "epoch": 0.08040051366994845, + "grad_norm": 8.565985887881476, + "learning_rate": 4.019352437662821e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.5, + "logps/chosen": -448.0, + "logps/rejected": -512.0, + "loss": 0.4672, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -2.5625, + "rewards/margins": 0.84765625, + "rewards/rejected": -3.421875, + "step": 2160 + }, + { + "epoch": 0.08077273827027229, + "grad_norm": 8.502570785022007, + "learning_rate": 4.0379605508001485e-07, + "logits/chosen": -3.59375, + "logits/rejected": -3.421875, + "logps/chosen": -500.0, + "logps/rejected": -592.0, + "loss": 0.4865, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.015625, + "rewards/margins": 1.1484375, + "rewards/rejected": -4.15625, + "step": 2170 + }, + { + "epoch": 0.08114496287059612, + "grad_norm": 6.182879652012646, + "learning_rate": 4.056568663937476e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.265625, + "logps/chosen": -506.0, + "logps/rejected": -596.0, + "loss": 0.4739, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -3.1875, + "rewards/margins": 1.1171875, + "rewards/rejected": -4.3125, + "step": 2180 + }, + { + "epoch": 0.08151718747091995, + "grad_norm": 7.010299440446747, + "learning_rate": 4.075176777074805e-07, + "logits/chosen": -3.46875, + "logits/rejected": -3.515625, + "logps/chosen": -464.0, + "logps/rejected": -528.0, + "loss": 0.4802, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -2.546875, + "rewards/margins": 0.9921875, + "rewards/rejected": -3.546875, + "step": 2190 + }, + { + "epoch": 0.08188941207124378, + "grad_norm": 5.568537062184612, + "learning_rate": 4.0937848902121325e-07, + "logits/chosen": -3.578125, + "logits/rejected": -3.484375, + "logps/chosen": -512.0, + "logps/rejected": -580.0, + "loss": 0.481, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.328125, + "rewards/margins": 0.87109375, + "rewards/rejected": -4.1875, + "step": 2200 + }, + { + "epoch": 0.08226163667156762, + "grad_norm": 6.448164831889189, + "learning_rate": 4.11239300334946e-07, + "logits/chosen": -3.578125, + "logits/rejected": -3.421875, + "logps/chosen": -498.0, + "logps/rejected": -544.0, + "loss": 0.4887, + "rewards/accuracies": 0.6812499761581421, + "rewards/chosen": -3.140625, + "rewards/margins": 0.7578125, + "rewards/rejected": -3.890625, + "step": 2210 + }, + { + "epoch": 0.08263386127189146, + "grad_norm": 7.624705951730895, + "learning_rate": 4.131001116486788e-07, + "logits/chosen": -3.546875, + "logits/rejected": -3.5, + "logps/chosen": -502.0, + "logps/rejected": -572.0, + "loss": 0.4671, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -3.109375, + "rewards/margins": 0.90234375, + "rewards/rejected": -4.0, + "step": 2220 + }, + { + "epoch": 0.0830060858722153, + "grad_norm": 6.666954742432476, + "learning_rate": 4.149609229624116e-07, + "logits/chosen": -3.5, + "logits/rejected": -3.375, + "logps/chosen": -500.0, + "logps/rejected": -568.0, + "loss": 0.4793, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -3.0625, + "rewards/margins": 1.0, + "rewards/rejected": -4.0625, + "step": 2230 + }, + { + "epoch": 0.08337831047253913, + "grad_norm": 6.33594374057711, + "learning_rate": 4.168217342761444e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.421875, + "logps/chosen": -488.0, + "logps/rejected": -560.0, + "loss": 0.4747, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -2.96875, + "rewards/margins": 1.0546875, + "rewards/rejected": -4.03125, + "step": 2240 + }, + { + "epoch": 0.08375053507286297, + "grad_norm": 8.464776874422762, + "learning_rate": 4.1868254558987714e-07, + "logits/chosen": -3.484375, + "logits/rejected": -3.3125, + "logps/chosen": -482.0, + "logps/rejected": -540.0, + "loss": 0.4782, + "rewards/accuracies": 0.6875, + "rewards/chosen": -2.984375, + "rewards/margins": 0.84765625, + "rewards/rejected": -3.828125, + "step": 2250 + }, + { + "epoch": 0.0841227596731868, + "grad_norm": 9.029855119041432, + "learning_rate": 4.2054335690360996e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.6875, + "logps/chosen": -466.0, + "logps/rejected": -568.0, + "loss": 0.4776, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -2.875, + "rewards/margins": 1.03125, + "rewards/rejected": -3.90625, + "step": 2260 + }, + { + "epoch": 0.08449498427351064, + "grad_norm": 8.879201240189081, + "learning_rate": 4.224041682173428e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.671875, + "logps/chosen": -500.0, + "logps/rejected": -600.0, + "loss": 0.4986, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -3.1875, + "rewards/margins": 0.8671875, + "rewards/rejected": -4.0625, + "step": 2270 + }, + { + "epoch": 0.08486720887383448, + "grad_norm": 5.848587871383628, + "learning_rate": 4.2426497953107555e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.671875, + "logps/chosen": -520.0, + "logps/rejected": -600.0, + "loss": 0.469, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -3.296875, + "rewards/margins": 0.9375, + "rewards/rejected": -4.25, + "step": 2280 + }, + { + "epoch": 0.08523943347415831, + "grad_norm": 6.176726638784167, + "learning_rate": 4.261257908448083e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.6875, + "logps/chosen": -520.0, + "logps/rejected": -600.0, + "loss": 0.4936, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -3.15625, + "rewards/margins": 1.0390625, + "rewards/rejected": -4.1875, + "step": 2290 + }, + { + "epoch": 0.08561165807448214, + "grad_norm": 5.633776596904817, + "learning_rate": 4.279866021585411e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.53125, + "logps/chosen": -494.0, + "logps/rejected": -564.0, + "loss": 0.4794, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -3.015625, + "rewards/margins": 0.9375, + "rewards/rejected": -3.953125, + "step": 2300 + }, + { + "epoch": 0.08598388267480597, + "grad_norm": 5.987960772140025, + "learning_rate": 4.298474134722739e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.59375, + "logps/chosen": -532.0, + "logps/rejected": -648.0, + "loss": 0.4429, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -3.390625, + "rewards/margins": 1.2734375, + "rewards/rejected": -4.65625, + "step": 2310 + }, + { + "epoch": 0.08635610727512981, + "grad_norm": 7.931597077248074, + "learning_rate": 4.3170822478600667e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.515625, + "logps/chosen": -516.0, + "logps/rejected": -600.0, + "loss": 0.473, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -3.234375, + "rewards/margins": 1.015625, + "rewards/rejected": -4.25, + "step": 2320 + }, + { + "epoch": 0.08672833187545365, + "grad_norm": 7.0217336118545965, + "learning_rate": 4.335690360997395e-07, + "logits/chosen": -3.625, + "logits/rejected": -3.375, + "logps/chosen": -510.0, + "logps/rejected": -596.0, + "loss": 0.4552, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -3.203125, + "rewards/margins": 1.109375, + "rewards/rejected": -4.3125, + "step": 2330 + }, + { + "epoch": 0.08710055647577748, + "grad_norm": 8.915164945587248, + "learning_rate": 4.3542984741347225e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.5, + "logps/chosen": -544.0, + "logps/rejected": -636.0, + "loss": 0.4716, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -3.53125, + "rewards/margins": 1.078125, + "rewards/rejected": -4.625, + "step": 2340 + }, + { + "epoch": 0.08747278107610132, + "grad_norm": 6.606079796847748, + "learning_rate": 4.372906587272051e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.453125, + "logps/chosen": -536.0, + "logps/rejected": -616.0, + "loss": 0.4759, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.53125, + "rewards/margins": 1.0859375, + "rewards/rejected": -4.625, + "step": 2350 + }, + { + "epoch": 0.08784500567642516, + "grad_norm": 6.840756149949872, + "learning_rate": 4.3915147004093784e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.5, + "logps/chosen": -520.0, + "logps/rejected": -576.0, + "loss": 0.4554, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -3.4375, + "rewards/margins": 0.83203125, + "rewards/rejected": -4.28125, + "step": 2360 + }, + { + "epoch": 0.08821723027674899, + "grad_norm": 7.607432047893891, + "learning_rate": 4.410122813546706e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.53125, + "logps/chosen": -488.0, + "logps/rejected": -544.0, + "loss": 0.4844, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -3.015625, + "rewards/margins": 1.0, + "rewards/rejected": -4.0, + "step": 2370 + }, + { + "epoch": 0.08858945487707283, + "grad_norm": 7.177824030903555, + "learning_rate": 4.428730926684034e-07, + "logits/chosen": -3.53125, + "logits/rejected": -3.484375, + "logps/chosen": -520.0, + "logps/rejected": -576.0, + "loss": 0.5042, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -3.15625, + "rewards/margins": 0.89453125, + "rewards/rejected": -4.0625, + "step": 2380 + }, + { + "epoch": 0.08896167947739667, + "grad_norm": 5.609842370446836, + "learning_rate": 4.447339039821362e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.484375, + "logps/chosen": -544.0, + "logps/rejected": -636.0, + "loss": 0.457, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -3.484375, + "rewards/margins": 1.1796875, + "rewards/rejected": -4.65625, + "step": 2390 + }, + { + "epoch": 0.0893339040777205, + "grad_norm": 6.631650078365204, + "learning_rate": 4.4659471529586896e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.53125, + "logps/chosen": -474.0, + "logps/rejected": -592.0, + "loss": 0.4793, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -2.859375, + "rewards/margins": 1.140625, + "rewards/rejected": -4.0, + "step": 2400 + }, + { + "epoch": 0.08970612867804433, + "grad_norm": 8.43491277629513, + "learning_rate": 4.484555266096018e-07, + "logits/chosen": -3.59375, + "logits/rejected": -3.453125, + "logps/chosen": -492.0, + "logps/rejected": -596.0, + "loss": 0.4743, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -3.34375, + "rewards/margins": 1.1875, + "rewards/rejected": -4.53125, + "step": 2410 + }, + { + "epoch": 0.09007835327836816, + "grad_norm": 5.688239496996797, + "learning_rate": 4.5031633792333455e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -548.0, + "logps/rejected": -624.0, + "loss": 0.4846, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -3.578125, + "rewards/margins": 1.078125, + "rewards/rejected": -4.65625, + "step": 2420 + }, + { + "epoch": 0.090450577878692, + "grad_norm": 6.594113719906323, + "learning_rate": 4.5217714923706737e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.546875, + "logps/chosen": -494.0, + "logps/rejected": -604.0, + "loss": 0.4645, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -3.1875, + "rewards/margins": 1.25, + "rewards/rejected": -4.4375, + "step": 2430 + }, + { + "epoch": 0.09082280247901584, + "grad_norm": 6.726664773853839, + "learning_rate": 4.5403796055080013e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.6875, + "logps/chosen": -540.0, + "logps/rejected": -616.0, + "loss": 0.4543, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -3.28125, + "rewards/margins": 1.125, + "rewards/rejected": -4.40625, + "step": 2440 + }, + { + "epoch": 0.09119502707933967, + "grad_norm": 6.929343667676475, + "learning_rate": 4.558987718645329e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.453125, + "logps/chosen": -496.0, + "logps/rejected": -588.0, + "loss": 0.4583, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.265625, + "rewards/margins": 1.0546875, + "rewards/rejected": -4.3125, + "step": 2450 + }, + { + "epoch": 0.09156725167966351, + "grad_norm": 7.3622656961718835, + "learning_rate": 4.5775958317826567e-07, + "logits/chosen": -3.546875, + "logits/rejected": -3.5, + "logps/chosen": -552.0, + "logps/rejected": -604.0, + "loss": 0.4814, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.40625, + "rewards/margins": 0.91796875, + "rewards/rejected": -4.34375, + "step": 2460 + }, + { + "epoch": 0.09193947627998734, + "grad_norm": 6.779558467695923, + "learning_rate": 4.596203944919985e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5, + "logps/chosen": -568.0, + "logps/rejected": -660.0, + "loss": 0.4841, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -3.796875, + "rewards/margins": 0.9765625, + "rewards/rejected": -4.78125, + "step": 2470 + }, + { + "epoch": 0.09231170088031118, + "grad_norm": 6.182721945798014, + "learning_rate": 4.614812058057313e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.78125, + "logps/chosen": -548.0, + "logps/rejected": -600.0, + "loss": 0.4639, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -3.46875, + "rewards/margins": 0.890625, + "rewards/rejected": -4.375, + "step": 2480 + }, + { + "epoch": 0.09268392548063502, + "grad_norm": 5.874758959805965, + "learning_rate": 4.633420171194641e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.75, + "logps/chosen": -524.0, + "logps/rejected": -612.0, + "loss": 0.4943, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -3.296875, + "rewards/margins": 0.91796875, + "rewards/rejected": -4.21875, + "step": 2490 + }, + { + "epoch": 0.09305615008095885, + "grad_norm": 6.2020847366471985, + "learning_rate": 4.6520282843319684e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -532.0, + "logps/rejected": -616.0, + "loss": 0.4914, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -3.53125, + "rewards/margins": 0.93359375, + "rewards/rejected": -4.46875, + "step": 2500 + }, + { + "epoch": 0.09342837468128269, + "grad_norm": 7.270644951317942, + "learning_rate": 4.6706363974692966e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -552.0, + "logps/rejected": -620.0, + "loss": 0.4998, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.765625, + "rewards/margins": 0.97265625, + "rewards/rejected": -4.75, + "step": 2510 + }, + { + "epoch": 0.09380059928160653, + "grad_norm": 7.181528411096263, + "learning_rate": 4.6892445106066243e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.78125, + "logps/chosen": -544.0, + "logps/rejected": -616.0, + "loss": 0.4715, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -3.4375, + "rewards/margins": 0.921875, + "rewards/rejected": -4.375, + "step": 2520 + }, + { + "epoch": 0.09417282388193035, + "grad_norm": 5.13615265178157, + "learning_rate": 4.707852623743952e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.8125, + "logps/chosen": -592.0, + "logps/rejected": -664.0, + "loss": 0.4942, + "rewards/accuracies": 0.71875, + "rewards/chosen": -3.96875, + "rewards/margins": 1.0234375, + "rewards/rejected": -5.0, + "step": 2530 + }, + { + "epoch": 0.09454504848225419, + "grad_norm": 6.338054075847786, + "learning_rate": 4.7264607368812796e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -536.0, + "logps/rejected": -640.0, + "loss": 0.4802, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.53125, + "rewards/margins": 1.015625, + "rewards/rejected": -4.5625, + "step": 2540 + }, + { + "epoch": 0.09491727308257802, + "grad_norm": 7.379950985938358, + "learning_rate": 4.7450688500186083e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -584.0, + "logps/rejected": -660.0, + "loss": 0.4457, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -3.921875, + "rewards/margins": 0.97265625, + "rewards/rejected": -4.90625, + "step": 2550 + }, + { + "epoch": 0.09528949768290186, + "grad_norm": 7.680201919892533, + "learning_rate": 4.763676963155936e-07, + "logits/chosen": -3.59375, + "logits/rejected": -3.53125, + "logps/chosen": -596.0, + "logps/rejected": -700.0, + "loss": 0.4737, + "rewards/accuracies": 0.78125, + "rewards/chosen": -4.09375, + "rewards/margins": 1.171875, + "rewards/rejected": -5.28125, + "step": 2560 + }, + { + "epoch": 0.0956617222832257, + "grad_norm": 8.454700735292763, + "learning_rate": 4.782285076293264e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -502.0, + "logps/rejected": -600.0, + "loss": 0.4657, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -3.203125, + "rewards/margins": 1.1171875, + "rewards/rejected": -4.3125, + "step": 2570 + }, + { + "epoch": 0.09603394688354953, + "grad_norm": 6.450134469200251, + "learning_rate": 4.800893189430591e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.640625, + "logps/chosen": -556.0, + "logps/rejected": -648.0, + "loss": 0.4571, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -3.71875, + "rewards/margins": 1.1015625, + "rewards/rejected": -4.8125, + "step": 2580 + }, + { + "epoch": 0.09640617148387337, + "grad_norm": 5.940209728125408, + "learning_rate": 4.81950130256792e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.75, + "logps/chosen": -544.0, + "logps/rejected": -648.0, + "loss": 0.4613, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.625, + "rewards/margins": 1.2265625, + "rewards/rejected": -4.875, + "step": 2590 + }, + { + "epoch": 0.09677839608419721, + "grad_norm": 6.090480682330815, + "learning_rate": 4.838109415705247e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.640625, + "logps/chosen": -528.0, + "logps/rejected": -608.0, + "loss": 0.4671, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -3.515625, + "rewards/margins": 0.921875, + "rewards/rejected": -4.4375, + "step": 2600 + }, + { + "epoch": 0.09715062068452104, + "grad_norm": 8.432048453882334, + "learning_rate": 4.856717528842575e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -540.0, + "logps/rejected": -624.0, + "loss": 0.4674, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -3.6875, + "rewards/margins": 0.94140625, + "rewards/rejected": -4.625, + "step": 2610 + }, + { + "epoch": 0.09752284528484488, + "grad_norm": 6.399208119692076, + "learning_rate": 4.875325641979903e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.546875, + "logps/chosen": -488.0, + "logps/rejected": -572.0, + "loss": 0.4654, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -3.140625, + "rewards/margins": 1.0859375, + "rewards/rejected": -4.21875, + "step": 2620 + }, + { + "epoch": 0.09789506988516872, + "grad_norm": 6.048613419276874, + "learning_rate": 4.893933755117231e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.71875, + "logps/chosen": -490.0, + "logps/rejected": -580.0, + "loss": 0.4703, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -3.0, + "rewards/margins": 1.0546875, + "rewards/rejected": -4.0625, + "step": 2630 + }, + { + "epoch": 0.09826729448549254, + "grad_norm": 5.926644748308866, + "learning_rate": 4.912541868254558e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.859375, + "logps/chosen": -560.0, + "logps/rejected": -628.0, + "loss": 0.4862, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.609375, + "rewards/margins": 0.9765625, + "rewards/rejected": -4.5625, + "step": 2640 + }, + { + "epoch": 0.09863951908581638, + "grad_norm": 6.3255628420034835, + "learning_rate": 4.931149981391887e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -580.0, + "logps/rejected": -660.0, + "loss": 0.481, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -3.90625, + "rewards/margins": 0.921875, + "rewards/rejected": -4.8125, + "step": 2650 + }, + { + "epoch": 0.09901174368614021, + "grad_norm": 6.2756242030817955, + "learning_rate": 4.949758094529215e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.6875, + "logps/chosen": -552.0, + "logps/rejected": -636.0, + "loss": 0.4846, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -3.671875, + "rewards/margins": 1.15625, + "rewards/rejected": -4.8125, + "step": 2660 + }, + { + "epoch": 0.09938396828646405, + "grad_norm": 6.211935806616986, + "learning_rate": 4.968366207666542e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -532.0, + "logps/rejected": -608.0, + "loss": 0.468, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.390625, + "rewards/margins": 1.0078125, + "rewards/rejected": -4.40625, + "step": 2670 + }, + { + "epoch": 0.09975619288678789, + "grad_norm": 7.110518955173448, + "learning_rate": 4.98697432080387e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -568.0, + "logps/rejected": -676.0, + "loss": 0.4666, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -3.8125, + "rewards/margins": 1.203125, + "rewards/rejected": -5.0, + "step": 2680 + }, + { + "epoch": 0.10012841748711172, + "grad_norm": 6.514305970839898, + "learning_rate": 4.999999810062151e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.84375, + "logps/chosen": -568.0, + "logps/rejected": -624.0, + "loss": 0.4636, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -3.78125, + "rewards/margins": 0.84375, + "rewards/rejected": -4.625, + "step": 2690 + }, + { + "epoch": 0.10050064208743556, + "grad_norm": 7.306955106260322, + "learning_rate": 4.99999643339008e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -548.0, + "logps/rejected": -644.0, + "loss": 0.4637, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.703125, + "rewards/margins": 1.1015625, + "rewards/rejected": -4.8125, + "step": 2700 + }, + { + "epoch": 0.1008728666877594, + "grad_norm": 7.037716673658451, + "learning_rate": 4.999988835883477e-07, + "logits/chosen": -3.5625, + "logits/rejected": -3.609375, + "logps/chosen": -548.0, + "logps/rejected": -632.0, + "loss": 0.4617, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.625, + "rewards/margins": 1.1015625, + "rewards/rejected": -4.71875, + "step": 2710 + }, + { + "epoch": 0.10124509128808323, + "grad_norm": 9.225651497922536, + "learning_rate": 4.999977017555171e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.625, + "logps/chosen": -506.0, + "logps/rejected": -552.0, + "loss": 0.4767, + "rewards/accuracies": 0.6937500238418579, + "rewards/chosen": -3.015625, + "rewards/margins": 0.87109375, + "rewards/rejected": -3.890625, + "step": 2720 + }, + { + "epoch": 0.10161731588840707, + "grad_norm": 6.318792353332601, + "learning_rate": 4.999960978425113e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.71875, + "logps/chosen": -532.0, + "logps/rejected": -596.0, + "loss": 0.4425, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -3.375, + "rewards/margins": 0.90625, + "rewards/rejected": -4.28125, + "step": 2730 + }, + { + "epoch": 0.1019895404887309, + "grad_norm": 7.445961075960431, + "learning_rate": 4.999940718520385e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -520.0, + "logps/rejected": -628.0, + "loss": 0.4751, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -3.453125, + "rewards/margins": 1.1171875, + "rewards/rejected": -4.5625, + "step": 2740 + }, + { + "epoch": 0.10236176508905473, + "grad_norm": 5.680014920863621, + "learning_rate": 4.999916237875191e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.65625, + "logps/chosen": -556.0, + "logps/rejected": -648.0, + "loss": 0.4433, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -3.734375, + "rewards/margins": 1.140625, + "rewards/rejected": -4.875, + "step": 2750 + }, + { + "epoch": 0.10273398968937857, + "grad_norm": 6.31065163996819, + "learning_rate": 4.999887536530864e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.578125, + "logps/chosen": -568.0, + "logps/rejected": -652.0, + "loss": 0.4635, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.890625, + "rewards/margins": 1.09375, + "rewards/rejected": -4.96875, + "step": 2760 + }, + { + "epoch": 0.1031062142897024, + "grad_norm": 6.092896553196265, + "learning_rate": 4.999854614535859e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.46875, + "logps/chosen": -572.0, + "logps/rejected": -664.0, + "loss": 0.4584, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -3.859375, + "rewards/margins": 0.9296875, + "rewards/rejected": -4.78125, + "step": 2770 + }, + { + "epoch": 0.10347843889002624, + "grad_norm": 6.749870666157138, + "learning_rate": 4.999817471945762e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -560.0, + "logps/rejected": -636.0, + "loss": 0.4697, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -3.84375, + "rewards/margins": 0.9140625, + "rewards/rejected": -4.75, + "step": 2780 + }, + { + "epoch": 0.10385066349035008, + "grad_norm": 6.603742051475939, + "learning_rate": 4.99977610882328e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -592.0, + "logps/rejected": -684.0, + "loss": 0.4519, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.890625, + "rewards/margins": 1.1015625, + "rewards/rejected": -5.0, + "step": 2790 + }, + { + "epoch": 0.10422288809067391, + "grad_norm": 6.4601518863713405, + "learning_rate": 4.99973052523825e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.6875, + "logps/chosen": -596.0, + "logps/rejected": -672.0, + "loss": 0.4633, + "rewards/accuracies": 0.75, + "rewards/chosen": -4.0, + "rewards/margins": 0.9609375, + "rewards/rejected": -4.96875, + "step": 2800 + }, + { + "epoch": 0.10459511269099775, + "grad_norm": 7.234422738030497, + "learning_rate": 4.999680721267631e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.765625, + "logps/chosen": -600.0, + "logps/rejected": -708.0, + "loss": 0.4633, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -4.09375, + "rewards/margins": 1.296875, + "rewards/rejected": -5.375, + "step": 2810 + }, + { + "epoch": 0.10496733729132159, + "grad_norm": 6.360501049327184, + "learning_rate": 4.999626696995509e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.640625, + "logps/chosen": -576.0, + "logps/rejected": -652.0, + "loss": 0.4586, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.0, + "rewards/margins": 1.03125, + "rewards/rejected": -5.03125, + "step": 2820 + }, + { + "epoch": 0.10533956189164542, + "grad_norm": 7.093918545875841, + "learning_rate": 4.999568452513096e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.703125, + "logps/chosen": -556.0, + "logps/rejected": -644.0, + "loss": 0.4756, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.640625, + "rewards/margins": 1.109375, + "rewards/rejected": -4.75, + "step": 2830 + }, + { + "epoch": 0.10571178649196926, + "grad_norm": 7.571224673884016, + "learning_rate": 4.999505987918727e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -548.0, + "logps/rejected": -640.0, + "loss": 0.4722, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -3.765625, + "rewards/margins": 1.015625, + "rewards/rejected": -4.78125, + "step": 2840 + }, + { + "epoch": 0.1060840110922931, + "grad_norm": 7.5048557009055035, + "learning_rate": 4.999439303317864e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.46875, + "logps/chosen": -564.0, + "logps/rejected": -680.0, + "loss": 0.4814, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -3.84375, + "rewards/margins": 1.25, + "rewards/rejected": -5.09375, + "step": 2850 + }, + { + "epoch": 0.10645623569261692, + "grad_norm": 9.07266968954365, + "learning_rate": 4.999368398823093e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.984375, + "logps/chosen": -540.0, + "logps/rejected": -616.0, + "loss": 0.4443, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -3.375, + "rewards/margins": 0.98046875, + "rewards/rejected": -4.375, + "step": 2860 + }, + { + "epoch": 0.10682846029294076, + "grad_norm": 7.251305724937602, + "learning_rate": 4.999293274554124e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.796875, + "logps/chosen": -556.0, + "logps/rejected": -668.0, + "loss": 0.4664, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -3.71875, + "rewards/margins": 1.2421875, + "rewards/rejected": -4.9375, + "step": 2870 + }, + { + "epoch": 0.10720068489326459, + "grad_norm": 7.155242673178749, + "learning_rate": 4.999213930637793e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.671875, + "logps/chosen": -576.0, + "logps/rejected": -688.0, + "loss": 0.457, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -3.859375, + "rewards/margins": 1.265625, + "rewards/rejected": -5.125, + "step": 2880 + }, + { + "epoch": 0.10757290949358843, + "grad_norm": 7.581529932420465, + "learning_rate": 4.999130367208059e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -592.0, + "logps/rejected": -676.0, + "loss": 0.4545, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.03125, + "rewards/margins": 1.109375, + "rewards/rejected": -5.15625, + "step": 2890 + }, + { + "epoch": 0.10794513409391226, + "grad_norm": 6.172272865891507, + "learning_rate": 4.999042584406005e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -576.0, + "logps/rejected": -684.0, + "loss": 0.4488, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.84375, + "rewards/margins": 1.25, + "rewards/rejected": -5.09375, + "step": 2900 + }, + { + "epoch": 0.1083173586942361, + "grad_norm": 7.382912182723025, + "learning_rate": 4.998950582379836e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -600.0, + "logps/rejected": -700.0, + "loss": 0.4546, + "rewards/accuracies": 0.6875, + "rewards/chosen": -4.09375, + "rewards/margins": 1.125, + "rewards/rejected": -5.21875, + "step": 2910 + }, + { + "epoch": 0.10868958329455994, + "grad_norm": 5.758207620223827, + "learning_rate": 4.998854361284885e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.453125, + "logps/chosen": -524.0, + "logps/rejected": -616.0, + "loss": 0.4686, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -3.34375, + "rewards/margins": 0.98828125, + "rewards/rejected": -4.34375, + "step": 2920 + }, + { + "epoch": 0.10906180789488377, + "grad_norm": 6.845912737324073, + "learning_rate": 4.998753921283606e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -564.0, + "logps/rejected": -656.0, + "loss": 0.461, + "rewards/accuracies": 0.8125, + "rewards/chosen": -3.890625, + "rewards/margins": 1.015625, + "rewards/rejected": -4.90625, + "step": 2930 + }, + { + "epoch": 0.10943403249520761, + "grad_norm": 5.982964820305056, + "learning_rate": 4.998649262545573e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.828125, + "logps/chosen": -556.0, + "logps/rejected": -660.0, + "loss": 0.4531, + "rewards/accuracies": 0.78125, + "rewards/chosen": -3.796875, + "rewards/margins": 1.2265625, + "rewards/rejected": -5.03125, + "step": 2940 + }, + { + "epoch": 0.10980625709553145, + "grad_norm": 6.292830318163489, + "learning_rate": 4.998540385247487e-07, + "logits/chosen": -3.640625, + "logits/rejected": -3.6875, + "logps/chosen": -520.0, + "logps/rejected": -584.0, + "loss": 0.4892, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -3.390625, + "rewards/margins": 0.8359375, + "rewards/rejected": -4.21875, + "step": 2950 + }, + { + "epoch": 0.11017848169585528, + "grad_norm": 6.841263806372628, + "learning_rate": 4.998427289573168e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.734375, + "logps/chosen": -536.0, + "logps/rejected": -624.0, + "loss": 0.4887, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -3.5625, + "rewards/margins": 0.93359375, + "rewards/rejected": -4.5, + "step": 2960 + }, + { + "epoch": 0.11055070629617911, + "grad_norm": 5.26619136368238, + "learning_rate": 4.998309975713561e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.53125, + "logps/chosen": -556.0, + "logps/rejected": -636.0, + "loss": 0.4815, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -3.84375, + "rewards/margins": 0.9375, + "rewards/rejected": -4.78125, + "step": 2970 + }, + { + "epoch": 0.11092293089650294, + "grad_norm": 5.953078813857384, + "learning_rate": 4.99818844386673e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.546875, + "logps/chosen": -604.0, + "logps/rejected": -696.0, + "loss": 0.4653, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -4.28125, + "rewards/margins": 1.015625, + "rewards/rejected": -5.28125, + "step": 2980 + }, + { + "epoch": 0.11129515549682678, + "grad_norm": 6.937288858216694, + "learning_rate": 4.998062694237862e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -620.0, + "logps/rejected": -736.0, + "loss": 0.4545, + "rewards/accuracies": 0.78125, + "rewards/chosen": -4.3125, + "rewards/margins": 1.203125, + "rewards/rejected": -5.5, + "step": 2990 + }, + { + "epoch": 0.11166738009715062, + "grad_norm": 5.54695879592323, + "learning_rate": 4.997932727039265e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -548.0, + "logps/rejected": -640.0, + "loss": 0.4774, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.53125, + "rewards/margins": 1.078125, + "rewards/rejected": -4.625, + "step": 3000 + }, + { + "epoch": 0.11203960469747445, + "grad_norm": 6.279746283077127, + "learning_rate": 4.997798542490368e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.53125, + "logps/chosen": -552.0, + "logps/rejected": -652.0, + "loss": 0.4379, + "rewards/accuracies": 0.75, + "rewards/chosen": -3.78125, + "rewards/margins": 0.9921875, + "rewards/rejected": -4.78125, + "step": 3010 + }, + { + "epoch": 0.11241182929779829, + "grad_norm": 6.247032126592368, + "learning_rate": 4.997660140817717e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -632.0, + "logps/rejected": -732.0, + "loss": 0.4317, + "rewards/accuracies": 0.78125, + "rewards/chosen": -4.4375, + "rewards/margins": 1.1953125, + "rewards/rejected": -5.625, + "step": 3020 + }, + { + "epoch": 0.11278405389812213, + "grad_norm": 6.999244480996859, + "learning_rate": 4.997517522254984e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.40625, + "logps/chosen": -572.0, + "logps/rejected": -656.0, + "loss": 0.4495, + "rewards/accuracies": 0.71875, + "rewards/chosen": -3.796875, + "rewards/margins": 1.0546875, + "rewards/rejected": -4.84375, + "step": 3030 + }, + { + "epoch": 0.11315627849844596, + "grad_norm": 8.06872233784361, + "learning_rate": 4.997370687042956e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -624.0, + "logps/rejected": -712.0, + "loss": 0.4567, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -4.3125, + "rewards/margins": 1.109375, + "rewards/rejected": -5.4375, + "step": 3040 + }, + { + "epoch": 0.1135285030987698, + "grad_norm": 6.947687716311752, + "learning_rate": 4.997219635429538e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -580.0, + "logps/rejected": -704.0, + "loss": 0.4423, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -3.953125, + "rewards/margins": 1.25, + "rewards/rejected": -5.21875, + "step": 3050 + }, + { + "epoch": 0.11390072769909364, + "grad_norm": 7.29382971914937, + "learning_rate": 4.997064367669758e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.71875, + "logps/chosen": -600.0, + "logps/rejected": -692.0, + "loss": 0.4572, + "rewards/accuracies": 0.71875, + "rewards/chosen": -4.21875, + "rewards/margins": 0.9609375, + "rewards/rejected": -5.1875, + "step": 3060 + }, + { + "epoch": 0.11427295229941747, + "grad_norm": 5.646650773332122, + "learning_rate": 4.996904884025761e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.796875, + "logps/chosen": -580.0, + "logps/rejected": -668.0, + "loss": 0.4628, + "rewards/accuracies": 0.8125, + "rewards/chosen": -3.828125, + "rewards/margins": 1.25, + "rewards/rejected": -5.09375, + "step": 3070 + }, + { + "epoch": 0.11464517689974131, + "grad_norm": 5.925473322691006, + "learning_rate": 4.996741184766806e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.6875, + "logps/chosen": -580.0, + "logps/rejected": -696.0, + "loss": 0.4445, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -4.0625, + "rewards/margins": 1.2578125, + "rewards/rejected": -5.34375, + "step": 3080 + }, + { + "epoch": 0.11501740150006513, + "grad_norm": 6.7048257156530084, + "learning_rate": 4.996573270169275e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.875, + "logps/chosen": -572.0, + "logps/rejected": -652.0, + "loss": 0.4471, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -3.78125, + "rewards/margins": 1.078125, + "rewards/rejected": -4.875, + "step": 3090 + }, + { + "epoch": 0.11538962610038897, + "grad_norm": 6.293377102514235, + "learning_rate": 4.996401140516663e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.8125, + "logps/chosen": -636.0, + "logps/rejected": -736.0, + "loss": 0.4436, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -4.53125, + "rewards/margins": 1.109375, + "rewards/rejected": -5.625, + "step": 3100 + }, + { + "epoch": 0.1157618507007128, + "grad_norm": 8.108184400087252, + "learning_rate": 4.996224796099584e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.8125, + "logps/chosen": -560.0, + "logps/rejected": -668.0, + "loss": 0.4446, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -3.78125, + "rewards/margins": 1.2890625, + "rewards/rejected": -5.0625, + "step": 3110 + }, + { + "epoch": 0.11613407530103664, + "grad_norm": 11.699226051929289, + "learning_rate": 4.996044237215765e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -596.0, + "logps/rejected": -704.0, + "loss": 0.4512, + "rewards/accuracies": 0.8125, + "rewards/chosen": -4.15625, + "rewards/margins": 1.140625, + "rewards/rejected": -5.28125, + "step": 3120 + }, + { + "epoch": 0.11650629990136048, + "grad_norm": 8.919296260065547, + "learning_rate": 4.995859464170051e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.859375, + "logps/chosen": -620.0, + "logps/rejected": -728.0, + "loss": 0.4417, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -4.40625, + "rewards/margins": 1.1640625, + "rewards/rejected": -5.5625, + "step": 3130 + }, + { + "epoch": 0.11687852450168432, + "grad_norm": 6.148343995228796, + "learning_rate": 4.995670477274402e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.828125, + "logps/chosen": -568.0, + "logps/rejected": -688.0, + "loss": 0.4663, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -3.9375, + "rewards/margins": 1.1796875, + "rewards/rejected": -5.125, + "step": 3140 + }, + { + "epoch": 0.11725074910200815, + "grad_norm": 6.671053026062253, + "learning_rate": 4.995477276847889e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -592.0, + "logps/rejected": -704.0, + "loss": 0.4481, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.21875, + "rewards/margins": 1.0625, + "rewards/rejected": -5.25, + "step": 3150 + }, + { + "epoch": 0.11762297370233199, + "grad_norm": 6.117612593879977, + "learning_rate": 4.995279863216701e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.8125, + "logps/chosen": -556.0, + "logps/rejected": -644.0, + "loss": 0.4363, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -3.84375, + "rewards/margins": 1.0703125, + "rewards/rejected": -4.90625, + "step": 3160 + }, + { + "epoch": 0.11799519830265583, + "grad_norm": 7.176202883807436, + "learning_rate": 4.995078236714138e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -584.0, + "logps/rejected": -748.0, + "loss": 0.4499, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -4.03125, + "rewards/margins": 1.578125, + "rewards/rejected": -5.59375, + "step": 3170 + }, + { + "epoch": 0.11836742290297966, + "grad_norm": 6.911854486517442, + "learning_rate": 4.994872397680615e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -592.0, + "logps/rejected": -688.0, + "loss": 0.4671, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -4.21875, + "rewards/margins": 0.96484375, + "rewards/rejected": -5.15625, + "step": 3180 + }, + { + "epoch": 0.1187396475033035, + "grad_norm": 10.197222141423639, + "learning_rate": 4.994662346463655e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.75, + "logps/chosen": -592.0, + "logps/rejected": -664.0, + "loss": 0.4628, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -4.0, + "rewards/margins": 1.0546875, + "rewards/rejected": -5.0625, + "step": 3190 + }, + { + "epoch": 0.11911187210362732, + "grad_norm": 8.779132089887378, + "learning_rate": 4.994448083417896e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.546875, + "logps/chosen": -616.0, + "logps/rejected": -740.0, + "loss": 0.4429, + "rewards/accuracies": 0.75, + "rewards/chosen": -4.375, + "rewards/margins": 1.2109375, + "rewards/rejected": -5.59375, + "step": 3200 + }, + { + "epoch": 0.11948409670395116, + "grad_norm": 6.372450601862111, + "learning_rate": 4.994229608905087e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -596.0, + "logps/rejected": -768.0, + "loss": 0.4574, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -4.09375, + "rewards/margins": 1.796875, + "rewards/rejected": -5.875, + "step": 3210 + }, + { + "epoch": 0.119856321304275, + "grad_norm": 6.441216649020593, + "learning_rate": 4.994006923294085e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -568.0, + "logps/rejected": -680.0, + "loss": 0.457, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.0, + "rewards/margins": 1.15625, + "rewards/rejected": -5.1875, + "step": 3220 + }, + { + "epoch": 0.12022854590459883, + "grad_norm": 6.4785093399544555, + "learning_rate": 4.993780026960859e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -620.0, + "logps/rejected": -700.0, + "loss": 0.4752, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -4.09375, + "rewards/margins": 1.1015625, + "rewards/rejected": -5.1875, + "step": 3230 + }, + { + "epoch": 0.12060077050492267, + "grad_norm": 5.9512176119157045, + "learning_rate": 4.993548920288487e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -584.0, + "logps/rejected": -688.0, + "loss": 0.4618, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -4.0, + "rewards/margins": 1.25, + "rewards/rejected": -5.25, + "step": 3240 + }, + { + "epoch": 0.1209729951052465, + "grad_norm": 6.575306736569084, + "learning_rate": 4.993313603667152e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -588.0, + "logps/rejected": -692.0, + "loss": 0.4422, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -4.15625, + "rewards/margins": 1.1484375, + "rewards/rejected": -5.28125, + "step": 3250 + }, + { + "epoch": 0.12134521970557034, + "grad_norm": 6.0838794532038225, + "learning_rate": 4.993074077494151e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -592.0, + "logps/rejected": -728.0, + "loss": 0.449, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -4.25, + "rewards/margins": 1.390625, + "rewards/rejected": -5.65625, + "step": 3260 + }, + { + "epoch": 0.12171744430589418, + "grad_norm": 7.95167940015155, + "learning_rate": 4.992830342173883e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -584.0, + "logps/rejected": -692.0, + "loss": 0.4238, + "rewards/accuracies": 0.8125, + "rewards/chosen": -3.796875, + "rewards/margins": 1.3359375, + "rewards/rejected": -5.125, + "step": 3270 + }, + { + "epoch": 0.12208966890621802, + "grad_norm": 9.697344826786047, + "learning_rate": 4.992582398117854e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.453125, + "logps/chosen": -580.0, + "logps/rejected": -716.0, + "loss": 0.45, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -4.09375, + "rewards/margins": 1.5703125, + "rewards/rejected": -5.6875, + "step": 3280 + }, + { + "epoch": 0.12246189350654185, + "grad_norm": 6.074554707253789, + "learning_rate": 4.992330245744679e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.84375, + "logps/chosen": -580.0, + "logps/rejected": -692.0, + "loss": 0.4562, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -3.96875, + "rewards/margins": 1.2578125, + "rewards/rejected": -5.21875, + "step": 3290 + }, + { + "epoch": 0.12283411810686569, + "grad_norm": 6.037098881295751, + "learning_rate": 4.992073885480076e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.9375, + "logps/chosen": -572.0, + "logps/rejected": -624.0, + "loss": 0.4659, + "rewards/accuracies": 0.6937500238418579, + "rewards/chosen": -3.765625, + "rewards/margins": 0.88671875, + "rewards/rejected": -4.65625, + "step": 3300 + }, + { + "epoch": 0.12320634270718951, + "grad_norm": 6.821962308345998, + "learning_rate": 4.991813317756866e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -600.0, + "logps/rejected": -704.0, + "loss": 0.4542, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -4.1875, + "rewards/margins": 1.28125, + "rewards/rejected": -5.46875, + "step": 3310 + }, + { + "epoch": 0.12357856730751335, + "grad_norm": 7.229520240147668, + "learning_rate": 4.991548543014975e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -628.0, + "logps/rejected": -740.0, + "loss": 0.4769, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -4.4375, + "rewards/margins": 1.3125, + "rewards/rejected": -5.75, + "step": 3320 + }, + { + "epoch": 0.12395079190783719, + "grad_norm": 6.84456725737557, + "learning_rate": 4.991279561701434e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.734375, + "logps/chosen": -572.0, + "logps/rejected": -692.0, + "loss": 0.4502, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -3.875, + "rewards/margins": 1.3984375, + "rewards/rejected": -5.28125, + "step": 3330 + }, + { + "epoch": 0.12432301650816102, + "grad_norm": 7.139306112495771, + "learning_rate": 4.991006374270371e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.671875, + "logps/chosen": -640.0, + "logps/rejected": -744.0, + "loss": 0.4545, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -4.4375, + "rewards/margins": 1.1796875, + "rewards/rejected": -5.625, + "step": 3340 + }, + { + "epoch": 0.12469524110848486, + "grad_norm": 8.202464001933487, + "learning_rate": 4.990728981183019e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -624.0, + "logps/rejected": -728.0, + "loss": 0.457, + "rewards/accuracies": 0.8125, + "rewards/chosen": -4.25, + "rewards/margins": 1.2734375, + "rewards/rejected": -5.53125, + "step": 3350 + }, + { + "epoch": 0.1250674657088087, + "grad_norm": 6.183831591940218, + "learning_rate": 4.990447382907713e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.75, + "logps/chosen": -596.0, + "logps/rejected": -696.0, + "loss": 0.4735, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -4.15625, + "rewards/margins": 1.09375, + "rewards/rejected": -5.25, + "step": 3360 + }, + { + "epoch": 0.12543969030913252, + "grad_norm": 5.74197797394421, + "learning_rate": 4.990161579919882e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.71875, + "logps/chosen": -616.0, + "logps/rejected": -716.0, + "loss": 0.4452, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -4.15625, + "rewards/margins": 1.1953125, + "rewards/rejected": -5.34375, + "step": 3370 + }, + { + "epoch": 0.12581191490945637, + "grad_norm": 5.972762359020475, + "learning_rate": 4.98987157270206e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.71875, + "logps/chosen": -580.0, + "logps/rejected": -672.0, + "loss": 0.4539, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -3.890625, + "rewards/margins": 1.125, + "rewards/rejected": -5.03125, + "step": 3380 + }, + { + "epoch": 0.1261841395097802, + "grad_norm": 6.340524766277757, + "learning_rate": 4.989577361743875e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.59375, + "logps/chosen": -604.0, + "logps/rejected": -696.0, + "loss": 0.4578, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -4.125, + "rewards/margins": 1.046875, + "rewards/rejected": -5.1875, + "step": 3390 + }, + { + "epoch": 0.12655636411010404, + "grad_norm": 6.680137616172863, + "learning_rate": 4.989278947542056e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.421875, + "logps/chosen": -648.0, + "logps/rejected": -744.0, + "loss": 0.4125, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -4.375, + "rewards/margins": 1.2734375, + "rewards/rejected": -5.65625, + "step": 3400 + }, + { + "epoch": 0.12692858871042786, + "grad_norm": 7.890719574539212, + "learning_rate": 4.988976330600426e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -592.0, + "logps/rejected": -712.0, + "loss": 0.4605, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -4.21875, + "rewards/margins": 1.375, + "rewards/rejected": -5.59375, + "step": 3410 + }, + { + "epoch": 0.12730081331075171, + "grad_norm": 5.906282275914477, + "learning_rate": 4.988669511429902e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -608.0, + "logps/rejected": -704.0, + "loss": 0.4635, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -4.1875, + "rewards/margins": 1.109375, + "rewards/rejected": -5.3125, + "step": 3420 + }, + { + "epoch": 0.12767303791107554, + "grad_norm": 5.3903668131739835, + "learning_rate": 4.988358490548501e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.703125, + "logps/chosen": -596.0, + "logps/rejected": -684.0, + "loss": 0.4765, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -3.921875, + "rewards/margins": 1.1484375, + "rewards/rejected": -5.0625, + "step": 3430 + }, + { + "epoch": 0.1280452625113994, + "grad_norm": 4.961272687874735, + "learning_rate": 4.988043268481329e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -616.0, + "logps/rejected": -748.0, + "loss": 0.4262, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -4.28125, + "rewards/margins": 1.4765625, + "rewards/rejected": -5.75, + "step": 3440 + }, + { + "epoch": 0.1284174871117232, + "grad_norm": 8.068168331858757, + "learning_rate": 4.987723845760587e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -624.0, + "logps/rejected": -740.0, + "loss": 0.442, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -4.40625, + "rewards/margins": 1.2890625, + "rewards/rejected": -5.6875, + "step": 3450 + }, + { + "epoch": 0.12878971171204706, + "grad_norm": 6.795034479962609, + "learning_rate": 4.987400222925569e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -652.0, + "logps/rejected": -748.0, + "loss": 0.4452, + "rewards/accuracies": 0.71875, + "rewards/chosen": -4.71875, + "rewards/margins": 0.99609375, + "rewards/rejected": -5.71875, + "step": 3460 + }, + { + "epoch": 0.12916193631237088, + "grad_norm": 5.796036927698797, + "learning_rate": 4.987072400522658e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.609375, + "logps/chosen": -616.0, + "logps/rejected": -736.0, + "loss": 0.4276, + "rewards/accuracies": 0.75, + "rewards/chosen": -4.78125, + "rewards/margins": 1.2109375, + "rewards/rejected": -5.96875, + "step": 3470 + }, + { + "epoch": 0.1295341609126947, + "grad_norm": 8.92117123663945, + "learning_rate": 4.986740379105328e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -604.0, + "logps/rejected": -712.0, + "loss": 0.4612, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": -4.28125, + "rewards/margins": 1.0078125, + "rewards/rejected": -5.28125, + "step": 3480 + }, + { + "epoch": 0.12990638551301856, + "grad_norm": 5.223560106131392, + "learning_rate": 4.986404159234145e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.6875, + "logps/chosen": -624.0, + "logps/rejected": -728.0, + "loss": 0.4321, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -4.21875, + "rewards/margins": 1.2734375, + "rewards/rejected": -5.5, + "step": 3490 + }, + { + "epoch": 0.13027861011334238, + "grad_norm": 5.871849600072611, + "learning_rate": 4.986063741476759e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.8125, + "logps/chosen": -664.0, + "logps/rejected": -784.0, + "loss": 0.4538, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -4.625, + "rewards/margins": 1.3984375, + "rewards/rejected": -6.03125, + "step": 3500 + }, + { + "epoch": 0.13065083471366623, + "grad_norm": 6.987648018826682, + "learning_rate": 4.985719126407912e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.859375, + "logps/chosen": -660.0, + "logps/rejected": -768.0, + "loss": 0.4375, + "rewards/accuracies": 0.8125, + "rewards/chosen": -4.78125, + "rewards/margins": 1.3828125, + "rewards/rejected": -6.15625, + "step": 3510 + }, + { + "epoch": 0.13102305931399005, + "grad_norm": 5.901780901766237, + "learning_rate": 4.985370314609426e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.765625, + "logps/chosen": -616.0, + "logps/rejected": -744.0, + "loss": 0.4456, + "rewards/accuracies": 0.8125, + "rewards/chosen": -4.21875, + "rewards/margins": 1.4375, + "rewards/rejected": -5.65625, + "step": 3520 + }, + { + "epoch": 0.1313952839143139, + "grad_norm": 7.071445326243194, + "learning_rate": 4.985017306670216e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.453125, + "logps/chosen": -616.0, + "logps/rejected": -748.0, + "loss": 0.4518, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -4.25, + "rewards/margins": 1.5546875, + "rewards/rejected": -5.78125, + "step": 3530 + }, + { + "epoch": 0.13176750851463773, + "grad_norm": 5.212204350054308, + "learning_rate": 4.984660103186278e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.84375, + "logps/chosen": -676.0, + "logps/rejected": -796.0, + "loss": 0.4563, + "rewards/accuracies": 0.78125, + "rewards/chosen": -4.84375, + "rewards/margins": 1.2578125, + "rewards/rejected": -6.09375, + "step": 3540 + }, + { + "epoch": 0.13213973311496158, + "grad_norm": 5.558822016819327, + "learning_rate": 4.984298704760689e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.71875, + "logps/chosen": -656.0, + "logps/rejected": -756.0, + "loss": 0.4332, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -4.625, + "rewards/margins": 1.109375, + "rewards/rejected": -5.75, + "step": 3550 + }, + { + "epoch": 0.1325119577152854, + "grad_norm": 6.967443631896487, + "learning_rate": 4.983933112003615e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.75, + "logps/chosen": -624.0, + "logps/rejected": -752.0, + "loss": 0.439, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -4.4375, + "rewards/margins": 1.5078125, + "rewards/rejected": -5.9375, + "step": 3560 + }, + { + "epoch": 0.13288418231560925, + "grad_norm": 6.3598928852554995, + "learning_rate": 4.983563325532295e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.609375, + "logps/chosen": -644.0, + "logps/rejected": -764.0, + "loss": 0.4427, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -4.71875, + "rewards/margins": 1.3359375, + "rewards/rejected": -6.0625, + "step": 3570 + }, + { + "epoch": 0.13325640691593307, + "grad_norm": 7.022481716988861, + "learning_rate": 4.983189345971056e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.78125, + "logps/chosen": -644.0, + "logps/rejected": -744.0, + "loss": 0.4383, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.5625, + "rewards/margins": 1.171875, + "rewards/rejected": -5.71875, + "step": 3580 + }, + { + "epoch": 0.1336286315162569, + "grad_norm": 6.780733486647057, + "learning_rate": 4.982811173951301e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -616.0, + "logps/rejected": -720.0, + "loss": 0.4532, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -4.5625, + "rewards/margins": 1.1640625, + "rewards/rejected": -5.71875, + "step": 3590 + }, + { + "epoch": 0.13400085611658075, + "grad_norm": 5.637307376742751, + "learning_rate": 4.982428810111512e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.875, + "logps/chosen": -652.0, + "logps/rejected": -744.0, + "loss": 0.4605, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.5625, + "rewards/margins": 0.98046875, + "rewards/rejected": -5.53125, + "step": 3600 + }, + { + "epoch": 0.13437308071690457, + "grad_norm": 5.715037906817475, + "learning_rate": 4.982042255097245e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.734375, + "logps/chosen": -624.0, + "logps/rejected": -744.0, + "loss": 0.4317, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -4.34375, + "rewards/margins": 1.3828125, + "rewards/rejected": -5.75, + "step": 3610 + }, + { + "epoch": 0.13474530531722842, + "grad_norm": 7.235399557709921, + "learning_rate": 4.981651509561137e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.78125, + "logps/chosen": -632.0, + "logps/rejected": -728.0, + "loss": 0.4471, + "rewards/accuracies": 0.78125, + "rewards/chosen": -4.4375, + "rewards/margins": 1.2578125, + "rewards/rejected": -5.6875, + "step": 3620 + }, + { + "epoch": 0.13511752991755224, + "grad_norm": 6.8658883846755705, + "learning_rate": 4.981256574162897e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.484375, + "logps/chosen": -628.0, + "logps/rejected": -760.0, + "loss": 0.4505, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -4.375, + "rewards/margins": 1.609375, + "rewards/rejected": -6.0, + "step": 3630 + }, + { + "epoch": 0.1354897545178761, + "grad_norm": 6.783324383771678, + "learning_rate": 4.980857449569309e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -636.0, + "logps/rejected": -748.0, + "loss": 0.4672, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -4.53125, + "rewards/margins": 1.2265625, + "rewards/rejected": -5.75, + "step": 3640 + }, + { + "epoch": 0.13586197911819992, + "grad_norm": 6.8706527455369395, + "learning_rate": 4.98045413645423e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -644.0, + "logps/rejected": -764.0, + "loss": 0.4365, + "rewards/accuracies": 0.8125, + "rewards/chosen": -4.375, + "rewards/margins": 1.46875, + "rewards/rejected": -5.84375, + "step": 3650 + }, + { + "epoch": 0.13623420371852377, + "grad_norm": 5.359628903637225, + "learning_rate": 4.980046635498589e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.390625, + "logps/chosen": -628.0, + "logps/rejected": -756.0, + "loss": 0.4544, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -4.59375, + "rewards/margins": 1.3203125, + "rewards/rejected": -5.9375, + "step": 3660 + }, + { + "epoch": 0.1366064283188476, + "grad_norm": 6.08079369798337, + "learning_rate": 4.979634947390381e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -632.0, + "logps/rejected": -748.0, + "loss": 0.4597, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -4.4375, + "rewards/margins": 1.28125, + "rewards/rejected": -5.6875, + "step": 3670 + }, + { + "epoch": 0.13697865291917144, + "grad_norm": 5.318130278514382, + "learning_rate": 4.979219072824678e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -600.0, + "logps/rejected": -712.0, + "loss": 0.4446, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -4.3125, + "rewards/margins": 1.359375, + "rewards/rejected": -5.65625, + "step": 3680 + }, + { + "epoch": 0.13735087751949526, + "grad_norm": 5.614603740865042, + "learning_rate": 4.978799012503614e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.578125, + "logps/chosen": -620.0, + "logps/rejected": -756.0, + "loss": 0.436, + "rewards/accuracies": 0.8125, + "rewards/chosen": -4.3125, + "rewards/margins": 1.4375, + "rewards/rejected": -5.75, + "step": 3690 + }, + { + "epoch": 0.13772310211981909, + "grad_norm": 8.205202469508833, + "learning_rate": 4.978374767136391e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.765625, + "logps/chosen": -652.0, + "logps/rejected": -764.0, + "loss": 0.4578, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -4.75, + "rewards/margins": 1.3046875, + "rewards/rejected": -6.0625, + "step": 3700 + }, + { + "epoch": 0.13809532672014294, + "grad_norm": 8.125967976566125, + "learning_rate": 4.977946337439281e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.828125, + "logps/chosen": -668.0, + "logps/rejected": -748.0, + "loss": 0.4321, + "rewards/accuracies": 0.78125, + "rewards/chosen": -4.4375, + "rewards/margins": 1.265625, + "rewards/rejected": -5.71875, + "step": 3710 + }, + { + "epoch": 0.13846755132046676, + "grad_norm": 6.1826290654240745, + "learning_rate": 4.977513724135615e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.578125, + "logps/chosen": -620.0, + "logps/rejected": -756.0, + "loss": 0.4453, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -4.40625, + "rewards/margins": 1.359375, + "rewards/rejected": -5.75, + "step": 3720 + }, + { + "epoch": 0.1388397759207906, + "grad_norm": 6.257212281885236, + "learning_rate": 4.977076927955792e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -644.0, + "logps/rejected": -740.0, + "loss": 0.4561, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -4.53125, + "rewards/margins": 1.1875, + "rewards/rejected": -5.75, + "step": 3730 + }, + { + "epoch": 0.13921200052111443, + "grad_norm": 5.8655856333891565, + "learning_rate": 4.976635949637268e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.546875, + "logps/chosen": -632.0, + "logps/rejected": -744.0, + "loss": 0.4524, + "rewards/accuracies": 0.75, + "rewards/chosen": -4.5, + "rewards/margins": 1.328125, + "rewards/rejected": -5.84375, + "step": 3740 + }, + { + "epoch": 0.13958422512143828, + "grad_norm": 8.972857669125604, + "learning_rate": 4.976190789924563e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.546875, + "logps/chosen": -608.0, + "logps/rejected": -712.0, + "loss": 0.4422, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -4.3125, + "rewards/margins": 1.1640625, + "rewards/rejected": -5.5, + "step": 3750 + }, + { + "epoch": 0.1399564497217621, + "grad_norm": 5.990912754321117, + "learning_rate": 4.975741449569258e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.59375, + "logps/chosen": -608.0, + "logps/rejected": -692.0, + "loss": 0.4611, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.46875, + "rewards/margins": 0.9375, + "rewards/rejected": -5.40625, + "step": 3760 + }, + { + "epoch": 0.14032867432208596, + "grad_norm": 5.121443166601498, + "learning_rate": 4.975287929329989e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.703125, + "logps/chosen": -640.0, + "logps/rejected": -752.0, + "loss": 0.4561, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -4.46875, + "rewards/margins": 1.2421875, + "rewards/rejected": -5.71875, + "step": 3770 + }, + { + "epoch": 0.14070089892240978, + "grad_norm": 6.311626680869443, + "learning_rate": 4.974830229972452e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.546875, + "logps/chosen": -608.0, + "logps/rejected": -732.0, + "loss": 0.4372, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -4.40625, + "rewards/margins": 1.3515625, + "rewards/rejected": -5.75, + "step": 3780 + }, + { + "epoch": 0.14107312352273363, + "grad_norm": 5.843621785655601, + "learning_rate": 4.974368352269397e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -624.0, + "logps/rejected": -756.0, + "loss": 0.4263, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -4.53125, + "rewards/margins": 1.296875, + "rewards/rejected": -5.84375, + "step": 3790 + }, + { + "epoch": 0.14144534812305745, + "grad_norm": 6.804867664066004, + "learning_rate": 4.973902297000628e-07, + "logits/chosen": -3.625, + "logits/rejected": -3.59375, + "logps/chosen": -644.0, + "logps/rejected": -744.0, + "loss": 0.4485, + "rewards/accuracies": 0.75, + "rewards/chosen": -4.6875, + "rewards/margins": 1.1875, + "rewards/rejected": -5.875, + "step": 3800 + }, + { + "epoch": 0.14181757272338127, + "grad_norm": 6.218503436352911, + "learning_rate": 4.973432064953004e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -684.0, + "logps/rejected": -804.0, + "loss": 0.4724, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.0, + "rewards/margins": 1.2578125, + "rewards/rejected": -6.25, + "step": 3810 + }, + { + "epoch": 0.14218979732370512, + "grad_norm": 5.2602914797478455, + "learning_rate": 4.972957656920434e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -616.0, + "logps/rejected": -748.0, + "loss": 0.435, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -4.34375, + "rewards/margins": 1.359375, + "rewards/rejected": -5.71875, + "step": 3820 + }, + { + "epoch": 0.14256202192402895, + "grad_norm": 5.770672774714267, + "learning_rate": 4.972479073703879e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.734375, + "logps/chosen": -700.0, + "logps/rejected": -796.0, + "loss": 0.4591, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -4.875, + "rewards/margins": 1.125, + "rewards/rejected": -6.0, + "step": 3830 + }, + { + "epoch": 0.1429342465243528, + "grad_norm": 6.836653213684203, + "learning_rate": 4.971996316111347e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.4375, + "logps/chosen": -712.0, + "logps/rejected": -808.0, + "loss": 0.4294, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.125, + "rewards/margins": 1.3359375, + "rewards/rejected": -6.46875, + "step": 3840 + }, + { + "epoch": 0.14330647112467662, + "grad_norm": 6.904003354824577, + "learning_rate": 4.971509384957899e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.75, + "logps/chosen": -636.0, + "logps/rejected": -760.0, + "loss": 0.4264, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -4.78125, + "rewards/margins": 1.1953125, + "rewards/rejected": -6.0, + "step": 3850 + }, + { + "epoch": 0.14367869572500047, + "grad_norm": 5.902140943109142, + "learning_rate": 4.971018281065632e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.796875, + "logps/chosen": -684.0, + "logps/rejected": -792.0, + "loss": 0.4138, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -4.8125, + "rewards/margins": 1.3828125, + "rewards/rejected": -6.1875, + "step": 3860 + }, + { + "epoch": 0.1440509203253243, + "grad_norm": 5.803101839035741, + "learning_rate": 4.9705230052637e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -680.0, + "logps/rejected": -776.0, + "loss": 0.4571, + "rewards/accuracies": 0.8125, + "rewards/chosen": -4.6875, + "rewards/margins": 1.3046875, + "rewards/rejected": -6.0, + "step": 3870 + }, + { + "epoch": 0.14442314492564814, + "grad_norm": 6.955879230784433, + "learning_rate": 4.970023558388294e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.71875, + "logps/chosen": -652.0, + "logps/rejected": -744.0, + "loss": 0.445, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.625, + "rewards/margins": 1.171875, + "rewards/rejected": -5.8125, + "step": 3880 + }, + { + "epoch": 0.14479536952597197, + "grad_norm": 5.2387046632240235, + "learning_rate": 4.969519941282647e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -656.0, + "logps/rejected": -740.0, + "loss": 0.4292, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.5625, + "rewards/margins": 1.046875, + "rewards/rejected": -5.59375, + "step": 3890 + }, + { + "epoch": 0.14516759412629582, + "grad_norm": 26.07099639219989, + "learning_rate": 4.969012154797034e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.65625, + "logps/chosen": -636.0, + "logps/rejected": -764.0, + "loss": 0.4395, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -4.53125, + "rewards/margins": 1.5, + "rewards/rejected": -6.03125, + "step": 3900 + }, + { + "epoch": 0.14553981872661964, + "grad_norm": 7.604734590879799, + "learning_rate": 4.96850019978877e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.59375, + "logps/chosen": -636.0, + "logps/rejected": -776.0, + "loss": 0.4515, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -4.65625, + "rewards/margins": 1.390625, + "rewards/rejected": -6.0625, + "step": 3910 + }, + { + "epoch": 0.1459120433269435, + "grad_norm": 5.464158017535742, + "learning_rate": 4.967984077122207e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.734375, + "logps/chosen": -596.0, + "logps/rejected": -700.0, + "loss": 0.4641, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -4.125, + "rewards/margins": 1.1640625, + "rewards/rejected": -5.3125, + "step": 3920 + }, + { + "epoch": 0.14628426792726731, + "grad_norm": 6.304001836376101, + "learning_rate": 4.967463787668734e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -640.0, + "logps/rejected": -752.0, + "loss": 0.4384, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -4.34375, + "rewards/margins": 1.3515625, + "rewards/rejected": -5.6875, + "step": 3930 + }, + { + "epoch": 0.14665649252759114, + "grad_norm": 5.931843149222858, + "learning_rate": 4.966939332306773e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -672.0, + "logps/rejected": -792.0, + "loss": 0.45, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -4.875, + "rewards/margins": 1.125, + "rewards/rejected": -6.0, + "step": 3940 + }, + { + "epoch": 0.147028717127915, + "grad_norm": 5.714391921437342, + "learning_rate": 4.966410711921784e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -644.0, + "logps/rejected": -728.0, + "loss": 0.4353, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -4.75, + "rewards/margins": 0.9453125, + "rewards/rejected": -5.6875, + "step": 3950 + }, + { + "epoch": 0.1474009417282388, + "grad_norm": 5.96946748930747, + "learning_rate": 4.965877927406252e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.671875, + "logps/chosen": -660.0, + "logps/rejected": -752.0, + "loss": 0.4478, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -4.875, + "rewards/margins": 1.140625, + "rewards/rejected": -6.03125, + "step": 3960 + }, + { + "epoch": 0.14777316632856266, + "grad_norm": 5.745987526680022, + "learning_rate": 4.965340979659699e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.65625, + "logps/chosen": -672.0, + "logps/rejected": -776.0, + "loss": 0.4513, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -4.96875, + "rewards/margins": 1.109375, + "rewards/rejected": -6.0625, + "step": 3970 + }, + { + "epoch": 0.14814539092888648, + "grad_norm": 6.814180391539611, + "learning_rate": 4.964799869588673e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -632.0, + "logps/rejected": -756.0, + "loss": 0.4721, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -4.53125, + "rewards/margins": 1.2890625, + "rewards/rejected": -5.8125, + "step": 3980 + }, + { + "epoch": 0.14851761552921033, + "grad_norm": 5.798104354113069, + "learning_rate": 4.964254598106751e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.765625, + "logps/chosen": -640.0, + "logps/rejected": -752.0, + "loss": 0.4414, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -4.375, + "rewards/margins": 1.3046875, + "rewards/rejected": -5.6875, + "step": 3990 + }, + { + "epoch": 0.14888984012953416, + "grad_norm": 6.114913289601737, + "learning_rate": 4.96370516613453e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -684.0, + "logps/rejected": -780.0, + "loss": 0.4562, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -4.9375, + "rewards/margins": 1.0, + "rewards/rejected": -5.9375, + "step": 4000 + }, + { + "epoch": 0.149262064729858, + "grad_norm": 5.01517407197322, + "learning_rate": 4.963151574599641e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.46875, + "logps/chosen": -632.0, + "logps/rejected": -760.0, + "loss": 0.4557, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -4.625, + "rewards/margins": 1.328125, + "rewards/rejected": -5.96875, + "step": 4010 + }, + { + "epoch": 0.14963428933018183, + "grad_norm": 6.104422620962016, + "learning_rate": 4.962593824436731e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -644.0, + "logps/rejected": -772.0, + "loss": 0.432, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -4.59375, + "rewards/margins": 1.234375, + "rewards/rejected": -5.8125, + "step": 4020 + }, + { + "epoch": 0.15000651393050568, + "grad_norm": 5.493524217382667, + "learning_rate": 4.962031916587469e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.65625, + "logps/chosen": -648.0, + "logps/rejected": -768.0, + "loss": 0.437, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -4.84375, + "rewards/margins": 1.34375, + "rewards/rejected": -6.1875, + "step": 4030 + }, + { + "epoch": 0.1503787385308295, + "grad_norm": 6.037008911338963, + "learning_rate": 4.961465852000545e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.78125, + "logps/chosen": -680.0, + "logps/rejected": -792.0, + "loss": 0.4524, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -4.90625, + "rewards/margins": 1.234375, + "rewards/rejected": -6.125, + "step": 4040 + }, + { + "epoch": 0.15075096313115333, + "grad_norm": 6.206263363310757, + "learning_rate": 4.960895631631665e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.96875, + "logps/chosen": -700.0, + "logps/rejected": -812.0, + "loss": 0.4451, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -5.0, + "rewards/margins": 1.546875, + "rewards/rejected": -6.53125, + "step": 4050 + }, + { + "epoch": 0.15112318773147718, + "grad_norm": 6.228569331632899, + "learning_rate": 4.960321256443555e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.90625, + "logps/chosen": -720.0, + "logps/rejected": -820.0, + "loss": 0.4434, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -4.96875, + "rewards/margins": 1.3671875, + "rewards/rejected": -6.3125, + "step": 4060 + }, + { + "epoch": 0.151495412331801, + "grad_norm": 5.122640947025669, + "learning_rate": 4.959742727405952e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.828125, + "logps/chosen": -660.0, + "logps/rejected": -760.0, + "loss": 0.4226, + "rewards/accuracies": 0.75, + "rewards/chosen": -4.65625, + "rewards/margins": 1.21875, + "rewards/rejected": -5.875, + "step": 4070 + }, + { + "epoch": 0.15186763693212485, + "grad_norm": 6.524389572637526, + "learning_rate": 4.959160045495607e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.828125, + "logps/chosen": -616.0, + "logps/rejected": -736.0, + "loss": 0.4599, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -4.28125, + "rewards/margins": 1.2890625, + "rewards/rejected": -5.5625, + "step": 4080 + }, + { + "epoch": 0.15223986153244867, + "grad_norm": 6.900189241327749, + "learning_rate": 4.958573211696285e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -668.0, + "logps/rejected": -788.0, + "loss": 0.4572, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -4.84375, + "rewards/margins": 1.2109375, + "rewards/rejected": -6.0625, + "step": 4090 + }, + { + "epoch": 0.15261208613277252, + "grad_norm": 6.16014597908324, + "learning_rate": 4.957982226998757e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.671875, + "logps/chosen": -640.0, + "logps/rejected": -776.0, + "loss": 0.4537, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -4.6875, + "rewards/margins": 1.296875, + "rewards/rejected": -6.0, + "step": 4100 + }, + { + "epoch": 0.15298431073309635, + "grad_norm": 5.7726572436368055, + "learning_rate": 4.957387092400805e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -664.0, + "logps/rejected": -768.0, + "loss": 0.4201, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -4.8125, + "rewards/margins": 1.2265625, + "rewards/rejected": -6.03125, + "step": 4110 + }, + { + "epoch": 0.1533565353334202, + "grad_norm": 6.7406768979167575, + "learning_rate": 4.956787808907215e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -700.0, + "logps/rejected": -792.0, + "loss": 0.449, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -5.15625, + "rewards/margins": 1.046875, + "rewards/rejected": -6.21875, + "step": 4120 + }, + { + "epoch": 0.15372875993374402, + "grad_norm": 6.581215141816501, + "learning_rate": 4.95618437752978e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.625, + "logps/chosen": -708.0, + "logps/rejected": -836.0, + "loss": 0.4501, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -5.0625, + "rewards/margins": 1.5078125, + "rewards/rejected": -6.5625, + "step": 4130 + }, + { + "epoch": 0.15410098453406787, + "grad_norm": 5.40509165991241, + "learning_rate": 4.955576799287296e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -664.0, + "logps/rejected": -768.0, + "loss": 0.4507, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -4.71875, + "rewards/margins": 1.2734375, + "rewards/rejected": -6.0, + "step": 4140 + }, + { + "epoch": 0.1544732091343917, + "grad_norm": 5.800105089284638, + "learning_rate": 4.954965075205556e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -648.0, + "logps/rejected": -724.0, + "loss": 0.4528, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -4.6875, + "rewards/margins": 1.015625, + "rewards/rejected": -5.71875, + "step": 4150 + }, + { + "epoch": 0.15484543373471552, + "grad_norm": 5.700824199770932, + "learning_rate": 4.954349206317359e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -660.0, + "logps/rejected": -776.0, + "loss": 0.4487, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -4.8125, + "rewards/margins": 1.25, + "rewards/rejected": -6.0625, + "step": 4160 + }, + { + "epoch": 0.15521765833503937, + "grad_norm": 5.951511567106983, + "learning_rate": 4.953729193662498e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.796875, + "logps/chosen": -688.0, + "logps/rejected": -796.0, + "loss": 0.4371, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.09375, + "rewards/margins": 1.25, + "rewards/rejected": -6.34375, + "step": 4170 + }, + { + "epoch": 0.1555898829353632, + "grad_norm": 5.924499558787697, + "learning_rate": 4.953105038287762e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.96875, + "logps/chosen": -680.0, + "logps/rejected": -776.0, + "loss": 0.4463, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -4.8125, + "rewards/margins": 1.1796875, + "rewards/rejected": -6.0, + "step": 4180 + }, + { + "epoch": 0.15596210753568704, + "grad_norm": 4.908287229377769, + "learning_rate": 4.952476741246937e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -652.0, + "logps/rejected": -776.0, + "loss": 0.4318, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -4.84375, + "rewards/margins": 1.2421875, + "rewards/rejected": -6.0625, + "step": 4190 + }, + { + "epoch": 0.15633433213601086, + "grad_norm": 7.085053760895597, + "learning_rate": 4.951844303600798e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.84375, + "logps/chosen": -692.0, + "logps/rejected": -804.0, + "loss": 0.4369, + "rewards/accuracies": 0.75, + "rewards/chosen": -5.03125, + "rewards/margins": 1.234375, + "rewards/rejected": -6.25, + "step": 4200 + }, + { + "epoch": 0.1567065567363347, + "grad_norm": 7.299734039249005, + "learning_rate": 4.951207726417113e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.78125, + "logps/chosen": -688.0, + "logps/rejected": -784.0, + "loss": 0.4433, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -5.03125, + "rewards/margins": 1.203125, + "rewards/rejected": -6.25, + "step": 4210 + }, + { + "epoch": 0.15707878133665854, + "grad_norm": 4.865575958043528, + "learning_rate": 4.950567010770638e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.640625, + "logps/chosen": -652.0, + "logps/rejected": -760.0, + "loss": 0.4335, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -4.78125, + "rewards/margins": 1.25, + "rewards/rejected": -6.0625, + "step": 4220 + }, + { + "epoch": 0.15745100593698239, + "grad_norm": 6.660088178189539, + "learning_rate": 4.949922157743116e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.859375, + "logps/chosen": -696.0, + "logps/rejected": -804.0, + "loss": 0.4695, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.0625, + "rewards/margins": 1.0703125, + "rewards/rejected": -6.125, + "step": 4230 + }, + { + "epoch": 0.1578232305373062, + "grad_norm": 6.516346852986926, + "learning_rate": 4.949273168423277e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.90625, + "logps/chosen": -740.0, + "logps/rejected": -824.0, + "loss": 0.4287, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -5.375, + "rewards/margins": 1.1328125, + "rewards/rejected": -6.5, + "step": 4240 + }, + { + "epoch": 0.15819545513763006, + "grad_norm": 5.779397019489463, + "learning_rate": 4.948620043906832e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.625, + "logps/chosen": -696.0, + "logps/rejected": -816.0, + "loss": 0.4355, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.03125, + "rewards/margins": 1.359375, + "rewards/rejected": -6.40625, + "step": 4250 + }, + { + "epoch": 0.15856767973795388, + "grad_norm": 5.6412601693042355, + "learning_rate": 4.947962785296475e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.8125, + "logps/chosen": -724.0, + "logps/rejected": -852.0, + "loss": 0.4162, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.28125, + "rewards/margins": 1.46875, + "rewards/rejected": -6.75, + "step": 4260 + }, + { + "epoch": 0.1589399043382777, + "grad_norm": 5.212627894939003, + "learning_rate": 4.947301393701881e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.859375, + "logps/chosen": -720.0, + "logps/rejected": -816.0, + "loss": 0.407, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -5.21875, + "rewards/margins": 1.3359375, + "rewards/rejected": -6.5625, + "step": 4270 + }, + { + "epoch": 0.15931212893860155, + "grad_norm": 7.839232390844439, + "learning_rate": 4.946635870239699e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -744.0, + "logps/rejected": -864.0, + "loss": 0.4329, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.625, + "rewards/margins": 1.34375, + "rewards/rejected": -6.96875, + "step": 4280 + }, + { + "epoch": 0.15968435353892538, + "grad_norm": 5.305950553011658, + "learning_rate": 4.945966216033558e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.765625, + "logps/chosen": -752.0, + "logps/rejected": -840.0, + "loss": 0.4365, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.46875, + "rewards/margins": 1.2734375, + "rewards/rejected": -6.71875, + "step": 4290 + }, + { + "epoch": 0.16005657813924923, + "grad_norm": 6.092310208302023, + "learning_rate": 4.945292432214059e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.828125, + "logps/chosen": -724.0, + "logps/rejected": -840.0, + "loss": 0.4135, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.5, + "rewards/margins": 1.296875, + "rewards/rejected": -6.8125, + "step": 4300 + }, + { + "epoch": 0.16042880273957305, + "grad_norm": 7.347003795038706, + "learning_rate": 4.944614519918775e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.46875, + "logps/chosen": -728.0, + "logps/rejected": -872.0, + "loss": 0.4589, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.65625, + "rewards/margins": 1.375, + "rewards/rejected": -7.03125, + "step": 4310 + }, + { + "epoch": 0.1608010273398969, + "grad_norm": 5.525125255334156, + "learning_rate": 4.943932480292251e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.859375, + "logps/chosen": -752.0, + "logps/rejected": -852.0, + "loss": 0.427, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.59375, + "rewards/margins": 1.2890625, + "rewards/rejected": -6.875, + "step": 4320 + }, + { + "epoch": 0.16117325194022072, + "grad_norm": 7.152439469296344, + "learning_rate": 4.943246314485999e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.765625, + "logps/chosen": -740.0, + "logps/rejected": -824.0, + "loss": 0.4411, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -5.34375, + "rewards/margins": 1.171875, + "rewards/rejected": -6.5, + "step": 4330 + }, + { + "epoch": 0.16154547654054457, + "grad_norm": 5.96617445849906, + "learning_rate": 4.942556023658497e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.8125, + "logps/chosen": -724.0, + "logps/rejected": -804.0, + "loss": 0.4236, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.28125, + "rewards/margins": 1.2421875, + "rewards/rejected": -6.5, + "step": 4340 + }, + { + "epoch": 0.1619177011408684, + "grad_norm": 6.880916875781202, + "learning_rate": 4.941861608975188e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -728.0, + "logps/rejected": -880.0, + "loss": 0.4373, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -5.375, + "rewards/margins": 1.65625, + "rewards/rejected": -7.03125, + "step": 4350 + }, + { + "epoch": 0.16228992574119225, + "grad_norm": 5.3375870206157074, + "learning_rate": 4.941163071608479e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.734375, + "logps/chosen": -716.0, + "logps/rejected": -848.0, + "loss": 0.4419, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.34375, + "rewards/margins": 1.59375, + "rewards/rejected": -6.9375, + "step": 4360 + }, + { + "epoch": 0.16266215034151607, + "grad_norm": 5.835199137212704, + "learning_rate": 4.940460412737733e-07, + "logits/chosen": -4.1875, + "logits/rejected": -3.9375, + "logps/chosen": -712.0, + "logps/rejected": -844.0, + "loss": 0.4285, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.34375, + "rewards/margins": 1.4375, + "rewards/rejected": -6.78125, + "step": 4370 + }, + { + "epoch": 0.1630343749418399, + "grad_norm": 5.430840526085023, + "learning_rate": 4.939753633549277e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.78125, + "logps/chosen": -720.0, + "logps/rejected": -840.0, + "loss": 0.4278, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.59375, + "rewards/margins": 1.1484375, + "rewards/rejected": -6.75, + "step": 4380 + }, + { + "epoch": 0.16340659954216374, + "grad_norm": 6.420210453405993, + "learning_rate": 4.93904273523639e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -748.0, + "logps/rejected": -884.0, + "loss": 0.4468, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.6875, + "rewards/margins": 1.3515625, + "rewards/rejected": -7.03125, + "step": 4390 + }, + { + "epoch": 0.16377882414248757, + "grad_norm": 4.821559561645362, + "learning_rate": 4.93832771899931e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -716.0, + "logps/rejected": -800.0, + "loss": 0.438, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.34375, + "rewards/margins": 1.1640625, + "rewards/rejected": -6.5, + "step": 4400 + }, + { + "epoch": 0.16415104874281142, + "grad_norm": 5.9986907160594365, + "learning_rate": 4.937608586045223e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.8125, + "logps/chosen": -740.0, + "logps/rejected": -848.0, + "loss": 0.4329, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.6875, + "rewards/margins": 1.2265625, + "rewards/rejected": -6.90625, + "step": 4410 + }, + { + "epoch": 0.16452327334313524, + "grad_norm": 5.135010039615432, + "learning_rate": 4.936885337588266e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.78125, + "logps/chosen": -744.0, + "logps/rejected": -852.0, + "loss": 0.4462, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.5, + "rewards/margins": 1.2578125, + "rewards/rejected": -6.75, + "step": 4420 + }, + { + "epoch": 0.1648954979434591, + "grad_norm": 4.956690386657707, + "learning_rate": 4.936157974849528e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -736.0, + "logps/rejected": -864.0, + "loss": 0.4538, + "rewards/accuracies": 0.75, + "rewards/chosen": -5.59375, + "rewards/margins": 1.546875, + "rewards/rejected": -7.15625, + "step": 4430 + }, + { + "epoch": 0.1652677225437829, + "grad_norm": 5.3185852565852745, + "learning_rate": 4.93542649905704e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -732.0, + "logps/rejected": -848.0, + "loss": 0.4309, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.59375, + "rewards/margins": 1.265625, + "rewards/rejected": -6.84375, + "step": 4440 + }, + { + "epoch": 0.16563994714410676, + "grad_norm": 5.459650406863102, + "learning_rate": 4.934690911445782e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -708.0, + "logps/rejected": -836.0, + "loss": 0.4136, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.3125, + "rewards/margins": 1.296875, + "rewards/rejected": -6.59375, + "step": 4450 + }, + { + "epoch": 0.1660121717444306, + "grad_norm": 6.218550154302611, + "learning_rate": 4.933951213257669e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -772.0, + "logps/rejected": -892.0, + "loss": 0.455, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -5.75, + "rewards/margins": 1.25, + "rewards/rejected": -7.0, + "step": 4460 + }, + { + "epoch": 0.16638439634475444, + "grad_norm": 5.821381057255457, + "learning_rate": 4.933207405741563e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.921875, + "logps/chosen": -736.0, + "logps/rejected": -832.0, + "loss": 0.4362, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.40625, + "rewards/margins": 1.1484375, + "rewards/rejected": -6.5625, + "step": 4470 + }, + { + "epoch": 0.16675662094507826, + "grad_norm": 5.978481687335648, + "learning_rate": 4.93245949015326e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.796875, + "logps/chosen": -712.0, + "logps/rejected": -828.0, + "loss": 0.4439, + "rewards/accuracies": 0.84375, + "rewards/chosen": -5.21875, + "rewards/margins": 1.3984375, + "rewards/rejected": -6.625, + "step": 4480 + }, + { + "epoch": 0.16712884554540208, + "grad_norm": 5.734106544288039, + "learning_rate": 4.931707467755495e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.75, + "logps/chosen": -748.0, + "logps/rejected": -880.0, + "loss": 0.443, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.46875, + "rewards/margins": 1.484375, + "rewards/rejected": -6.96875, + "step": 4490 + }, + { + "epoch": 0.16750107014572593, + "grad_norm": 5.006028842221933, + "learning_rate": 4.930951339817932e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.703125, + "logps/chosen": -728.0, + "logps/rejected": -844.0, + "loss": 0.4441, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.59375, + "rewards/margins": 1.3828125, + "rewards/rejected": -7.0, + "step": 4500 + }, + { + "epoch": 0.16787329474604976, + "grad_norm": 6.372329177266804, + "learning_rate": 4.93019110761717e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.5625, + "logps/chosen": -696.0, + "logps/rejected": -824.0, + "loss": 0.4451, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.21875, + "rewards/margins": 1.3671875, + "rewards/rejected": -6.5625, + "step": 4510 + }, + { + "epoch": 0.1682455193463736, + "grad_norm": 5.321077186116423, + "learning_rate": 4.929426772436738e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.8125, + "logps/chosen": -704.0, + "logps/rejected": -816.0, + "loss": 0.4601, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.3125, + "rewards/margins": 1.1953125, + "rewards/rejected": -6.5, + "step": 4520 + }, + { + "epoch": 0.16861774394669743, + "grad_norm": 5.780086491592659, + "learning_rate": 4.928658335567088e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.8125, + "logps/chosen": -736.0, + "logps/rejected": -844.0, + "loss": 0.4323, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -5.4375, + "rewards/margins": 1.296875, + "rewards/rejected": -6.71875, + "step": 4530 + }, + { + "epoch": 0.16898996854702128, + "grad_norm": 5.583812927129396, + "learning_rate": 4.927885798305603e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.65625, + "logps/chosen": -736.0, + "logps/rejected": -872.0, + "loss": 0.4313, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -5.4375, + "rewards/margins": 1.625, + "rewards/rejected": -7.0625, + "step": 4540 + }, + { + "epoch": 0.1693621931473451, + "grad_norm": 5.476057964945678, + "learning_rate": 4.927109161956584e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.796875, + "logps/chosen": -752.0, + "logps/rejected": -840.0, + "loss": 0.4495, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.6875, + "rewards/margins": 1.0078125, + "rewards/rejected": -6.71875, + "step": 4550 + }, + { + "epoch": 0.16973441774766895, + "grad_norm": 7.033847374914891, + "learning_rate": 4.926328427831254e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.84375, + "logps/chosen": -732.0, + "logps/rejected": -840.0, + "loss": 0.4375, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.4375, + "rewards/margins": 1.3203125, + "rewards/rejected": -6.75, + "step": 4560 + }, + { + "epoch": 0.17010664234799278, + "grad_norm": 5.1607785323824595, + "learning_rate": 4.925543597247756e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.765625, + "logps/chosen": -724.0, + "logps/rejected": -888.0, + "loss": 0.4275, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -5.4375, + "rewards/margins": 1.6875, + "rewards/rejected": -7.15625, + "step": 4570 + }, + { + "epoch": 0.17047886694831663, + "grad_norm": 5.618927098882581, + "learning_rate": 4.924754671531145e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -728.0, + "logps/rejected": -856.0, + "loss": 0.401, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.5, + "rewards/margins": 1.4375, + "rewards/rejected": -6.9375, + "step": 4580 + }, + { + "epoch": 0.17085109154864045, + "grad_norm": 5.830772890973959, + "learning_rate": 4.923961652013396e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -744.0, + "logps/rejected": -852.0, + "loss": 0.4344, + "rewards/accuracies": 0.75, + "rewards/chosen": -5.5, + "rewards/margins": 1.2890625, + "rewards/rejected": -6.78125, + "step": 4590 + }, + { + "epoch": 0.17122331614896427, + "grad_norm": 6.239813343089435, + "learning_rate": 4.923164540033392e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.8125, + "logps/chosen": -660.0, + "logps/rejected": -748.0, + "loss": 0.4385, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -4.90625, + "rewards/margins": 1.109375, + "rewards/rejected": -6.03125, + "step": 4600 + }, + { + "epoch": 0.17159554074928812, + "grad_norm": 4.968248889246611, + "learning_rate": 4.922363336936926e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.84375, + "logps/chosen": -712.0, + "logps/rejected": -816.0, + "loss": 0.4246, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.21875, + "rewards/margins": 1.3515625, + "rewards/rejected": -6.5625, + "step": 4610 + }, + { + "epoch": 0.17196776534961195, + "grad_norm": 4.957565888521443, + "learning_rate": 4.921558044076696e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.6875, + "logps/chosen": -692.0, + "logps/rejected": -824.0, + "loss": 0.4355, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.15625, + "rewards/margins": 1.453125, + "rewards/rejected": -6.59375, + "step": 4620 + }, + { + "epoch": 0.1723399899499358, + "grad_norm": 5.609337891090924, + "learning_rate": 4.920748662812309e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.796875, + "logps/chosen": -756.0, + "logps/rejected": -848.0, + "loss": 0.4603, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -5.5625, + "rewards/margins": 1.0859375, + "rewards/rejected": -6.65625, + "step": 4630 + }, + { + "epoch": 0.17271221455025962, + "grad_norm": 5.668406015308072, + "learning_rate": 4.919935194510274e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -736.0, + "logps/rejected": -844.0, + "loss": 0.437, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.46875, + "rewards/margins": 1.3359375, + "rewards/rejected": -6.8125, + "step": 4640 + }, + { + "epoch": 0.17308443915058347, + "grad_norm": 5.033927610969634, + "learning_rate": 4.919117640543996e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -748.0, + "logps/rejected": -848.0, + "loss": 0.441, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.46875, + "rewards/margins": 1.3046875, + "rewards/rejected": -6.75, + "step": 4650 + }, + { + "epoch": 0.1734566637509073, + "grad_norm": 5.789939967450309, + "learning_rate": 4.918296002293782e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.765625, + "logps/chosen": -756.0, + "logps/rejected": -836.0, + "loss": 0.4407, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": -5.625, + "rewards/margins": 0.9296875, + "rewards/rejected": -6.5625, + "step": 4660 + }, + { + "epoch": 0.17382888835123114, + "grad_norm": 5.828642956821937, + "learning_rate": 4.917470281146836e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.640625, + "logps/chosen": -728.0, + "logps/rejected": -864.0, + "loss": 0.4362, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.625, + "rewards/margins": 1.46875, + "rewards/rejected": -7.09375, + "step": 4670 + }, + { + "epoch": 0.17420111295155497, + "grad_norm": 6.765149293815343, + "learning_rate": 4.916640478497249e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.703125, + "logps/chosen": -740.0, + "logps/rejected": -856.0, + "loss": 0.4191, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.4375, + "rewards/margins": 1.390625, + "rewards/rejected": -6.84375, + "step": 4680 + }, + { + "epoch": 0.17457333755187882, + "grad_norm": 6.558713025037335, + "learning_rate": 4.91580659574601e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -772.0, + "logps/rejected": -880.0, + "loss": 0.4419, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.8125, + "rewards/margins": 1.28125, + "rewards/rejected": -7.09375, + "step": 4690 + }, + { + "epoch": 0.17494556215220264, + "grad_norm": 6.356682875651491, + "learning_rate": 4.914968634300993e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -732.0, + "logps/rejected": -900.0, + "loss": 0.4479, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.59375, + "rewards/margins": 1.65625, + "rewards/rejected": -7.25, + "step": 4700 + }, + { + "epoch": 0.17531778675252646, + "grad_norm": 6.113981869788465, + "learning_rate": 4.914126595576957e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.796875, + "logps/chosen": -740.0, + "logps/rejected": -844.0, + "loss": 0.4237, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.375, + "rewards/margins": 1.3203125, + "rewards/rejected": -6.6875, + "step": 4710 + }, + { + "epoch": 0.1756900113528503, + "grad_norm": 6.024599076238062, + "learning_rate": 4.913280480995547e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.8125, + "logps/chosen": -752.0, + "logps/rejected": -864.0, + "loss": 0.454, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.53125, + "rewards/margins": 1.25, + "rewards/rejected": -6.78125, + "step": 4720 + }, + { + "epoch": 0.17606223595317413, + "grad_norm": 8.184884356586648, + "learning_rate": 4.912430291985291e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.71875, + "logps/chosen": -732.0, + "logps/rejected": -844.0, + "loss": 0.4376, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.5, + "rewards/margins": 1.4140625, + "rewards/rejected": -6.90625, + "step": 4730 + }, + { + "epoch": 0.17643446055349798, + "grad_norm": 6.813540017641614, + "learning_rate": 4.911576029981591e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.5, + "logps/chosen": -756.0, + "logps/rejected": -904.0, + "loss": 0.4263, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.8125, + "rewards/margins": 1.453125, + "rewards/rejected": -7.25, + "step": 4740 + }, + { + "epoch": 0.1768066851538218, + "grad_norm": 6.563348472736759, + "learning_rate": 4.91071769642673e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -736.0, + "logps/rejected": -864.0, + "loss": 0.4304, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.4375, + "rewards/margins": 1.40625, + "rewards/rejected": -6.84375, + "step": 4750 + }, + { + "epoch": 0.17717890975414566, + "grad_norm": 5.825920486652797, + "learning_rate": 4.909855292769863e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -704.0, + "logps/rejected": -848.0, + "loss": 0.4513, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.125, + "rewards/margins": 1.5703125, + "rewards/rejected": -6.71875, + "step": 4760 + }, + { + "epoch": 0.17755113435446948, + "grad_norm": 7.050683574404367, + "learning_rate": 4.908988820467018e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.8125, + "logps/chosen": -728.0, + "logps/rejected": -832.0, + "loss": 0.4345, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.375, + "rewards/margins": 1.34375, + "rewards/rejected": -6.71875, + "step": 4770 + }, + { + "epoch": 0.17792335895479333, + "grad_norm": 5.943063447979361, + "learning_rate": 4.908118280981091e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.6875, + "logps/chosen": -728.0, + "logps/rejected": -848.0, + "loss": 0.4401, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.40625, + "rewards/margins": 1.4296875, + "rewards/rejected": -6.8125, + "step": 4780 + }, + { + "epoch": 0.17829558355511715, + "grad_norm": 5.5061494436906235, + "learning_rate": 4.907243675781847e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.484375, + "logps/chosen": -728.0, + "logps/rejected": -840.0, + "loss": 0.4248, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.5, + "rewards/margins": 1.34375, + "rewards/rejected": -6.84375, + "step": 4790 + }, + { + "epoch": 0.178667808155441, + "grad_norm": 6.4331453916200685, + "learning_rate": 4.90636500634591e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -772.0, + "logps/rejected": -884.0, + "loss": 0.4209, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.84375, + "rewards/margins": 1.1953125, + "rewards/rejected": -7.03125, + "step": 4800 + }, + { + "epoch": 0.17904003275576483, + "grad_norm": 6.851308791165571, + "learning_rate": 4.905482274156773e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -756.0, + "logps/rejected": -892.0, + "loss": 0.4402, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.71875, + "rewards/margins": 1.421875, + "rewards/rejected": -7.125, + "step": 4810 + }, + { + "epoch": 0.17941225735608865, + "grad_norm": 6.118848900478091, + "learning_rate": 4.904595480704784e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.734375, + "logps/chosen": -716.0, + "logps/rejected": -856.0, + "loss": 0.453, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.5, + "rewards/margins": 1.34375, + "rewards/rejected": -6.84375, + "step": 4820 + }, + { + "epoch": 0.1797844819564125, + "grad_norm": 6.02105358245143, + "learning_rate": 4.903704627487148e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.828125, + "logps/chosen": -732.0, + "logps/rejected": -832.0, + "loss": 0.4205, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.53125, + "rewards/margins": 1.0625, + "rewards/rejected": -6.59375, + "step": 4830 + }, + { + "epoch": 0.18015670655673632, + "grad_norm": 5.612262348422165, + "learning_rate": 4.902809716007923e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.78125, + "logps/chosen": -740.0, + "logps/rejected": -856.0, + "loss": 0.4487, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.71875, + "rewards/margins": 1.328125, + "rewards/rejected": -7.0625, + "step": 4840 + }, + { + "epoch": 0.18052893115706017, + "grad_norm": 6.268376969175533, + "learning_rate": 4.901910747778023e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.90625, + "logps/chosen": -724.0, + "logps/rejected": -836.0, + "loss": 0.4451, + "rewards/accuracies": 0.71875, + "rewards/chosen": -5.4375, + "rewards/margins": 1.2578125, + "rewards/rejected": -6.6875, + "step": 4850 + }, + { + "epoch": 0.180901155757384, + "grad_norm": 6.493458128988398, + "learning_rate": 4.901007724315209e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.828125, + "logps/chosen": -732.0, + "logps/rejected": -856.0, + "loss": 0.4204, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.3125, + "rewards/margins": 1.390625, + "rewards/rejected": -6.6875, + "step": 4860 + }, + { + "epoch": 0.18127338035770785, + "grad_norm": 5.5586289014407555, + "learning_rate": 4.900100647144085e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.8125, + "logps/chosen": -764.0, + "logps/rejected": -868.0, + "loss": 0.4445, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -5.65625, + "rewards/margins": 1.234375, + "rewards/rejected": -6.875, + "step": 4870 + }, + { + "epoch": 0.18164560495803167, + "grad_norm": 6.08621931637, + "learning_rate": 4.899189517796105e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -740.0, + "logps/rejected": -872.0, + "loss": 0.4362, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.6875, + "rewards/margins": 1.4453125, + "rewards/rejected": -7.125, + "step": 4880 + }, + { + "epoch": 0.18201782955835552, + "grad_norm": 5.543220496129898, + "learning_rate": 4.898274337809562e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.84375, + "logps/chosen": -764.0, + "logps/rejected": -916.0, + "loss": 0.4234, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.6875, + "rewards/margins": 1.640625, + "rewards/rejected": -7.34375, + "step": 4890 + }, + { + "epoch": 0.18239005415867934, + "grad_norm": 6.093505029561755, + "learning_rate": 4.897355108729585e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.671875, + "logps/chosen": -764.0, + "logps/rejected": -892.0, + "loss": 0.4264, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.8125, + "rewards/margins": 1.40625, + "rewards/rejected": -7.21875, + "step": 4900 + }, + { + "epoch": 0.1827622787590032, + "grad_norm": 8.016223200841504, + "learning_rate": 4.896431832108143e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.625, + "logps/chosen": -764.0, + "logps/rejected": -888.0, + "loss": 0.4505, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.90625, + "rewards/margins": 1.3359375, + "rewards/rejected": -7.25, + "step": 4910 + }, + { + "epoch": 0.18313450335932702, + "grad_norm": 5.795693174310396, + "learning_rate": 4.895504509504038e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.734375, + "logps/chosen": -784.0, + "logps/rejected": -872.0, + "loss": 0.4154, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.8125, + "rewards/margins": 1.1953125, + "rewards/rejected": -7.03125, + "step": 4920 + }, + { + "epoch": 0.18350672795965087, + "grad_norm": 5.095859257672974, + "learning_rate": 4.894573142482902e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.515625, + "logps/chosen": -744.0, + "logps/rejected": -880.0, + "loss": 0.4319, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.59375, + "rewards/margins": 1.421875, + "rewards/rejected": -7.03125, + "step": 4930 + }, + { + "epoch": 0.1838789525599747, + "grad_norm": 5.635877599621557, + "learning_rate": 4.893637732617196e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -740.0, + "logps/rejected": -856.0, + "loss": 0.4294, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.5, + "rewards/margins": 1.25, + "rewards/rejected": -6.75, + "step": 4940 + }, + { + "epoch": 0.1842511771602985, + "grad_norm": 5.488866266104458, + "learning_rate": 4.892698281486206e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -792.0, + "logps/rejected": -916.0, + "loss": 0.4184, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.9375, + "rewards/margins": 1.5078125, + "rewards/rejected": -7.4375, + "step": 4950 + }, + { + "epoch": 0.18462340176062236, + "grad_norm": 5.6824898097068575, + "learning_rate": 4.89175479067604e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.78125, + "logps/chosen": -744.0, + "logps/rejected": -884.0, + "loss": 0.4338, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.6875, + "rewards/margins": 1.484375, + "rewards/rejected": -7.15625, + "step": 4960 + }, + { + "epoch": 0.18499562636094619, + "grad_norm": 6.015013465582994, + "learning_rate": 4.890807261779631e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.84375, + "logps/chosen": -748.0, + "logps/rejected": -880.0, + "loss": 0.4398, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.625, + "rewards/margins": 1.3828125, + "rewards/rejected": -7.03125, + "step": 4970 + }, + { + "epoch": 0.18536785096127004, + "grad_norm": 7.496988606774147, + "learning_rate": 4.889855696396722e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -724.0, + "logps/rejected": -844.0, + "loss": 0.4411, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -5.53125, + "rewards/margins": 1.15625, + "rewards/rejected": -6.6875, + "step": 4980 + }, + { + "epoch": 0.18574007556159386, + "grad_norm": 7.139245875854106, + "learning_rate": 4.88890009613388e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.8125, + "logps/chosen": -736.0, + "logps/rejected": -856.0, + "loss": 0.4222, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.625, + "rewards/margins": 1.3515625, + "rewards/rejected": -6.96875, + "step": 4990 + }, + { + "epoch": 0.1861123001619177, + "grad_norm": 5.895380777165287, + "learning_rate": 4.887940462604475e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.375, + "logps/chosen": -752.0, + "logps/rejected": -896.0, + "loss": 0.4428, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -5.59375, + "rewards/margins": 1.5625, + "rewards/rejected": -7.15625, + "step": 5000 + }, + { + "epoch": 0.1861123001619177, + "eval_logits/chosen": -3.8125, + "eval_logits/rejected": -3.625, + "eval_logps/chosen": -752.0, + "eval_logps/rejected": -844.0, + "eval_loss": 0.4641050100326538, + "eval_rewards/accuracies": 0.7533489465713501, + "eval_rewards/chosen": -5.53125, + "eval_rewards/margins": 1.203125, + "eval_rewards/rejected": -6.75, + "eval_runtime": 6274.7166, + "eval_samples_per_second": 30.449, + "eval_steps_per_second": 0.476, + "step": 5000 + }, + { + "epoch": 0.18648452476224153, + "grad_norm": 5.725945474561893, + "learning_rate": 4.886976797428694e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -740.0, + "logps/rejected": -844.0, + "loss": 0.4427, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.5, + "rewards/margins": 1.2109375, + "rewards/rejected": -6.71875, + "step": 5010 + }, + { + "epoch": 0.18685674936256538, + "grad_norm": 6.832914843918203, + "learning_rate": 4.886009102233528e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -724.0, + "logps/rejected": -844.0, + "loss": 0.445, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.28125, + "rewards/margins": 1.4921875, + "rewards/rejected": -6.78125, + "step": 5020 + }, + { + "epoch": 0.1872289739628892, + "grad_norm": 6.7518725830357935, + "learning_rate": 4.88503737865277e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -728.0, + "logps/rejected": -856.0, + "loss": 0.4369, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.5625, + "rewards/margins": 1.34375, + "rewards/rejected": -6.90625, + "step": 5030 + }, + { + "epoch": 0.18760119856321306, + "grad_norm": 5.582802264723439, + "learning_rate": 4.884061628327018e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.640625, + "logps/chosen": -752.0, + "logps/rejected": -872.0, + "loss": 0.4411, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.71875, + "rewards/margins": 1.3359375, + "rewards/rejected": -7.03125, + "step": 5040 + }, + { + "epoch": 0.18797342316353688, + "grad_norm": 6.326476485002667, + "learning_rate": 4.883081852903665e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.703125, + "logps/chosen": -728.0, + "logps/rejected": -860.0, + "loss": 0.399, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.40625, + "rewards/margins": 1.5, + "rewards/rejected": -6.875, + "step": 5050 + }, + { + "epoch": 0.1883456477638607, + "grad_norm": 5.907025640438917, + "learning_rate": 4.882098054036901e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -760.0, + "logps/rejected": -872.0, + "loss": 0.4461, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -5.75, + "rewards/margins": 1.390625, + "rewards/rejected": -7.125, + "step": 5060 + }, + { + "epoch": 0.18871787236418455, + "grad_norm": 5.292269064459508, + "learning_rate": 4.881110233387711e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.6875, + "logps/chosen": -740.0, + "logps/rejected": -876.0, + "loss": 0.4024, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.5, + "rewards/margins": 1.515625, + "rewards/rejected": -7.0, + "step": 5070 + }, + { + "epoch": 0.18909009696450838, + "grad_norm": 6.46023311091003, + "learning_rate": 4.880118392623869e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.640625, + "logps/chosen": -716.0, + "logps/rejected": -852.0, + "loss": 0.4429, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.375, + "rewards/margins": 1.5859375, + "rewards/rejected": -6.96875, + "step": 5080 + }, + { + "epoch": 0.18946232156483223, + "grad_norm": 6.0498403978099295, + "learning_rate": 4.879122533419933e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.59375, + "logps/chosen": -748.0, + "logps/rejected": -872.0, + "loss": 0.4278, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.6875, + "rewards/margins": 1.484375, + "rewards/rejected": -7.1875, + "step": 5090 + }, + { + "epoch": 0.18983454616515605, + "grad_norm": 6.917627910061831, + "learning_rate": 4.87812265745725e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.703125, + "logps/chosen": -736.0, + "logps/rejected": -832.0, + "loss": 0.4388, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -5.59375, + "rewards/margins": 1.2109375, + "rewards/rejected": -6.8125, + "step": 5100 + }, + { + "epoch": 0.1902067707654799, + "grad_norm": 5.854938819403657, + "learning_rate": 4.877118766423945e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.59375, + "logps/chosen": -732.0, + "logps/rejected": -864.0, + "loss": 0.4207, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.5, + "rewards/margins": 1.2890625, + "rewards/rejected": -6.78125, + "step": 5110 + }, + { + "epoch": 0.19057899536580372, + "grad_norm": 6.628461291408429, + "learning_rate": 4.876110862014926e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.59375, + "logps/chosen": -776.0, + "logps/rejected": -908.0, + "loss": 0.4375, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -5.90625, + "rewards/margins": 1.4296875, + "rewards/rejected": -7.34375, + "step": 5120 + }, + { + "epoch": 0.19095121996612757, + "grad_norm": 6.828581273814096, + "learning_rate": 4.875098945931873e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.65625, + "logps/chosen": -740.0, + "logps/rejected": -876.0, + "loss": 0.4178, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.65625, + "rewards/margins": 1.59375, + "rewards/rejected": -7.25, + "step": 5130 + }, + { + "epoch": 0.1913234445664514, + "grad_norm": 7.889843254400278, + "learning_rate": 4.874083019883242e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.5625, + "logps/chosen": -740.0, + "logps/rejected": -856.0, + "loss": 0.4515, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.78125, + "rewards/margins": 1.203125, + "rewards/rejected": -6.96875, + "step": 5140 + }, + { + "epoch": 0.19169566916677525, + "grad_norm": 6.252180105350043, + "learning_rate": 4.873063085584256e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.765625, + "logps/chosen": -740.0, + "logps/rejected": -848.0, + "loss": 0.4389, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.6875, + "rewards/margins": 1.15625, + "rewards/rejected": -6.84375, + "step": 5150 + }, + { + "epoch": 0.19206789376709907, + "grad_norm": 7.349031142114769, + "learning_rate": 4.872039144756907e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.78125, + "logps/chosen": -704.0, + "logps/rejected": -836.0, + "loss": 0.4165, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -5.28125, + "rewards/margins": 1.46875, + "rewards/rejected": -6.75, + "step": 5160 + }, + { + "epoch": 0.1924401183674229, + "grad_norm": 5.828708637714437, + "learning_rate": 4.871011199129953e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.703125, + "logps/chosen": -744.0, + "logps/rejected": -872.0, + "loss": 0.4294, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -5.71875, + "rewards/margins": 1.390625, + "rewards/rejected": -7.125, + "step": 5170 + }, + { + "epoch": 0.19281234296774674, + "grad_norm": 8.44398046890037, + "learning_rate": 4.869979250438911e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.546875, + "logps/chosen": -732.0, + "logps/rejected": -892.0, + "loss": 0.4269, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.6875, + "rewards/margins": 1.53125, + "rewards/rejected": -7.21875, + "step": 5180 + }, + { + "epoch": 0.19318456756807056, + "grad_norm": 6.091867051627648, + "learning_rate": 4.868943300426057e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -728.0, + "logps/rejected": -840.0, + "loss": 0.461, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -5.53125, + "rewards/margins": 1.2421875, + "rewards/rejected": -6.75, + "step": 5190 + }, + { + "epoch": 0.19355679216839441, + "grad_norm": 8.020364430687428, + "learning_rate": 4.867903350840423e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.75, + "logps/chosen": -724.0, + "logps/rejected": -804.0, + "loss": 0.437, + "rewards/accuracies": 0.71875, + "rewards/chosen": -5.40625, + "rewards/margins": 1.109375, + "rewards/rejected": -6.5, + "step": 5200 + }, + { + "epoch": 0.19392901676871824, + "grad_norm": 6.6012859196720886, + "learning_rate": 4.866859403437795e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.78125, + "logps/chosen": -776.0, + "logps/rejected": -892.0, + "loss": 0.4028, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.75, + "rewards/margins": 1.390625, + "rewards/rejected": -7.125, + "step": 5210 + }, + { + "epoch": 0.1943012413690421, + "grad_norm": 6.373502263083278, + "learning_rate": 4.865811459980705e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.796875, + "logps/chosen": -764.0, + "logps/rejected": -864.0, + "loss": 0.415, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.625, + "rewards/margins": 1.3359375, + "rewards/rejected": -6.96875, + "step": 5220 + }, + { + "epoch": 0.1946734659693659, + "grad_norm": 6.487507137121604, + "learning_rate": 4.864759522238435e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -716.0, + "logps/rejected": -824.0, + "loss": 0.4563, + "rewards/accuracies": 0.75, + "rewards/chosen": -5.46875, + "rewards/margins": 1.3125, + "rewards/rejected": -6.78125, + "step": 5230 + }, + { + "epoch": 0.19504569056968976, + "grad_norm": 4.992462986944008, + "learning_rate": 4.86370359198701e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.859375, + "logps/chosen": -748.0, + "logps/rejected": -884.0, + "loss": 0.4317, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -5.46875, + "rewards/margins": 1.6796875, + "rewards/rejected": -7.15625, + "step": 5240 + }, + { + "epoch": 0.19541791517001358, + "grad_norm": 5.488033190904126, + "learning_rate": 4.862643671009193e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.8125, + "logps/chosen": -744.0, + "logps/rejected": -852.0, + "loss": 0.434, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -5.8125, + "rewards/margins": 1.1796875, + "rewards/rejected": -7.0, + "step": 5250 + }, + { + "epoch": 0.19579013977033743, + "grad_norm": 5.8995603064893665, + "learning_rate": 4.861579761094491e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -736.0, + "logps/rejected": -864.0, + "loss": 0.422, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.65625, + "rewards/margins": 1.5, + "rewards/rejected": -7.15625, + "step": 5260 + }, + { + "epoch": 0.19616236437066126, + "grad_norm": 5.920617882957075, + "learning_rate": 4.860511864039139e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.5625, + "logps/chosen": -740.0, + "logps/rejected": -880.0, + "loss": 0.4507, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.53125, + "rewards/margins": 1.515625, + "rewards/rejected": -7.03125, + "step": 5270 + }, + { + "epoch": 0.19653458897098508, + "grad_norm": 5.994071618489967, + "learning_rate": 4.859439981646106e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -676.0, + "logps/rejected": -804.0, + "loss": 0.4096, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -4.875, + "rewards/margins": 1.6328125, + "rewards/rejected": -6.5, + "step": 5280 + }, + { + "epoch": 0.19690681357130893, + "grad_norm": 5.9493842806654165, + "learning_rate": 4.858364115725091e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -732.0, + "logps/rejected": -856.0, + "loss": 0.4245, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.5, + "rewards/margins": 1.3359375, + "rewards/rejected": -6.8125, + "step": 5290 + }, + { + "epoch": 0.19727903817163275, + "grad_norm": 7.092812702959431, + "learning_rate": 4.857284268092516e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.765625, + "logps/chosen": -732.0, + "logps/rejected": -864.0, + "loss": 0.437, + "rewards/accuracies": 0.75, + "rewards/chosen": -5.75, + "rewards/margins": 1.4140625, + "rewards/rejected": -7.15625, + "step": 5300 + }, + { + "epoch": 0.1976512627719566, + "grad_norm": 5.159932194970655, + "learning_rate": 4.856200440571529e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.515625, + "logps/chosen": -712.0, + "logps/rejected": -856.0, + "loss": 0.4128, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.4375, + "rewards/margins": 1.671875, + "rewards/rejected": -7.125, + "step": 5310 + }, + { + "epoch": 0.19802348737228043, + "grad_norm": 7.17408143427172, + "learning_rate": 4.855112634991994e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -716.0, + "logps/rejected": -832.0, + "loss": 0.4257, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.375, + "rewards/margins": 1.28125, + "rewards/rejected": -6.65625, + "step": 5320 + }, + { + "epoch": 0.19839571197260428, + "grad_norm": 5.990694261618531, + "learning_rate": 4.854020853190492e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.6875, + "logps/chosen": -756.0, + "logps/rejected": -892.0, + "loss": 0.434, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.6875, + "rewards/margins": 1.5234375, + "rewards/rejected": -7.21875, + "step": 5330 + }, + { + "epoch": 0.1987679365729281, + "grad_norm": 7.813568158112514, + "learning_rate": 4.85292509701032e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -776.0, + "logps/rejected": -880.0, + "loss": 0.4224, + "rewards/accuracies": 0.75, + "rewards/chosen": -5.875, + "rewards/margins": 1.203125, + "rewards/rejected": -7.0625, + "step": 5340 + }, + { + "epoch": 0.19914016117325195, + "grad_norm": 6.149892459263521, + "learning_rate": 4.85182536830148e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.734375, + "logps/chosen": -720.0, + "logps/rejected": -876.0, + "loss": 0.417, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.53125, + "rewards/margins": 1.5703125, + "rewards/rejected": -7.125, + "step": 5350 + }, + { + "epoch": 0.19951238577357577, + "grad_norm": 8.445225407753806, + "learning_rate": 4.850721668920684e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -700.0, + "logps/rejected": -816.0, + "loss": 0.4408, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.1875, + "rewards/margins": 1.4375, + "rewards/rejected": -6.625, + "step": 5360 + }, + { + "epoch": 0.19988461037389962, + "grad_norm": 5.7207478835359185, + "learning_rate": 4.84961400073135e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -700.0, + "logps/rejected": -812.0, + "loss": 0.423, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.25, + "rewards/margins": 1.328125, + "rewards/rejected": -6.5625, + "step": 5370 + }, + { + "epoch": 0.20025683497422345, + "grad_norm": 6.368419048288751, + "learning_rate": 4.848502365603593e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.984375, + "logps/chosen": -704.0, + "logps/rejected": -824.0, + "loss": 0.4271, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.1875, + "rewards/margins": 1.3125, + "rewards/rejected": -6.5, + "step": 5380 + }, + { + "epoch": 0.20062905957454727, + "grad_norm": 6.409322920707655, + "learning_rate": 4.847386765414227e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.78125, + "logps/chosen": -764.0, + "logps/rejected": -852.0, + "loss": 0.4119, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.6875, + "rewards/margins": 1.2890625, + "rewards/rejected": -7.0, + "step": 5390 + }, + { + "epoch": 0.20100128417487112, + "grad_norm": 6.9305270596595125, + "learning_rate": 4.84626720204676e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.671875, + "logps/chosen": -784.0, + "logps/rejected": -896.0, + "loss": 0.4108, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -5.9375, + "rewards/margins": 1.234375, + "rewards/rejected": -7.1875, + "step": 5400 + }, + { + "epoch": 0.20137350877519494, + "grad_norm": 6.427921369036785, + "learning_rate": 4.845143677391392e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -760.0, + "logps/rejected": -892.0, + "loss": 0.4023, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.65625, + "rewards/margins": 1.421875, + "rewards/rejected": -7.09375, + "step": 5410 + }, + { + "epoch": 0.2017457333755188, + "grad_norm": 8.00449296114199, + "learning_rate": 4.84401619334501e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -768.0, + "logps/rejected": -880.0, + "loss": 0.4492, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.8125, + "rewards/margins": 1.2578125, + "rewards/rejected": -7.0625, + "step": 5420 + }, + { + "epoch": 0.20211795797584262, + "grad_norm": 11.180049033802964, + "learning_rate": 4.842884751811185e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.875, + "logps/chosen": -760.0, + "logps/rejected": -892.0, + "loss": 0.4279, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.8125, + "rewards/margins": 1.5, + "rewards/rejected": -7.3125, + "step": 5430 + }, + { + "epoch": 0.20249018257616647, + "grad_norm": 6.5389454437663765, + "learning_rate": 4.841749354700172e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.8125, + "logps/chosen": -780.0, + "logps/rejected": -880.0, + "loss": 0.4376, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.75, + "rewards/margins": 1.34375, + "rewards/rejected": -7.09375, + "step": 5440 + }, + { + "epoch": 0.2028624071764903, + "grad_norm": 7.879662554611795, + "learning_rate": 4.840610003928902e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.953125, + "logps/chosen": -800.0, + "logps/rejected": -916.0, + "loss": 0.4231, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.96875, + "rewards/margins": 1.375, + "rewards/rejected": -7.34375, + "step": 5450 + }, + { + "epoch": 0.20323463177681414, + "grad_norm": 6.805461144988961, + "learning_rate": 4.839466701420985e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.84375, + "logps/chosen": -804.0, + "logps/rejected": -912.0, + "loss": 0.4605, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.0, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.375, + "step": 5460 + }, + { + "epoch": 0.20360685637713796, + "grad_norm": 5.647063109039535, + "learning_rate": 4.838319449106697e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.875, + "logps/chosen": -736.0, + "logps/rejected": -844.0, + "loss": 0.4248, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.59375, + "rewards/margins": 1.203125, + "rewards/rejected": -6.78125, + "step": 5470 + }, + { + "epoch": 0.2039790809774618, + "grad_norm": 6.272824298573251, + "learning_rate": 4.837168248922986e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -796.0, + "logps/rejected": -908.0, + "loss": 0.4104, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.9375, + "rewards/margins": 1.296875, + "rewards/rejected": -7.25, + "step": 5480 + }, + { + "epoch": 0.20435130557778564, + "grad_norm": 6.782748839764093, + "learning_rate": 4.836013102813467e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.65625, + "logps/chosen": -808.0, + "logps/rejected": -928.0, + "loss": 0.4153, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.125, + "rewards/margins": 1.5546875, + "rewards/rejected": -7.65625, + "step": 5490 + }, + { + "epoch": 0.20472353017810946, + "grad_norm": 6.682845177389023, + "learning_rate": 4.834854012728412e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -780.0, + "logps/rejected": -888.0, + "loss": 0.4471, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.875, + "rewards/margins": 1.265625, + "rewards/rejected": -7.15625, + "step": 5500 + }, + { + "epoch": 0.2050957547784333, + "grad_norm": 7.451998046730023, + "learning_rate": 4.833690980624758e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.796875, + "logps/chosen": -748.0, + "logps/rejected": -840.0, + "loss": 0.4428, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.59375, + "rewards/margins": 1.1484375, + "rewards/rejected": -6.71875, + "step": 5510 + }, + { + "epoch": 0.20546797937875713, + "grad_norm": 5.674745956020104, + "learning_rate": 4.832524008466091e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.796875, + "logps/chosen": -764.0, + "logps/rejected": -872.0, + "loss": 0.4299, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -5.71875, + "rewards/margins": 1.3046875, + "rewards/rejected": -7.03125, + "step": 5520 + }, + { + "epoch": 0.20584020397908098, + "grad_norm": 5.55775427016974, + "learning_rate": 4.831353098222655e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -772.0, + "logps/rejected": -912.0, + "loss": 0.4426, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.90625, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.4375, + "step": 5530 + }, + { + "epoch": 0.2062124285794048, + "grad_norm": 6.307489786502535, + "learning_rate": 4.83017825187134e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.65625, + "logps/chosen": -756.0, + "logps/rejected": -904.0, + "loss": 0.4143, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -5.625, + "rewards/margins": 1.53125, + "rewards/rejected": -7.1875, + "step": 5540 + }, + { + "epoch": 0.20658465317972866, + "grad_norm": 6.242121457615083, + "learning_rate": 4.828999471395679e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -816.0, + "logps/rejected": -932.0, + "loss": 0.4179, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.25, + "rewards/margins": 1.40625, + "rewards/rejected": -7.65625, + "step": 5550 + }, + { + "epoch": 0.20695687778005248, + "grad_norm": 6.8558002150321595, + "learning_rate": 4.827816758785853e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -812.0, + "logps/rejected": -912.0, + "loss": 0.4186, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.25, + "rewards/margins": 1.1640625, + "rewards/rejected": -7.40625, + "step": 5560 + }, + { + "epoch": 0.20732910238037633, + "grad_norm": 7.3299794584129545, + "learning_rate": 4.826630116038677e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.890625, + "logps/chosen": -800.0, + "logps/rejected": -904.0, + "loss": 0.4278, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.125, + "rewards/margins": 1.3671875, + "rewards/rejected": -7.5, + "step": 5570 + }, + { + "epoch": 0.20770132698070015, + "grad_norm": 6.5494812484368286, + "learning_rate": 4.825439545157603e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.859375, + "logps/chosen": -772.0, + "logps/rejected": -896.0, + "loss": 0.4552, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.75, + "rewards/margins": 1.3671875, + "rewards/rejected": -7.125, + "step": 5580 + }, + { + "epoch": 0.208073551581024, + "grad_norm": 5.472702241786248, + "learning_rate": 4.824245048152715e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.84375, + "logps/chosen": -748.0, + "logps/rejected": -856.0, + "loss": 0.4388, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.59375, + "rewards/margins": 1.203125, + "rewards/rejected": -6.78125, + "step": 5590 + }, + { + "epoch": 0.20844577618134782, + "grad_norm": 5.476594065118695, + "learning_rate": 4.823046627040725e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.796875, + "logps/chosen": -748.0, + "logps/rejected": -856.0, + "loss": 0.4481, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -5.6875, + "rewards/margins": 1.2890625, + "rewards/rejected": -7.0, + "step": 5600 + }, + { + "epoch": 0.20881800078167165, + "grad_norm": 5.988377094099928, + "learning_rate": 4.821844283844972e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -756.0, + "logps/rejected": -896.0, + "loss": 0.4269, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.59375, + "rewards/margins": 1.4453125, + "rewards/rejected": -7.03125, + "step": 5610 + }, + { + "epoch": 0.2091902253819955, + "grad_norm": 6.901883765962637, + "learning_rate": 4.820638020595414e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.6875, + "logps/chosen": -784.0, + "logps/rejected": -900.0, + "loss": 0.437, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.96875, + "rewards/margins": 1.234375, + "rewards/rejected": -7.1875, + "step": 5620 + }, + { + "epoch": 0.20956244998231932, + "grad_norm": 7.104942828033639, + "learning_rate": 4.819427839328632e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.6875, + "logps/chosen": -760.0, + "logps/rejected": -872.0, + "loss": 0.434, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -5.875, + "rewards/margins": 1.4140625, + "rewards/rejected": -7.28125, + "step": 5630 + }, + { + "epoch": 0.20993467458264317, + "grad_norm": 5.872803815540037, + "learning_rate": 4.818213742087815e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.6875, + "logps/chosen": -788.0, + "logps/rejected": -912.0, + "loss": 0.4201, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.0, + "rewards/margins": 1.484375, + "rewards/rejected": -7.5, + "step": 5640 + }, + { + "epoch": 0.210306899182967, + "grad_norm": 7.01609954309212, + "learning_rate": 4.81699573092277e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.84375, + "logps/chosen": -768.0, + "logps/rejected": -888.0, + "loss": 0.4127, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.90625, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.3125, + "step": 5650 + }, + { + "epoch": 0.21067912378329084, + "grad_norm": 6.5011599034795555, + "learning_rate": 4.815773807889907e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.859375, + "logps/chosen": -748.0, + "logps/rejected": -892.0, + "loss": 0.4149, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.9375, + "rewards/margins": 1.4375, + "rewards/rejected": -7.375, + "step": 5660 + }, + { + "epoch": 0.21105134838361467, + "grad_norm": 5.619096198602472, + "learning_rate": 4.814547975052244e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.859375, + "logps/chosen": -804.0, + "logps/rejected": -916.0, + "loss": 0.4433, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.1875, + "rewards/margins": 1.109375, + "rewards/rejected": -7.28125, + "step": 5670 + }, + { + "epoch": 0.21142357298393852, + "grad_norm": 8.68391073705843, + "learning_rate": 4.813318234479401e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.84375, + "logps/chosen": -772.0, + "logps/rejected": -892.0, + "loss": 0.4318, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.90625, + "rewards/margins": 1.328125, + "rewards/rejected": -7.21875, + "step": 5680 + }, + { + "epoch": 0.21179579758426234, + "grad_norm": 7.399522959076703, + "learning_rate": 4.812084588247592e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -792.0, + "logps/rejected": -904.0, + "loss": 0.4214, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.125, + "rewards/margins": 1.1796875, + "rewards/rejected": -7.3125, + "step": 5690 + }, + { + "epoch": 0.2121680221845862, + "grad_norm": 6.271029452514774, + "learning_rate": 4.810847038439626e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.6875, + "logps/chosen": -772.0, + "logps/rejected": -884.0, + "loss": 0.4406, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.03125, + "rewards/margins": 1.171875, + "rewards/rejected": -7.1875, + "step": 5700 + }, + { + "epoch": 0.21254024678491001, + "grad_norm": 5.679004085620849, + "learning_rate": 4.809605587144904e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.625, + "logps/chosen": -796.0, + "logps/rejected": -936.0, + "loss": 0.4407, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.25, + "rewards/margins": 1.4921875, + "rewards/rejected": -7.75, + "step": 5710 + }, + { + "epoch": 0.21291247138523384, + "grad_norm": 6.064190117711728, + "learning_rate": 4.808360236459412e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -788.0, + "logps/rejected": -928.0, + "loss": 0.4149, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.0625, + "rewards/margins": 1.578125, + "rewards/rejected": -7.625, + "step": 5720 + }, + { + "epoch": 0.2132846959855577, + "grad_norm": 5.34081328966269, + "learning_rate": 4.807110988485721e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.765625, + "logps/chosen": -804.0, + "logps/rejected": -956.0, + "loss": 0.4336, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.21875, + "rewards/margins": 1.703125, + "rewards/rejected": -7.90625, + "step": 5730 + }, + { + "epoch": 0.2136569205858815, + "grad_norm": 5.142041992023566, + "learning_rate": 4.805857845332983e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.921875, + "logps/chosen": -820.0, + "logps/rejected": -940.0, + "loss": 0.3852, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.3125, + "rewards/margins": 1.3359375, + "rewards/rejected": -7.65625, + "step": 5740 + }, + { + "epoch": 0.21402914518620536, + "grad_norm": 5.5563528347744215, + "learning_rate": 4.804600809116925e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.921875, + "logps/chosen": -800.0, + "logps/rejected": -940.0, + "loss": 0.4178, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.0625, + "rewards/margins": 1.5859375, + "rewards/rejected": -7.65625, + "step": 5750 + }, + { + "epoch": 0.21440136978652918, + "grad_norm": 7.038481769129602, + "learning_rate": 4.803339881959845e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -768.0, + "logps/rejected": -888.0, + "loss": 0.4363, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.78125, + "rewards/margins": 1.4921875, + "rewards/rejected": -7.25, + "step": 5760 + }, + { + "epoch": 0.21477359438685303, + "grad_norm": 7.308586162270306, + "learning_rate": 4.802075065990613e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -804.0, + "logps/rejected": -876.0, + "loss": 0.4378, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -6.09375, + "rewards/margins": 1.03125, + "rewards/rejected": -7.125, + "step": 5770 + }, + { + "epoch": 0.21514581898717686, + "grad_norm": 6.442639898934758, + "learning_rate": 4.800806363344663e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.78125, + "logps/chosen": -784.0, + "logps/rejected": -900.0, + "loss": 0.4456, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.125, + "rewards/margins": 1.1328125, + "rewards/rejected": -7.25, + "step": 5780 + }, + { + "epoch": 0.2155180435875007, + "grad_norm": 5.545584310833082, + "learning_rate": 4.799533776163993e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.71875, + "logps/chosen": -772.0, + "logps/rejected": -900.0, + "loss": 0.4252, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.0625, + "rewards/margins": 1.296875, + "rewards/rejected": -7.34375, + "step": 5790 + }, + { + "epoch": 0.21589026818782453, + "grad_norm": 6.0723328777733885, + "learning_rate": 4.798257306597156e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -804.0, + "logps/rejected": -908.0, + "loss": 0.4043, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.15625, + "rewards/margins": 1.078125, + "rewards/rejected": -7.21875, + "step": 5800 + }, + { + "epoch": 0.21626249278814838, + "grad_norm": 6.224187576028383, + "learning_rate": 4.796976956799264e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -824.0, + "logps/rejected": -940.0, + "loss": 0.4392, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.375, + "rewards/margins": 1.3046875, + "rewards/rejected": -7.6875, + "step": 5810 + }, + { + "epoch": 0.2166347173884722, + "grad_norm": 6.411589765759591, + "learning_rate": 4.795692728931977e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.75, + "logps/chosen": -820.0, + "logps/rejected": -952.0, + "loss": 0.4378, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.40625, + "rewards/margins": 1.453125, + "rewards/rejected": -7.84375, + "step": 5820 + }, + { + "epoch": 0.21700694198879603, + "grad_norm": 5.717319870956347, + "learning_rate": 4.794404625163503e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.8125, + "logps/chosen": -804.0, + "logps/rejected": -912.0, + "loss": 0.4175, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -6.15625, + "rewards/margins": 1.21875, + "rewards/rejected": -7.375, + "step": 5830 + }, + { + "epoch": 0.21737916658911988, + "grad_norm": 4.959897879077896, + "learning_rate": 4.793112647668594e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.859375, + "logps/chosen": -744.0, + "logps/rejected": -888.0, + "loss": 0.4231, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.65625, + "rewards/margins": 1.5546875, + "rewards/rejected": -7.21875, + "step": 5840 + }, + { + "epoch": 0.2177513911894437, + "grad_norm": 6.534440761415513, + "learning_rate": 4.791816798628544e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.71875, + "logps/chosen": -760.0, + "logps/rejected": -896.0, + "loss": 0.4282, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.75, + "rewards/margins": 1.609375, + "rewards/rejected": -7.375, + "step": 5850 + }, + { + "epoch": 0.21812361578976755, + "grad_norm": 6.128108343721542, + "learning_rate": 4.790517080231179e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.84375, + "logps/chosen": -832.0, + "logps/rejected": -940.0, + "loss": 0.4541, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.4140625, + "rewards/rejected": -7.71875, + "step": 5860 + }, + { + "epoch": 0.21849584039009137, + "grad_norm": 8.19536165570185, + "learning_rate": 4.789213494670864e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -796.0, + "logps/rejected": -876.0, + "loss": 0.4372, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -5.9375, + "rewards/margins": 1.1015625, + "rewards/rejected": -7.03125, + "step": 5870 + }, + { + "epoch": 0.21886806499041522, + "grad_norm": 5.179616613587669, + "learning_rate": 4.787906044148489e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -736.0, + "logps/rejected": -868.0, + "loss": 0.4207, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.3125, + "rewards/margins": 1.6015625, + "rewards/rejected": -6.90625, + "step": 5880 + }, + { + "epoch": 0.21924028959073905, + "grad_norm": 5.650400881885734, + "learning_rate": 4.786594730871467e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -800.0, + "logps/rejected": -916.0, + "loss": 0.4115, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -5.96875, + "rewards/margins": 1.421875, + "rewards/rejected": -7.375, + "step": 5890 + }, + { + "epoch": 0.2196125141910629, + "grad_norm": 6.225431096268802, + "learning_rate": 4.785279557053739e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.8125, + "logps/chosen": -756.0, + "logps/rejected": -888.0, + "loss": 0.4517, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.875, + "rewards/margins": 1.296875, + "rewards/rejected": -7.15625, + "step": 5900 + }, + { + "epoch": 0.21998473879138672, + "grad_norm": 5.890086153536098, + "learning_rate": 4.78396052491576e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.765625, + "logps/chosen": -756.0, + "logps/rejected": -908.0, + "loss": 0.4171, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -5.84375, + "rewards/margins": 1.6015625, + "rewards/rejected": -7.46875, + "step": 5910 + }, + { + "epoch": 0.22035696339171057, + "grad_norm": 5.111685546177177, + "learning_rate": 4.782637636684499e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -772.0, + "logps/rejected": -900.0, + "loss": 0.4081, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.96875, + "rewards/margins": 1.4375, + "rewards/rejected": -7.40625, + "step": 5920 + }, + { + "epoch": 0.2207291879920344, + "grad_norm": 6.367102774287387, + "learning_rate": 4.781310894593437e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.921875, + "logps/chosen": -816.0, + "logps/rejected": -916.0, + "loss": 0.4363, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.0546875, + "rewards/rejected": -7.375, + "step": 5930 + }, + { + "epoch": 0.22110141259235822, + "grad_norm": 6.732957539192681, + "learning_rate": 4.779980300882559e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -788.0, + "logps/rejected": -948.0, + "loss": 0.4073, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.1875, + "rewards/margins": 1.640625, + "rewards/rejected": -7.84375, + "step": 5940 + }, + { + "epoch": 0.22147363719268207, + "grad_norm": 6.607356044114583, + "learning_rate": 4.778645857798357e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.703125, + "logps/chosen": -752.0, + "logps/rejected": -856.0, + "loss": 0.4256, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.0625, + "rewards/margins": 0.98828125, + "rewards/rejected": -7.03125, + "step": 5950 + }, + { + "epoch": 0.2218458617930059, + "grad_norm": 6.235417597487092, + "learning_rate": 4.777307567593818e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -768.0, + "logps/rejected": -896.0, + "loss": 0.429, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -5.84375, + "rewards/margins": 1.4453125, + "rewards/rejected": -7.28125, + "step": 5960 + }, + { + "epoch": 0.22221808639332974, + "grad_norm": 6.5454457344607, + "learning_rate": 4.775965432528426e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -808.0, + "logps/rejected": -932.0, + "loss": 0.4138, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -6.25, + "rewards/margins": 1.4140625, + "rewards/rejected": -7.65625, + "step": 5970 + }, + { + "epoch": 0.22259031099365356, + "grad_norm": 6.331675313138522, + "learning_rate": 4.774619454868156e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -768.0, + "logps/rejected": -912.0, + "loss": 0.4224, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.0, + "rewards/margins": 1.6328125, + "rewards/rejected": -7.625, + "step": 5980 + }, + { + "epoch": 0.2229625355939774, + "grad_norm": 5.751801674711064, + "learning_rate": 4.773269636885471e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -792.0, + "logps/rejected": -944.0, + "loss": 0.4083, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.0, + "rewards/margins": 1.5546875, + "rewards/rejected": -7.53125, + "step": 5990 + }, + { + "epoch": 0.22333476019430124, + "grad_norm": 5.848378657103043, + "learning_rate": 4.771915980859318e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.90625, + "logps/chosen": -804.0, + "logps/rejected": -908.0, + "loss": 0.424, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.0625, + "rewards/margins": 1.2578125, + "rewards/rejected": -7.3125, + "step": 6000 + }, + { + "epoch": 0.22370698479462509, + "grad_norm": 6.26990076919701, + "learning_rate": 4.770558489075124e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.9375, + "logps/chosen": -808.0, + "logps/rejected": -928.0, + "loss": 0.4112, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.09375, + "rewards/margins": 1.4921875, + "rewards/rejected": -7.59375, + "step": 6010 + }, + { + "epoch": 0.2240792093949489, + "grad_norm": 7.548283260332925, + "learning_rate": 4.76919716382479e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.8125, + "logps/chosen": -816.0, + "logps/rejected": -924.0, + "loss": 0.4202, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.21875, + "rewards/margins": 1.4765625, + "rewards/rejected": -7.6875, + "step": 6020 + }, + { + "epoch": 0.22445143399527276, + "grad_norm": 5.6872152480335165, + "learning_rate": 4.7678320074066925e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.828125, + "logps/chosen": -804.0, + "logps/rejected": -944.0, + "loss": 0.399, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.09375, + "rewards/margins": 1.6875, + "rewards/rejected": -7.78125, + "step": 6030 + }, + { + "epoch": 0.22482365859559658, + "grad_norm": 7.868638878167568, + "learning_rate": 4.766463022125673e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.96875, + "logps/chosen": -800.0, + "logps/rejected": -908.0, + "loss": 0.4192, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.0625, + "rewards/margins": 1.53125, + "rewards/rejected": -7.59375, + "step": 6040 + }, + { + "epoch": 0.22519588319592043, + "grad_norm": 12.322515515850705, + "learning_rate": 4.765090210293039e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.90625, + "logps/chosen": -808.0, + "logps/rejected": -924.0, + "loss": 0.4352, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.28125, + "rewards/margins": 1.359375, + "rewards/rejected": -7.65625, + "step": 6050 + }, + { + "epoch": 0.22556810779624425, + "grad_norm": 5.527528242493144, + "learning_rate": 4.76371357422656e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.875, + "logps/chosen": -768.0, + "logps/rejected": -896.0, + "loss": 0.4129, + "rewards/accuracies": 0.75, + "rewards/chosen": -5.90625, + "rewards/margins": 1.3125, + "rewards/rejected": -7.21875, + "step": 6060 + }, + { + "epoch": 0.22594033239656808, + "grad_norm": 6.530297056526231, + "learning_rate": 4.7623331162504585e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.921875, + "logps/chosen": -760.0, + "logps/rejected": -900.0, + "loss": 0.4273, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.9375, + "rewards/margins": 1.5, + "rewards/rejected": -7.4375, + "step": 6070 + }, + { + "epoch": 0.22631255699689193, + "grad_norm": 4.898526690129243, + "learning_rate": 4.7609488386954137e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.859375, + "logps/chosen": -752.0, + "logps/rejected": -888.0, + "loss": 0.4315, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.78125, + "rewards/margins": 1.3046875, + "rewards/rejected": -7.09375, + "step": 6080 + }, + { + "epoch": 0.22668478159721575, + "grad_norm": 6.132011810945695, + "learning_rate": 4.759560743898551e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.8125, + "logps/chosen": -828.0, + "logps/rejected": -936.0, + "loss": 0.4062, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.0625, + "rewards/margins": 1.546875, + "rewards/rejected": -7.59375, + "step": 6090 + }, + { + "epoch": 0.2270570061975396, + "grad_norm": 5.023249321329233, + "learning_rate": 4.758168834203439e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.84375, + "logps/chosen": -788.0, + "logps/rejected": -924.0, + "loss": 0.3967, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.0, + "rewards/margins": 1.6171875, + "rewards/rejected": -7.625, + "step": 6100 + }, + { + "epoch": 0.22742923079786342, + "grad_norm": 8.489424090439904, + "learning_rate": 4.7567731119600916e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.703125, + "logps/chosen": -752.0, + "logps/rejected": -932.0, + "loss": 0.4144, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.8125, + "rewards/margins": 1.8125, + "rewards/rejected": -7.59375, + "step": 6110 + }, + { + "epoch": 0.22780145539818727, + "grad_norm": 6.383030066432269, + "learning_rate": 4.755373579524957e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.796875, + "logps/chosen": -796.0, + "logps/rejected": -920.0, + "loss": 0.4446, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -6.25, + "rewards/margins": 1.28125, + "rewards/rejected": -7.5625, + "step": 6120 + }, + { + "epoch": 0.2281736799985111, + "grad_norm": 5.122973760511068, + "learning_rate": 4.753970239260916e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -824.0, + "logps/rejected": -924.0, + "loss": 0.4561, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.46875, + "rewards/margins": 1.1640625, + "rewards/rejected": -7.625, + "step": 6130 + }, + { + "epoch": 0.22854590459883495, + "grad_norm": 5.306429521480451, + "learning_rate": 4.752563093537279e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.765625, + "logps/chosen": -760.0, + "logps/rejected": -896.0, + "loss": 0.4162, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.84375, + "rewards/margins": 1.4765625, + "rewards/rejected": -7.34375, + "step": 6140 + }, + { + "epoch": 0.22891812919915877, + "grad_norm": 5.682541141240045, + "learning_rate": 4.751152144729781e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.859375, + "logps/chosen": -804.0, + "logps/rejected": -912.0, + "loss": 0.4244, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.15625, + "rewards/margins": 1.3515625, + "rewards/rejected": -7.5, + "step": 6150 + }, + { + "epoch": 0.22929035379948262, + "grad_norm": 6.436204816144081, + "learning_rate": 4.749737395220578e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.875, + "logps/chosen": -792.0, + "logps/rejected": -928.0, + "loss": 0.4059, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -5.90625, + "rewards/margins": 1.5703125, + "rewards/rejected": -7.5, + "step": 6160 + }, + { + "epoch": 0.22966257839980644, + "grad_norm": 5.94076333669987, + "learning_rate": 4.748318847398242e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.6875, + "logps/chosen": -788.0, + "logps/rejected": -924.0, + "loss": 0.4211, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.0, + "rewards/margins": 1.5, + "rewards/rejected": -7.5, + "step": 6170 + }, + { + "epoch": 0.23003480300013027, + "grad_norm": 4.959858507272183, + "learning_rate": 4.746896503657759e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.53125, + "logps/chosen": -752.0, + "logps/rejected": -892.0, + "loss": 0.4279, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -5.78125, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.3125, + "step": 6180 + }, + { + "epoch": 0.23040702760045412, + "grad_norm": 5.1969834553735135, + "learning_rate": 4.745470366400525e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.765625, + "logps/chosen": -792.0, + "logps/rejected": -916.0, + "loss": 0.408, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.84375, + "rewards/margins": 1.5546875, + "rewards/rejected": -7.375, + "step": 6190 + }, + { + "epoch": 0.23077925220077794, + "grad_norm": 6.445248230897788, + "learning_rate": 4.744040438034338e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.84375, + "logps/chosen": -784.0, + "logps/rejected": -884.0, + "loss": 0.4294, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.9375, + "rewards/margins": 1.34375, + "rewards/rejected": -7.28125, + "step": 6200 + }, + { + "epoch": 0.2311514768011018, + "grad_norm": 5.817894647914261, + "learning_rate": 4.7426067209733977e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.84375, + "logps/chosen": -760.0, + "logps/rejected": -864.0, + "loss": 0.4281, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.59375, + "rewards/margins": 1.3125, + "rewards/rejected": -6.90625, + "step": 6210 + }, + { + "epoch": 0.2315237014014256, + "grad_norm": 6.926605729963249, + "learning_rate": 4.7411692176383013e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.75, + "logps/chosen": -784.0, + "logps/rejected": -924.0, + "loss": 0.4083, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.9375, + "rewards/margins": 1.734375, + "rewards/rejected": -7.6875, + "step": 6220 + }, + { + "epoch": 0.23189592600174946, + "grad_norm": 5.851495287373424, + "learning_rate": 4.739727930456037e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.828125, + "logps/chosen": -836.0, + "logps/rejected": -964.0, + "loss": 0.4141, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.40625, + "rewards/margins": 1.515625, + "rewards/rejected": -7.90625, + "step": 6230 + }, + { + "epoch": 0.2322681506020733, + "grad_norm": 5.771059985402298, + "learning_rate": 4.738282861859982e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.71875, + "logps/chosen": -812.0, + "logps/rejected": -964.0, + "loss": 0.4299, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.34375, + "rewards/margins": 1.53125, + "rewards/rejected": -7.875, + "step": 6240 + }, + { + "epoch": 0.23264037520239714, + "grad_norm": 5.489245233557804, + "learning_rate": 4.7368340142898983e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -764.0, + "logps/rejected": -864.0, + "loss": 0.4349, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.9375, + "rewards/margins": 1.1953125, + "rewards/rejected": -7.125, + "step": 6250 + }, + { + "epoch": 0.23301259980272096, + "grad_norm": 6.09632578490293, + "learning_rate": 4.7353813901919283e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.890625, + "logps/chosen": -760.0, + "logps/rejected": -892.0, + "loss": 0.4199, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -5.90625, + "rewards/margins": 1.421875, + "rewards/rejected": -7.3125, + "step": 6260 + }, + { + "epoch": 0.2333848244030448, + "grad_norm": 6.522106259492334, + "learning_rate": 4.7339249920185885e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.8125, + "logps/chosen": -816.0, + "logps/rejected": -964.0, + "loss": 0.4152, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.28125, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.65625, + "step": 6270 + }, + { + "epoch": 0.23375704900336863, + "grad_norm": 5.71911587721337, + "learning_rate": 4.73246482222877e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.8125, + "logps/chosen": -808.0, + "logps/rejected": -956.0, + "loss": 0.3941, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.375, + "rewards/margins": 1.578125, + "rewards/rejected": -7.9375, + "step": 6280 + }, + { + "epoch": 0.23412927360369246, + "grad_norm": 7.391656384188058, + "learning_rate": 4.73100088328773e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.84375, + "logps/chosen": -836.0, + "logps/rejected": -952.0, + "loss": 0.4293, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.34375, + "rewards/margins": 1.3125, + "rewards/rejected": -7.6875, + "step": 6290 + }, + { + "epoch": 0.2345014982040163, + "grad_norm": 5.114771672962533, + "learning_rate": 4.72953317766709e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.75, + "logps/chosen": -792.0, + "logps/rejected": -928.0, + "loss": 0.4358, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.03125, + "rewards/margins": 1.4453125, + "rewards/rejected": -7.46875, + "step": 6300 + }, + { + "epoch": 0.23487372280434013, + "grad_norm": 5.680627173402873, + "learning_rate": 4.7280617078448294e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.8125, + "logps/chosen": -784.0, + "logps/rejected": -916.0, + "loss": 0.4297, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.0625, + "rewards/margins": 1.3046875, + "rewards/rejected": -7.375, + "step": 6310 + }, + { + "epoch": 0.23524594740466398, + "grad_norm": 5.933723635892915, + "learning_rate": 4.726586476305285e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.8125, + "logps/chosen": -772.0, + "logps/rejected": -892.0, + "loss": 0.4288, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -5.90625, + "rewards/margins": 1.484375, + "rewards/rejected": -7.40625, + "step": 6320 + }, + { + "epoch": 0.2356181720049878, + "grad_norm": 5.22075790109594, + "learning_rate": 4.725107485539143e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -824.0, + "logps/rejected": -952.0, + "loss": 0.4388, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.3125, + "rewards/margins": 1.53125, + "rewards/rejected": -7.8125, + "step": 6330 + }, + { + "epoch": 0.23599039660531165, + "grad_norm": 5.4705830083365194, + "learning_rate": 4.723624738043438e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.8125, + "logps/chosen": -816.0, + "logps/rejected": -924.0, + "loss": 0.4292, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.34375, + "rewards/margins": 1.25, + "rewards/rejected": -7.59375, + "step": 6340 + }, + { + "epoch": 0.23636262120563548, + "grad_norm": 5.866031715136251, + "learning_rate": 4.7221382363215447e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -832.0, + "logps/rejected": -960.0, + "loss": 0.4357, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.59375, + "rewards/margins": 1.46875, + "rewards/rejected": -8.0625, + "step": 6350 + }, + { + "epoch": 0.23673484580595933, + "grad_norm": 5.799551873821158, + "learning_rate": 4.72064798288318e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -828.0, + "logps/rejected": -924.0, + "loss": 0.4073, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.4375, + "rewards/margins": 1.2109375, + "rewards/rejected": -7.625, + "step": 6360 + }, + { + "epoch": 0.23710707040628315, + "grad_norm": 6.53867763652818, + "learning_rate": 4.7191539802443906e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -808.0, + "logps/rejected": -956.0, + "loss": 0.4169, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.5234375, + "rewards/rejected": -7.84375, + "step": 6370 + }, + { + "epoch": 0.237479295006607, + "grad_norm": 5.611965867491773, + "learning_rate": 4.717656230927557e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -820.0, + "logps/rejected": -948.0, + "loss": 0.427, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.34375, + "rewards/margins": 1.5234375, + "rewards/rejected": -7.875, + "step": 6380 + }, + { + "epoch": 0.23785151960693082, + "grad_norm": 6.7368464566277035, + "learning_rate": 4.7161547374613817e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.65625, + "logps/chosen": -816.0, + "logps/rejected": -932.0, + "loss": 0.4174, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.25, + "rewards/margins": 1.4609375, + "rewards/rejected": -7.71875, + "step": 6390 + }, + { + "epoch": 0.23822374420725465, + "grad_norm": 6.3362822283526175, + "learning_rate": 4.714649502380893e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -808.0, + "logps/rejected": -940.0, + "loss": 0.4183, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.21875, + "rewards/margins": 1.421875, + "rewards/rejected": -7.625, + "step": 6400 + }, + { + "epoch": 0.2385959688075785, + "grad_norm": 6.36364465001046, + "learning_rate": 4.7131405282274315e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -836.0, + "logps/rejected": -912.0, + "loss": 0.448, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.53125, + "rewards/margins": 1.0703125, + "rewards/rejected": -7.59375, + "step": 6410 + }, + { + "epoch": 0.23896819340790232, + "grad_norm": 5.118738021745892, + "learning_rate": 4.7116278175486546e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.484375, + "logps/chosen": -784.0, + "logps/rejected": -904.0, + "loss": 0.4465, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.1875, + "rewards/margins": 1.328125, + "rewards/rejected": -7.53125, + "step": 6420 + }, + { + "epoch": 0.23934041800822617, + "grad_norm": 4.7360386085029536, + "learning_rate": 4.7101113728985253e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.828125, + "logps/chosen": -792.0, + "logps/rejected": -920.0, + "loss": 0.4212, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.03125, + "rewards/margins": 1.3828125, + "rewards/rejected": -7.40625, + "step": 6430 + }, + { + "epoch": 0.23971264260855, + "grad_norm": 5.656427810531944, + "learning_rate": 4.7085911968373135e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.765625, + "logps/chosen": -788.0, + "logps/rejected": -904.0, + "loss": 0.4055, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.125, + "rewards/margins": 1.3515625, + "rewards/rejected": -7.46875, + "step": 6440 + }, + { + "epoch": 0.24008486720887384, + "grad_norm": 5.47845254609012, + "learning_rate": 4.7070672919315856e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -816.0, + "logps/rejected": -912.0, + "loss": 0.4203, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.21875, + "rewards/margins": 1.234375, + "rewards/rejected": -7.4375, + "step": 6450 + }, + { + "epoch": 0.24045709180919767, + "grad_norm": 6.347307076455001, + "learning_rate": 4.705539660754207e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.59375, + "logps/chosen": -816.0, + "logps/rejected": -944.0, + "loss": 0.4281, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.34375, + "rewards/margins": 1.4296875, + "rewards/rejected": -7.78125, + "step": 6460 + }, + { + "epoch": 0.24082931640952152, + "grad_norm": 5.266163040844717, + "learning_rate": 4.704008305884332e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.71875, + "logps/chosen": -832.0, + "logps/rejected": -932.0, + "loss": 0.4424, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.21875, + "rewards/margins": 1.484375, + "rewards/rejected": -7.6875, + "step": 6470 + }, + { + "epoch": 0.24120154100984534, + "grad_norm": 6.02256912553513, + "learning_rate": 4.7024732299074023e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -804.0, + "logps/rejected": -920.0, + "loss": 0.4236, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.1875, + "rewards/margins": 1.359375, + "rewards/rejected": -7.53125, + "step": 6480 + }, + { + "epoch": 0.2415737656101692, + "grad_norm": 7.541961383816745, + "learning_rate": 4.7009344354151424e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.734375, + "logps/chosen": -808.0, + "logps/rejected": -924.0, + "loss": 0.4243, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.375, + "rewards/rejected": -7.6875, + "step": 6490 + }, + { + "epoch": 0.241945990210493, + "grad_norm": 7.430317560153076, + "learning_rate": 4.6993919250055557e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -812.0, + "logps/rejected": -928.0, + "loss": 0.4389, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.125, + "rewards/margins": 1.34375, + "rewards/rejected": -7.46875, + "step": 6500 + }, + { + "epoch": 0.24231821481081683, + "grad_norm": 6.407746800397953, + "learning_rate": 4.6978457012829174e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.796875, + "logps/chosen": -836.0, + "logps/rejected": -956.0, + "loss": 0.4015, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.46875, + "rewards/margins": 1.4375, + "rewards/rejected": -7.90625, + "step": 6510 + }, + { + "epoch": 0.24269043941114068, + "grad_norm": 6.252142015750858, + "learning_rate": 4.6962957668577736e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.78125, + "logps/chosen": -844.0, + "logps/rejected": -944.0, + "loss": 0.4302, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.46875, + "rewards/margins": 1.2578125, + "rewards/rejected": -7.71875, + "step": 6520 + }, + { + "epoch": 0.2430626640114645, + "grad_norm": 5.497439476416673, + "learning_rate": 4.694742124346934e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -812.0, + "logps/rejected": -924.0, + "loss": 0.4382, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.28125, + "rewards/margins": 1.28125, + "rewards/rejected": -7.5625, + "step": 6530 + }, + { + "epoch": 0.24343488861178836, + "grad_norm": 6.490216840077626, + "learning_rate": 4.6931847763734703e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.8125, + "logps/chosen": -796.0, + "logps/rejected": -920.0, + "loss": 0.4289, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.09375, + "rewards/margins": 1.3203125, + "rewards/rejected": -7.40625, + "step": 6540 + }, + { + "epoch": 0.24380711321211218, + "grad_norm": 5.615847818685157, + "learning_rate": 4.6916237255667093e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.671875, + "logps/chosen": -780.0, + "logps/rejected": -920.0, + "loss": 0.4257, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.96875, + "rewards/margins": 1.546875, + "rewards/rejected": -7.5, + "step": 6550 + }, + { + "epoch": 0.24417933781243603, + "grad_norm": 5.682486676946517, + "learning_rate": 4.6900589745622294e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -788.0, + "logps/rejected": -912.0, + "loss": 0.4311, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.09375, + "rewards/margins": 1.265625, + "rewards/rejected": -7.375, + "step": 6560 + }, + { + "epoch": 0.24455156241275985, + "grad_norm": 5.820232103868232, + "learning_rate": 4.688490526001856e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.65625, + "logps/chosen": -848.0, + "logps/rejected": -960.0, + "loss": 0.4161, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.78125, + "rewards/margins": 1.265625, + "rewards/rejected": -8.0625, + "step": 6570 + }, + { + "epoch": 0.2449237870130837, + "grad_norm": 8.169062220330268, + "learning_rate": 4.6869183825336587e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.546875, + "logps/chosen": -800.0, + "logps/rejected": -952.0, + "loss": 0.4553, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.34375, + "rewards/margins": 1.3828125, + "rewards/rejected": -7.71875, + "step": 6580 + }, + { + "epoch": 0.24529601161340753, + "grad_norm": 5.721998116739456, + "learning_rate": 4.685342546811943e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -760.0, + "logps/rejected": -912.0, + "loss": 0.4278, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.96875, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.5, + "step": 6590 + }, + { + "epoch": 0.24566823621373138, + "grad_norm": 6.2761689310538555, + "learning_rate": 4.6837630214972514e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.765625, + "logps/chosen": -844.0, + "logps/rejected": -932.0, + "loss": 0.4474, + "rewards/accuracies": 0.6937500238418579, + "rewards/chosen": -6.375, + "rewards/margins": 1.0625, + "rewards/rejected": -7.4375, + "step": 6600 + }, + { + "epoch": 0.2460404608140552, + "grad_norm": 5.900942155872346, + "learning_rate": 4.6821798092563514e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.84375, + "logps/chosen": -816.0, + "logps/rejected": -908.0, + "loss": 0.4077, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.15625, + "rewards/margins": 1.203125, + "rewards/rejected": -7.375, + "step": 6610 + }, + { + "epoch": 0.24641268541437902, + "grad_norm": 6.641446753014602, + "learning_rate": 4.680592912762238e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.875, + "logps/chosen": -828.0, + "logps/rejected": -964.0, + "loss": 0.4063, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.4375, + "rewards/margins": 1.53125, + "rewards/rejected": -7.9375, + "step": 6620 + }, + { + "epoch": 0.24678491001470287, + "grad_norm": 9.449492598841816, + "learning_rate": 4.6790023346941274e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.75, + "logps/chosen": -844.0, + "logps/rejected": -964.0, + "loss": 0.4193, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.46875, + "rewards/margins": 1.484375, + "rewards/rejected": -7.96875, + "step": 6630 + }, + { + "epoch": 0.2471571346150267, + "grad_norm": 7.714903830083636, + "learning_rate": 4.677408077737449e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.9375, + "logps/chosen": -808.0, + "logps/rejected": -932.0, + "loss": 0.441, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.28125, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.6875, + "step": 6640 + }, + { + "epoch": 0.24752935921535055, + "grad_norm": 5.4441759336675535, + "learning_rate": 4.6758101445838457e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -844.0, + "logps/rejected": -936.0, + "loss": 0.4336, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -6.53125, + "rewards/margins": 1.2265625, + "rewards/rejected": -7.75, + "step": 6650 + }, + { + "epoch": 0.24790158381567437, + "grad_norm": 7.739944946158606, + "learning_rate": 4.6742085379311645e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.890625, + "logps/chosen": -812.0, + "logps/rejected": -932.0, + "loss": 0.4067, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.28125, + "rewards/margins": 1.3203125, + "rewards/rejected": -7.59375, + "step": 6660 + }, + { + "epoch": 0.24827380841599822, + "grad_norm": 5.9997287712072005, + "learning_rate": 4.6726032604834566e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.734375, + "logps/chosen": -828.0, + "logps/rejected": -952.0, + "loss": 0.4163, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.40625, + "rewards/margins": 1.4609375, + "rewards/rejected": -7.84375, + "step": 6670 + }, + { + "epoch": 0.24864603301632204, + "grad_norm": 5.798419256905425, + "learning_rate": 4.67099431495097e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.890625, + "logps/chosen": -840.0, + "logps/rejected": -948.0, + "loss": 0.4266, + "rewards/accuracies": 0.71875, + "rewards/chosen": -6.5625, + "rewards/margins": 1.15625, + "rewards/rejected": -7.71875, + "step": 6680 + }, + { + "epoch": 0.2490182576166459, + "grad_norm": 8.196094364451225, + "learning_rate": 4.669381704050146e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.875, + "logps/chosen": -820.0, + "logps/rejected": -904.0, + "loss": 0.4254, + "rewards/accuracies": 0.71875, + "rewards/chosen": -6.4375, + "rewards/margins": 1.1328125, + "rewards/rejected": -7.5625, + "step": 6690 + }, + { + "epoch": 0.24939048221696972, + "grad_norm": 5.894388057612442, + "learning_rate": 4.6677654305036136e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -780.0, + "logps/rejected": -920.0, + "loss": 0.4404, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.09375, + "rewards/margins": 1.453125, + "rewards/rejected": -7.5625, + "step": 6700 + }, + { + "epoch": 0.24976270681729357, + "grad_norm": 5.60483072522514, + "learning_rate": 4.666145497040186e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.59375, + "logps/chosen": -804.0, + "logps/rejected": -936.0, + "loss": 0.4155, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.25, + "rewards/margins": 1.546875, + "rewards/rejected": -7.78125, + "step": 6710 + }, + { + "epoch": 0.2501349314176174, + "grad_norm": 5.961096567165508, + "learning_rate": 4.664521906394856e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.578125, + "logps/chosen": -812.0, + "logps/rejected": -952.0, + "loss": 0.4256, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.21875, + "rewards/margins": 1.6640625, + "rewards/rejected": -7.875, + "step": 6720 + }, + { + "epoch": 0.2505071560179412, + "grad_norm": 9.91923906368576, + "learning_rate": 4.662894661308789e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.796875, + "logps/chosen": -796.0, + "logps/rejected": -892.0, + "loss": 0.4507, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -6.25, + "rewards/margins": 1.28125, + "rewards/rejected": -7.53125, + "step": 6730 + }, + { + "epoch": 0.25087938061826504, + "grad_norm": 5.83173760425227, + "learning_rate": 4.6612637645293243e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.703125, + "logps/chosen": -788.0, + "logps/rejected": -928.0, + "loss": 0.4398, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.0625, + "rewards/margins": 1.390625, + "rewards/rejected": -7.4375, + "step": 6740 + }, + { + "epoch": 0.2512516052185889, + "grad_norm": 6.10559542732337, + "learning_rate": 4.659629218809963e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.609375, + "logps/chosen": -788.0, + "logps/rejected": -928.0, + "loss": 0.4107, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.09375, + "rewards/margins": 1.578125, + "rewards/rejected": -7.6875, + "step": 6750 + }, + { + "epoch": 0.25162382981891274, + "grad_norm": 5.355304419131932, + "learning_rate": 4.657991026910366e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.734375, + "logps/chosen": -824.0, + "logps/rejected": -944.0, + "loss": 0.4118, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.4375, + "rewards/margins": 1.4296875, + "rewards/rejected": -7.875, + "step": 6760 + }, + { + "epoch": 0.25199605441923656, + "grad_norm": 6.250452222122328, + "learning_rate": 4.656349191596355e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.71875, + "logps/chosen": -812.0, + "logps/rejected": -952.0, + "loss": 0.4031, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.3125, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.84375, + "step": 6770 + }, + { + "epoch": 0.2523682790195604, + "grad_norm": 7.464677342725597, + "learning_rate": 4.6547037156398976e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.625, + "logps/chosen": -720.0, + "logps/rejected": -856.0, + "loss": 0.4148, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.59375, + "rewards/margins": 1.46875, + "rewards/rejected": -7.0625, + "step": 6780 + }, + { + "epoch": 0.25274050361988426, + "grad_norm": 6.004157006557244, + "learning_rate": 4.653054601819112e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -760.0, + "logps/rejected": -912.0, + "loss": 0.4222, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.78125, + "rewards/margins": 1.6875, + "rewards/rejected": -7.46875, + "step": 6790 + }, + { + "epoch": 0.2531127282202081, + "grad_norm": 6.554328420068891, + "learning_rate": 4.651401852918256e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.78125, + "logps/chosen": -800.0, + "logps/rejected": -952.0, + "loss": 0.4463, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.125, + "rewards/margins": 1.609375, + "rewards/rejected": -7.75, + "step": 6800 + }, + { + "epoch": 0.2534849528205319, + "grad_norm": 6.002968003872758, + "learning_rate": 4.6497454717277253e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -788.0, + "logps/rejected": -904.0, + "loss": 0.4184, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.03125, + "rewards/margins": 1.328125, + "rewards/rejected": -7.375, + "step": 6810 + }, + { + "epoch": 0.25385717742085573, + "grad_norm": 5.912557991966657, + "learning_rate": 4.648085461044049e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.78125, + "logps/chosen": -764.0, + "logps/rejected": -880.0, + "loss": 0.4264, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.65625, + "rewards/margins": 1.4296875, + "rewards/rejected": -7.09375, + "step": 6820 + }, + { + "epoch": 0.2542294020211796, + "grad_norm": 5.879871351533836, + "learning_rate": 4.646421823669883e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -788.0, + "logps/rejected": -916.0, + "loss": 0.4379, + "rewards/accuracies": 0.78125, + "rewards/chosen": -5.9375, + "rewards/margins": 1.3828125, + "rewards/rejected": -7.34375, + "step": 6830 + }, + { + "epoch": 0.25460162662150343, + "grad_norm": 5.8083438839498855, + "learning_rate": 4.644754562414006e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.703125, + "logps/chosen": -764.0, + "logps/rejected": -888.0, + "loss": 0.4194, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.875, + "rewards/margins": 1.328125, + "rewards/rejected": -7.21875, + "step": 6840 + }, + { + "epoch": 0.25497385122182725, + "grad_norm": 4.823811006340166, + "learning_rate": 4.6430836800913167e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -800.0, + "logps/rejected": -912.0, + "loss": 0.3981, + "rewards/accuracies": 0.875, + "rewards/chosen": -6.03125, + "rewards/margins": 1.5625, + "rewards/rejected": -7.59375, + "step": 6850 + }, + { + "epoch": 0.2553460758221511, + "grad_norm": 6.944388369911442, + "learning_rate": 4.6414091795228247e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.796875, + "logps/chosen": -856.0, + "logps/rejected": -988.0, + "loss": 0.4018, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.5625, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.0625, + "step": 6860 + }, + { + "epoch": 0.2557183004224749, + "grad_norm": 6.624621827733266, + "learning_rate": 4.6397310635356514e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.796875, + "logps/chosen": -836.0, + "logps/rejected": -944.0, + "loss": 0.4331, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.625, + "rewards/margins": 1.296875, + "rewards/rejected": -7.90625, + "step": 6870 + }, + { + "epoch": 0.2560905250227988, + "grad_norm": 5.695681707945807, + "learning_rate": 4.63804933496302e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.75, + "logps/chosen": -800.0, + "logps/rejected": -920.0, + "loss": 0.4283, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.3125, + "rewards/margins": 1.421875, + "rewards/rejected": -7.71875, + "step": 6880 + }, + { + "epoch": 0.2564627496231226, + "grad_norm": 5.975492463825295, + "learning_rate": 4.6363639966442535e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -832.0, + "logps/rejected": -980.0, + "loss": 0.4295, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.28125, + "rewards/margins": 1.625, + "rewards/rejected": -7.90625, + "step": 6890 + }, + { + "epoch": 0.2568349742234464, + "grad_norm": 7.9029141557386255, + "learning_rate": 4.634675051424771e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -820.0, + "logps/rejected": -956.0, + "loss": 0.4352, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.3125, + "rewards/margins": 1.453125, + "rewards/rejected": -7.78125, + "step": 6900 + }, + { + "epoch": 0.25720719882377024, + "grad_norm": 5.924450624299557, + "learning_rate": 4.632982502156078e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -816.0, + "logps/rejected": -928.0, + "loss": 0.4245, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.25, + "rewards/margins": 1.421875, + "rewards/rejected": -7.65625, + "step": 6910 + }, + { + "epoch": 0.2575794234240941, + "grad_norm": 6.920771352726799, + "learning_rate": 4.6312863516957686e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.734375, + "logps/chosen": -848.0, + "logps/rejected": -964.0, + "loss": 0.4197, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.65625, + "rewards/margins": 1.3671875, + "rewards/rejected": -8.0, + "step": 6920 + }, + { + "epoch": 0.25795164802441795, + "grad_norm": 5.820297292357974, + "learning_rate": 4.629586602907514e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.828125, + "logps/chosen": -824.0, + "logps/rejected": -944.0, + "loss": 0.4506, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.5, + "rewards/margins": 1.3125, + "rewards/rejected": -7.8125, + "step": 6930 + }, + { + "epoch": 0.25832387262474177, + "grad_norm": 5.914879662411408, + "learning_rate": 4.627883258661061e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.625, + "logps/chosen": -800.0, + "logps/rejected": -936.0, + "loss": 0.4196, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.03125, + "rewards/margins": 1.6015625, + "rewards/rejected": -7.625, + "step": 6940 + }, + { + "epoch": 0.2586960972250656, + "grad_norm": 6.198591450715814, + "learning_rate": 4.626176321832229e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -772.0, + "logps/rejected": -904.0, + "loss": 0.4192, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -5.96875, + "rewards/margins": 1.3125, + "rewards/rejected": -7.28125, + "step": 6950 + }, + { + "epoch": 0.2590683218253894, + "grad_norm": 6.382208272677864, + "learning_rate": 4.6244657953029005e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.703125, + "logps/chosen": -816.0, + "logps/rejected": -944.0, + "loss": 0.4161, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -6.28125, + "rewards/margins": 1.34375, + "rewards/rejected": -7.59375, + "step": 6960 + }, + { + "epoch": 0.2594405464257133, + "grad_norm": 6.195584631295477, + "learning_rate": 4.622751681961019e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.6875, + "logps/chosen": -828.0, + "logps/rejected": -944.0, + "loss": 0.4231, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.15625, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.71875, + "step": 6970 + }, + { + "epoch": 0.2598127710260371, + "grad_norm": 5.674286559755445, + "learning_rate": 4.621033984700585e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.578125, + "logps/chosen": -796.0, + "logps/rejected": -920.0, + "loss": 0.4063, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.15625, + "rewards/margins": 1.4296875, + "rewards/rejected": -7.59375, + "step": 6980 + }, + { + "epoch": 0.26018499562636094, + "grad_norm": 5.892757426878994, + "learning_rate": 4.6193127064216486e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.765625, + "logps/chosen": -816.0, + "logps/rejected": -952.0, + "loss": 0.3907, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.28125, + "rewards/margins": 1.5859375, + "rewards/rejected": -7.875, + "step": 6990 + }, + { + "epoch": 0.26055722022668476, + "grad_norm": 5.779461468889358, + "learning_rate": 4.6175878500303054e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.65625, + "logps/chosen": -796.0, + "logps/rejected": -952.0, + "loss": 0.4012, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.25, + "rewards/margins": 1.671875, + "rewards/rejected": -7.9375, + "step": 7000 + }, + { + "epoch": 0.26092944482700864, + "grad_norm": 7.399670910318273, + "learning_rate": 4.615859418438695e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.78125, + "logps/chosen": -840.0, + "logps/rejected": -948.0, + "loss": 0.4199, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.4609375, + "rewards/rejected": -7.78125, + "step": 7010 + }, + { + "epoch": 0.26130166942733246, + "grad_norm": 5.579899430532945, + "learning_rate": 4.6141274145649876e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -808.0, + "logps/rejected": -920.0, + "loss": 0.4237, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.34375, + "rewards/margins": 1.109375, + "rewards/rejected": -7.4375, + "step": 7020 + }, + { + "epoch": 0.2616738940276563, + "grad_norm": 5.861809476791946, + "learning_rate": 4.612391841333392e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.625, + "logps/chosen": -792.0, + "logps/rejected": -932.0, + "loss": 0.4062, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.875, + "rewards/margins": 1.6484375, + "rewards/rejected": -7.53125, + "step": 7030 + }, + { + "epoch": 0.2620461186279801, + "grad_norm": 5.734970025363787, + "learning_rate": 4.6106527016741377e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.84375, + "logps/chosen": -816.0, + "logps/rejected": -932.0, + "loss": 0.4113, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.09375, + "rewards/margins": 1.3671875, + "rewards/rejected": -7.46875, + "step": 7040 + }, + { + "epoch": 0.262418343228304, + "grad_norm": 7.515271231256475, + "learning_rate": 4.608909998523476e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.859375, + "logps/chosen": -800.0, + "logps/rejected": -928.0, + "loss": 0.4251, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.1875, + "rewards/margins": 1.46875, + "rewards/rejected": -7.625, + "step": 7050 + }, + { + "epoch": 0.2627905678286278, + "grad_norm": 6.117346670109052, + "learning_rate": 4.607163734823678e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -788.0, + "logps/rejected": -916.0, + "loss": 0.4042, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.90625, + "rewards/margins": 1.515625, + "rewards/rejected": -7.4375, + "step": 7060 + }, + { + "epoch": 0.26316279242895163, + "grad_norm": 5.732134762321121, + "learning_rate": 4.605413913523022e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -808.0, + "logps/rejected": -928.0, + "loss": 0.4209, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.21875, + "rewards/margins": 1.3359375, + "rewards/rejected": -7.5625, + "step": 7070 + }, + { + "epoch": 0.26353501702927545, + "grad_norm": 6.168376801567615, + "learning_rate": 4.603660537575796e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.734375, + "logps/chosen": -792.0, + "logps/rejected": -900.0, + "loss": 0.4198, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.0, + "rewards/margins": 1.3828125, + "rewards/rejected": -7.375, + "step": 7080 + }, + { + "epoch": 0.2639072416295993, + "grad_norm": 7.079605830294161, + "learning_rate": 4.601903609942287e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.75, + "logps/chosen": -808.0, + "logps/rejected": -952.0, + "loss": 0.4184, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.1875, + "rewards/margins": 1.4609375, + "rewards/rejected": -7.625, + "step": 7090 + }, + { + "epoch": 0.26427946622992315, + "grad_norm": 6.1303983560448865, + "learning_rate": 4.600143133588781e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -772.0, + "logps/rejected": -916.0, + "loss": 0.3939, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -5.96875, + "rewards/margins": 1.515625, + "rewards/rejected": -7.46875, + "step": 7100 + }, + { + "epoch": 0.264651690830247, + "grad_norm": 7.257289544071512, + "learning_rate": 4.598379111487552e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.53125, + "logps/chosen": -776.0, + "logps/rejected": -960.0, + "loss": 0.4291, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.96875, + "rewards/margins": 1.6484375, + "rewards/rejected": -7.59375, + "step": 7110 + }, + { + "epoch": 0.2650239154305708, + "grad_norm": 6.629916399075003, + "learning_rate": 4.5966115466168645e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.8125, + "logps/chosen": -836.0, + "logps/rejected": -944.0, + "loss": 0.4251, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.375, + "rewards/margins": 1.296875, + "rewards/rejected": -7.65625, + "step": 7120 + }, + { + "epoch": 0.2653961400308946, + "grad_norm": 6.854369095431051, + "learning_rate": 4.594840441960961e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.640625, + "logps/chosen": -800.0, + "logps/rejected": -936.0, + "loss": 0.423, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.125, + "rewards/margins": 1.4921875, + "rewards/rejected": -7.625, + "step": 7130 + }, + { + "epoch": 0.2657683646312185, + "grad_norm": 5.452144756823122, + "learning_rate": 4.593065800510062e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -764.0, + "logps/rejected": -880.0, + "loss": 0.4232, + "rewards/accuracies": 0.75, + "rewards/chosen": -5.96875, + "rewards/margins": 1.2421875, + "rewards/rejected": -7.1875, + "step": 7140 + }, + { + "epoch": 0.2661405892315423, + "grad_norm": 5.23057721543945, + "learning_rate": 4.5912876252603585e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.5, + "logps/chosen": -800.0, + "logps/rejected": -928.0, + "loss": 0.4119, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.28125, + "rewards/margins": 1.3203125, + "rewards/rejected": -7.59375, + "step": 7150 + }, + { + "epoch": 0.26651281383186615, + "grad_norm": 5.98550008036415, + "learning_rate": 4.5895059192140095e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.75, + "logps/chosen": -824.0, + "logps/rejected": -948.0, + "loss": 0.4293, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -6.53125, + "rewards/margins": 1.3203125, + "rewards/rejected": -7.84375, + "step": 7160 + }, + { + "epoch": 0.26688503843218997, + "grad_norm": 6.377827546099224, + "learning_rate": 4.587720685379132e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.75, + "logps/chosen": -816.0, + "logps/rejected": -932.0, + "loss": 0.4352, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.3125, + "rewards/margins": 1.359375, + "rewards/rejected": -7.6875, + "step": 7170 + }, + { + "epoch": 0.2672572630325138, + "grad_norm": 6.759601967564584, + "learning_rate": 4.5859319267698025e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.609375, + "logps/chosen": -824.0, + "logps/rejected": -924.0, + "loss": 0.4364, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.40625, + "rewards/rejected": -7.71875, + "step": 7180 + }, + { + "epoch": 0.26762948763283767, + "grad_norm": 5.900896651278787, + "learning_rate": 4.584139646406047e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.5625, + "logps/chosen": -776.0, + "logps/rejected": -916.0, + "loss": 0.4022, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.0, + "rewards/margins": 1.4453125, + "rewards/rejected": -7.4375, + "step": 7190 + }, + { + "epoch": 0.2680017122331615, + "grad_norm": 5.263022048457993, + "learning_rate": 4.5823438473138353e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -792.0, + "logps/rejected": -924.0, + "loss": 0.421, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.25, + "rewards/margins": 1.328125, + "rewards/rejected": -7.59375, + "step": 7200 + }, + { + "epoch": 0.2683739368334853, + "grad_norm": 5.890167597830479, + "learning_rate": 4.5805445325250826e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.734375, + "logps/chosen": -804.0, + "logps/rejected": -964.0, + "loss": 0.4075, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.1875, + "rewards/margins": 1.6875, + "rewards/rejected": -7.875, + "step": 7210 + }, + { + "epoch": 0.26874616143380914, + "grad_norm": 8.762199756640179, + "learning_rate": 4.578741705077636e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -828.0, + "logps/rejected": -952.0, + "loss": 0.444, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.34375, + "rewards/margins": 1.40625, + "rewards/rejected": -7.75, + "step": 7220 + }, + { + "epoch": 0.269118386034133, + "grad_norm": 5.461416990040634, + "learning_rate": 4.5769353680152735e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -792.0, + "logps/rejected": -920.0, + "loss": 0.4343, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.96875, + "rewards/margins": 1.4765625, + "rewards/rejected": -7.46875, + "step": 7230 + }, + { + "epoch": 0.26949061063445684, + "grad_norm": 5.476272606008138, + "learning_rate": 4.575125524387701e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -792.0, + "logps/rejected": -908.0, + "loss": 0.4251, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.03125, + "rewards/margins": 1.3515625, + "rewards/rejected": -7.375, + "step": 7240 + }, + { + "epoch": 0.26986283523478066, + "grad_norm": 5.6661464976358875, + "learning_rate": 4.573312177250543e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.65625, + "logps/chosen": -828.0, + "logps/rejected": -932.0, + "loss": 0.4147, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -6.4375, + "rewards/margins": 1.3203125, + "rewards/rejected": -7.75, + "step": 7250 + }, + { + "epoch": 0.2702350598351045, + "grad_norm": 6.188756853024002, + "learning_rate": 4.571495329665338e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -848.0, + "logps/rejected": -964.0, + "loss": 0.4408, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.2734375, + "rewards/rejected": -8.0625, + "step": 7260 + }, + { + "epoch": 0.27060728443542836, + "grad_norm": 5.603965350823858, + "learning_rate": 4.5696749846995365e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.640625, + "logps/chosen": -856.0, + "logps/rejected": -956.0, + "loss": 0.438, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -6.59375, + "rewards/margins": 1.3359375, + "rewards/rejected": -7.90625, + "step": 7270 + }, + { + "epoch": 0.2709795090357522, + "grad_norm": 5.993571491812543, + "learning_rate": 4.5678511454264924e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.6875, + "logps/chosen": -772.0, + "logps/rejected": -924.0, + "loss": 0.4125, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -5.78125, + "rewards/margins": 1.578125, + "rewards/rejected": -7.375, + "step": 7280 + }, + { + "epoch": 0.271351733636076, + "grad_norm": 5.947469507645822, + "learning_rate": 4.566023814925459e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -780.0, + "logps/rejected": -900.0, + "loss": 0.4275, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -5.9375, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.34375, + "step": 7290 + }, + { + "epoch": 0.27172395823639983, + "grad_norm": 6.325841025077607, + "learning_rate": 4.5641929962815863e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.53125, + "logps/chosen": -804.0, + "logps/rejected": -936.0, + "loss": 0.4413, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.28125, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.6875, + "step": 7300 + }, + { + "epoch": 0.27209618283672365, + "grad_norm": 5.18473163082829, + "learning_rate": 4.56235869258591e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -784.0, + "logps/rejected": -896.0, + "loss": 0.4344, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.03125, + "rewards/margins": 1.4296875, + "rewards/rejected": -7.46875, + "step": 7310 + }, + { + "epoch": 0.27246840743704753, + "grad_norm": 5.609072281036662, + "learning_rate": 4.5605209069353525e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.71875, + "logps/chosen": -808.0, + "logps/rejected": -972.0, + "loss": 0.3937, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.21875, + "rewards/margins": 1.65625, + "rewards/rejected": -7.875, + "step": 7320 + }, + { + "epoch": 0.27284063203737136, + "grad_norm": 5.880955789651384, + "learning_rate": 4.5586796424327135e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.796875, + "logps/chosen": -852.0, + "logps/rejected": -964.0, + "loss": 0.4412, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.59375, + "rewards/margins": 1.40625, + "rewards/rejected": -8.0, + "step": 7330 + }, + { + "epoch": 0.2732128566376952, + "grad_norm": 6.440537371603219, + "learning_rate": 4.5568349021866666e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.5, + "logps/chosen": -840.0, + "logps/rejected": -984.0, + "loss": 0.4136, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.53125, + "rewards/margins": 1.4140625, + "rewards/rejected": -7.96875, + "step": 7340 + }, + { + "epoch": 0.273585081238019, + "grad_norm": 6.804135994492139, + "learning_rate": 4.554986689311754e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.4375, + "logps/chosen": -804.0, + "logps/rejected": -944.0, + "loss": 0.4352, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.40625, + "rewards/margins": 1.546875, + "rewards/rejected": -7.96875, + "step": 7350 + }, + { + "epoch": 0.2739573058383429, + "grad_norm": 5.957121505319705, + "learning_rate": 4.553135006928379e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -824.0, + "logps/rejected": -996.0, + "loss": 0.4343, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.5, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.1875, + "step": 7360 + }, + { + "epoch": 0.2743295304386667, + "grad_norm": 8.04956443135275, + "learning_rate": 4.551279858162806e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.859375, + "logps/chosen": -832.0, + "logps/rejected": -988.0, + "loss": 0.4039, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.46875, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.125, + "step": 7370 + }, + { + "epoch": 0.2747017550389905, + "grad_norm": 6.3864781116711224, + "learning_rate": 4.549421246147149e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.578125, + "logps/chosen": -828.0, + "logps/rejected": -948.0, + "loss": 0.4224, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.46875, + "rewards/margins": 1.4296875, + "rewards/rejected": -7.90625, + "step": 7380 + }, + { + "epoch": 0.27507397963931435, + "grad_norm": 5.8097010692839905, + "learning_rate": 4.547559174019369e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.5625, + "logps/chosen": -816.0, + "logps/rejected": -980.0, + "loss": 0.4075, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.375, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.0, + "step": 7390 + }, + { + "epoch": 0.27544620423963817, + "grad_norm": 5.9473524195336145, + "learning_rate": 4.5456936449232715e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.59375, + "logps/chosen": -784.0, + "logps/rejected": -928.0, + "loss": 0.4173, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.21875, + "rewards/margins": 1.4609375, + "rewards/rejected": -7.6875, + "step": 7400 + }, + { + "epoch": 0.27581842883996205, + "grad_norm": 5.9398143418043166, + "learning_rate": 4.543824662008496e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.734375, + "logps/chosen": -812.0, + "logps/rejected": -944.0, + "loss": 0.4105, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.1875, + "rewards/margins": 1.5234375, + "rewards/rejected": -7.6875, + "step": 7410 + }, + { + "epoch": 0.27619065344028587, + "grad_norm": 6.763736215751725, + "learning_rate": 4.541952228430514e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.734375, + "logps/chosen": -824.0, + "logps/rejected": -932.0, + "loss": 0.4308, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.375, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.78125, + "step": 7420 + }, + { + "epoch": 0.2765628780406097, + "grad_norm": 8.151576032792361, + "learning_rate": 4.540076347350623e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.75, + "logps/chosen": -840.0, + "logps/rejected": -968.0, + "loss": 0.3925, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.375, + "rewards/margins": 1.5703125, + "rewards/rejected": -7.9375, + "step": 7430 + }, + { + "epoch": 0.2769351026409335, + "grad_norm": 11.288966043305832, + "learning_rate": 4.538197021935941e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.703125, + "logps/chosen": -784.0, + "logps/rejected": -912.0, + "loss": 0.3969, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.78125, + "rewards/margins": 1.59375, + "rewards/rejected": -7.375, + "step": 7440 + }, + { + "epoch": 0.2773073272412574, + "grad_norm": 6.707145109970866, + "learning_rate": 4.5363142553594014e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.6875, + "logps/chosen": -776.0, + "logps/rejected": -924.0, + "loss": 0.4053, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.78125, + "rewards/margins": 1.6953125, + "rewards/rejected": -7.46875, + "step": 7450 + }, + { + "epoch": 0.2776795518415812, + "grad_norm": 6.905530201700849, + "learning_rate": 4.534428050799747e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -784.0, + "logps/rejected": -920.0, + "loss": 0.4164, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.0, + "rewards/margins": 1.5703125, + "rewards/rejected": -7.5625, + "step": 7460 + }, + { + "epoch": 0.27805177644190504, + "grad_norm": 5.8253928740880365, + "learning_rate": 4.5325384114415254e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -780.0, + "logps/rejected": -916.0, + "loss": 0.4079, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.9375, + "rewards/margins": 1.65625, + "rewards/rejected": -7.59375, + "step": 7470 + }, + { + "epoch": 0.27842400104222886, + "grad_norm": 7.665848171883835, + "learning_rate": 4.530645340475083e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -776.0, + "logps/rejected": -912.0, + "loss": 0.4082, + "rewards/accuracies": 0.8125, + "rewards/chosen": -5.84375, + "rewards/margins": 1.5859375, + "rewards/rejected": -7.40625, + "step": 7480 + }, + { + "epoch": 0.27879622564255274, + "grad_norm": 6.752541166954709, + "learning_rate": 4.52874884109656e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.703125, + "logps/chosen": -748.0, + "logps/rejected": -912.0, + "loss": 0.4184, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -5.6875, + "rewards/margins": 1.5859375, + "rewards/rejected": -7.28125, + "step": 7490 + }, + { + "epoch": 0.27916845024287656, + "grad_norm": 5.773009747462673, + "learning_rate": 4.5268489165078855e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.890625, + "logps/chosen": -816.0, + "logps/rejected": -928.0, + "loss": 0.432, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.09375, + "rewards/margins": 1.4375, + "rewards/rejected": -7.53125, + "step": 7500 + }, + { + "epoch": 0.2795406748432004, + "grad_norm": 6.864929343234643, + "learning_rate": 4.5249455699167706e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.8125, + "logps/chosen": -768.0, + "logps/rejected": -888.0, + "loss": 0.4167, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -5.9375, + "rewards/margins": 1.390625, + "rewards/rejected": -7.3125, + "step": 7510 + }, + { + "epoch": 0.2799128994435242, + "grad_norm": 6.632761532547937, + "learning_rate": 4.523038804536704e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.75, + "logps/chosen": -776.0, + "logps/rejected": -912.0, + "loss": 0.4157, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -5.9375, + "rewards/margins": 1.5546875, + "rewards/rejected": -7.5, + "step": 7520 + }, + { + "epoch": 0.28028512404384803, + "grad_norm": 6.669079637823111, + "learning_rate": 4.521128623586947e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.734375, + "logps/chosen": -812.0, + "logps/rejected": -948.0, + "loss": 0.434, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.34375, + "rewards/margins": 1.4453125, + "rewards/rejected": -7.78125, + "step": 7530 + }, + { + "epoch": 0.2806573486441719, + "grad_norm": 6.156049752852196, + "learning_rate": 4.519215030292527e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.828125, + "logps/chosen": -816.0, + "logps/rejected": -944.0, + "loss": 0.4368, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.34375, + "rewards/margins": 1.46875, + "rewards/rejected": -7.8125, + "step": 7540 + }, + { + "epoch": 0.28102957324449573, + "grad_norm": 6.07035973255774, + "learning_rate": 4.517298027884234e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.8125, + "logps/chosen": -840.0, + "logps/rejected": -944.0, + "loss": 0.4299, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.21875, + "rewards/margins": 1.390625, + "rewards/rejected": -7.625, + "step": 7550 + }, + { + "epoch": 0.28140179784481956, + "grad_norm": 6.080414694651505, + "learning_rate": 4.5153776195986113e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -852.0, + "logps/rejected": -920.0, + "loss": 0.4358, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.46875, + "rewards/margins": 1.0546875, + "rewards/rejected": -7.5, + "step": 7560 + }, + { + "epoch": 0.2817740224451434, + "grad_norm": 5.605986319201334, + "learning_rate": 4.513453808677955e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.59375, + "logps/chosen": -820.0, + "logps/rejected": -940.0, + "loss": 0.3868, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.1875, + "rewards/margins": 1.3671875, + "rewards/rejected": -7.5625, + "step": 7570 + }, + { + "epoch": 0.28214624704546726, + "grad_norm": 6.528616544992401, + "learning_rate": 4.5115265983703036e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.59375, + "logps/chosen": -816.0, + "logps/rejected": -948.0, + "loss": 0.4088, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.46875, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.0, + "step": 7580 + }, + { + "epoch": 0.2825184716457911, + "grad_norm": 5.293613770865945, + "learning_rate": 4.5095959919294366e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -848.0, + "logps/rejected": -964.0, + "loss": 0.4125, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.6875, + "rewards/margins": 1.4140625, + "rewards/rejected": -8.125, + "step": 7590 + }, + { + "epoch": 0.2828906962461149, + "grad_norm": 8.308599384829984, + "learning_rate": 4.5076619926148673e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.671875, + "logps/chosen": -876.0, + "logps/rejected": -1016.0, + "loss": 0.4218, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.3125, + "step": 7600 + }, + { + "epoch": 0.2832629208464387, + "grad_norm": 6.89426563654055, + "learning_rate": 4.5057246036918357e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.890625, + "logps/chosen": -856.0, + "logps/rejected": -1012.0, + "loss": 0.4079, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.53125, + "rewards/margins": 1.671875, + "rewards/rejected": -8.1875, + "step": 7610 + }, + { + "epoch": 0.28363514544676255, + "grad_norm": 5.757382364852515, + "learning_rate": 4.503783828431306e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.8125, + "logps/chosen": -820.0, + "logps/rejected": -956.0, + "loss": 0.4148, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.4375, + "rewards/margins": 1.4140625, + "rewards/rejected": -7.84375, + "step": 7620 + }, + { + "epoch": 0.2840073700470864, + "grad_norm": 8.796876620057319, + "learning_rate": 4.50183967010996e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -816.0, + "logps/rejected": -936.0, + "loss": 0.4164, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.34375, + "rewards/margins": 1.40625, + "rewards/rejected": -7.75, + "step": 7630 + }, + { + "epoch": 0.28437959464741025, + "grad_norm": 5.409682348117861, + "learning_rate": 4.49989213201019e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.6875, + "logps/chosen": -788.0, + "logps/rejected": -912.0, + "loss": 0.4236, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.0625, + "rewards/margins": 1.4453125, + "rewards/rejected": -7.53125, + "step": 7640 + }, + { + "epoch": 0.2847518192477341, + "grad_norm": 5.522829230003005, + "learning_rate": 4.497941217420095e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -816.0, + "logps/rejected": -936.0, + "loss": 0.4011, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.1875, + "rewards/margins": 1.5078125, + "rewards/rejected": -7.71875, + "step": 7650 + }, + { + "epoch": 0.2851240438480579, + "grad_norm": 6.128079921566439, + "learning_rate": 4.495986929633476e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -816.0, + "logps/rejected": -944.0, + "loss": 0.4334, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.40625, + "rewards/margins": 1.3125, + "rewards/rejected": -7.71875, + "step": 7660 + }, + { + "epoch": 0.2854962684483818, + "grad_norm": 7.737598587677687, + "learning_rate": 4.494029271949826e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -844.0, + "logps/rejected": -968.0, + "loss": 0.4078, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.625, + "rewards/margins": 1.4140625, + "rewards/rejected": -8.0625, + "step": 7670 + }, + { + "epoch": 0.2858684930487056, + "grad_norm": 6.468631454744863, + "learning_rate": 4.492068247674331e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.5625, + "logps/chosen": -848.0, + "logps/rejected": -980.0, + "loss": 0.4589, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.71875, + "rewards/margins": 1.578125, + "rewards/rejected": -8.3125, + "step": 7680 + }, + { + "epoch": 0.2862407176490294, + "grad_norm": 7.510640649966863, + "learning_rate": 4.490103860117858e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -816.0, + "logps/rejected": -956.0, + "loss": 0.4346, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.375, + "rewards/margins": 1.46875, + "rewards/rejected": -7.8125, + "step": 7690 + }, + { + "epoch": 0.28661294224935324, + "grad_norm": 5.3436987473560125, + "learning_rate": 4.4881361125969546e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -812.0, + "logps/rejected": -944.0, + "loss": 0.4136, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.21875, + "rewards/margins": 1.703125, + "rewards/rejected": -7.9375, + "step": 7700 + }, + { + "epoch": 0.2869851668496771, + "grad_norm": 5.84593282580263, + "learning_rate": 4.48616500843384e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.890625, + "logps/chosen": -848.0, + "logps/rejected": -960.0, + "loss": 0.4235, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.5625, + "rewards/margins": 1.390625, + "rewards/rejected": -7.9375, + "step": 7710 + }, + { + "epoch": 0.28735739145000094, + "grad_norm": 6.060442318478308, + "learning_rate": 4.4841905509564e-07, + "logits/chosen": -3.984375, + "logits/rejected": -4.03125, + "logps/chosen": -820.0, + "logps/rejected": -928.0, + "loss": 0.3898, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.25, + "rewards/margins": 1.46875, + "rewards/rejected": -7.71875, + "step": 7720 + }, + { + "epoch": 0.28772961605032477, + "grad_norm": 6.194875526344922, + "learning_rate": 4.4822127434981845e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -824.0, + "logps/rejected": -972.0, + "loss": 0.4065, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.46875, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.0625, + "step": 7730 + }, + { + "epoch": 0.2881018406506486, + "grad_norm": 6.587423826797523, + "learning_rate": 4.4802315893983957e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.890625, + "logps/chosen": -816.0, + "logps/rejected": -960.0, + "loss": 0.4107, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.28125, + "rewards/margins": 1.6328125, + "rewards/rejected": -7.90625, + "step": 7740 + }, + { + "epoch": 0.2884740652509724, + "grad_norm": 5.579966834077149, + "learning_rate": 4.4782470920018875e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.671875, + "logps/chosen": -828.0, + "logps/rejected": -968.0, + "loss": 0.4231, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.5, + "rewards/margins": 1.609375, + "rewards/rejected": -8.125, + "step": 7750 + }, + { + "epoch": 0.2888462898512963, + "grad_norm": 5.578942771970089, + "learning_rate": 4.4762592546591617e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.65625, + "logps/chosen": -844.0, + "logps/rejected": -976.0, + "loss": 0.4297, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.71875, + "rewards/margins": 1.375, + "rewards/rejected": -8.0625, + "step": 7760 + }, + { + "epoch": 0.2892185144516201, + "grad_norm": 5.627177009698344, + "learning_rate": 4.4742680807263524e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.765625, + "logps/chosen": -816.0, + "logps/rejected": -972.0, + "loss": 0.426, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.375, + "rewards/margins": 1.5703125, + "rewards/rejected": -7.96875, + "step": 7770 + }, + { + "epoch": 0.28959073905194394, + "grad_norm": 6.211708773823986, + "learning_rate": 4.4722735735652327e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.703125, + "logps/chosen": -832.0, + "logps/rejected": -964.0, + "loss": 0.4449, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.53125, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.0, + "step": 7780 + }, + { + "epoch": 0.28996296365226776, + "grad_norm": 4.965561637662461, + "learning_rate": 4.4702757365432007e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.875, + "logps/chosen": -816.0, + "logps/rejected": -944.0, + "loss": 0.4155, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.3125, + "rewards/margins": 1.3203125, + "rewards/rejected": -7.625, + "step": 7790 + }, + { + "epoch": 0.29033518825259164, + "grad_norm": 5.633981216434436, + "learning_rate": 4.468274573033278e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -832.0, + "logps/rejected": -940.0, + "loss": 0.4245, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.375, + "rewards/margins": 1.359375, + "rewards/rejected": -7.71875, + "step": 7800 + }, + { + "epoch": 0.29070741285291546, + "grad_norm": 5.812551208964231, + "learning_rate": 4.4662700864141e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.890625, + "logps/chosen": -836.0, + "logps/rejected": -952.0, + "loss": 0.418, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.375, + "rewards/margins": 1.296875, + "rewards/rejected": -7.6875, + "step": 7810 + }, + { + "epoch": 0.2910796374532393, + "grad_norm": 6.823075340921146, + "learning_rate": 4.4642622800699155e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.859375, + "logps/chosen": -832.0, + "logps/rejected": -964.0, + "loss": 0.418, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.53125, + "rewards/margins": 1.3203125, + "rewards/rejected": -7.875, + "step": 7820 + }, + { + "epoch": 0.2914518620535631, + "grad_norm": 5.934821118318428, + "learning_rate": 4.4622511573905754e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.75, + "logps/chosen": -808.0, + "logps/rejected": -940.0, + "loss": 0.4082, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.28125, + "rewards/margins": 1.5078125, + "rewards/rejected": -7.78125, + "step": 7830 + }, + { + "epoch": 0.291824086653887, + "grad_norm": 5.697784836555151, + "learning_rate": 4.460236721771531e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.90625, + "logps/chosen": -820.0, + "logps/rejected": -932.0, + "loss": 0.4145, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.3125, + "rewards/margins": 1.390625, + "rewards/rejected": -7.71875, + "step": 7840 + }, + { + "epoch": 0.2921963112542108, + "grad_norm": 8.194828445942946, + "learning_rate": 4.458218976613828e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.8125, + "logps/chosen": -824.0, + "logps/rejected": -936.0, + "loss": 0.4249, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.4375, + "rewards/margins": 1.2578125, + "rewards/rejected": -7.71875, + "step": 7850 + }, + { + "epoch": 0.29256853585453463, + "grad_norm": 6.101392884473911, + "learning_rate": 4.456197925324098e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.890625, + "logps/chosen": -824.0, + "logps/rejected": -944.0, + "loss": 0.4257, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.46875, + "rewards/margins": 1.3828125, + "rewards/rejected": -7.84375, + "step": 7860 + }, + { + "epoch": 0.29294076045485845, + "grad_norm": 5.775207827332482, + "learning_rate": 4.4541735713145546e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -816.0, + "logps/rejected": -960.0, + "loss": 0.4123, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.46875, + "rewards/margins": 1.59375, + "rewards/rejected": -8.0625, + "step": 7870 + }, + { + "epoch": 0.2933129850551823, + "grad_norm": 5.529179150621515, + "learning_rate": 4.4521459180029884e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.765625, + "logps/chosen": -824.0, + "logps/rejected": -952.0, + "loss": 0.4271, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.40625, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.8125, + "step": 7880 + }, + { + "epoch": 0.29368520965550615, + "grad_norm": 5.629698643352411, + "learning_rate": 4.45011496881276e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.671875, + "logps/chosen": -824.0, + "logps/rejected": -944.0, + "loss": 0.4165, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.40625, + "rewards/margins": 1.515625, + "rewards/rejected": -7.90625, + "step": 7890 + }, + { + "epoch": 0.29405743425583, + "grad_norm": 5.858186522980214, + "learning_rate": 4.4480807271727954e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -840.0, + "logps/rejected": -956.0, + "loss": 0.4144, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.40625, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.9375, + "step": 7900 + }, + { + "epoch": 0.2944296588561538, + "grad_norm": 6.51605195710432, + "learning_rate": 4.446043196517577e-07, + "logits/chosen": -4.15625, + "logits/rejected": -3.875, + "logps/chosen": -832.0, + "logps/rejected": -940.0, + "loss": 0.4436, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -6.625, + "rewards/margins": 1.1640625, + "rewards/rejected": -7.8125, + "step": 7910 + }, + { + "epoch": 0.2948018834564776, + "grad_norm": 7.191073113766226, + "learning_rate": 4.444002380287143e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.59375, + "logps/chosen": -820.0, + "logps/rejected": -948.0, + "loss": 0.4176, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -6.3125, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.84375, + "step": 7920 + }, + { + "epoch": 0.2951741080568015, + "grad_norm": 5.595229117567896, + "learning_rate": 4.441958281927075e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.75, + "logps/chosen": -816.0, + "logps/rejected": -936.0, + "loss": 0.4179, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -6.34375, + "rewards/margins": 1.2578125, + "rewards/rejected": -7.59375, + "step": 7930 + }, + { + "epoch": 0.2955463326571253, + "grad_norm": 6.527830177486686, + "learning_rate": 4.4399109048885006e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -856.0, + "logps/rejected": -992.0, + "loss": 0.4268, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.90625, + "rewards/margins": 1.4140625, + "rewards/rejected": -8.3125, + "step": 7940 + }, + { + "epoch": 0.29591855725744914, + "grad_norm": 6.079554429820177, + "learning_rate": 4.437860252628081e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.8125, + "logps/chosen": -852.0, + "logps/rejected": -972.0, + "loss": 0.3929, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.75, + "rewards/margins": 1.375, + "rewards/rejected": -8.125, + "step": 7950 + }, + { + "epoch": 0.29629078185777297, + "grad_norm": 6.582564336121776, + "learning_rate": 4.435806328608004e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.71875, + "logps/chosen": -844.0, + "logps/rejected": -992.0, + "loss": 0.3996, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.53125, + "rewards/margins": 1.609375, + "rewards/rejected": -8.125, + "step": 7960 + }, + { + "epoch": 0.2966630064580968, + "grad_norm": 6.506949889046725, + "learning_rate": 4.4337491362959854e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.875, + "logps/chosen": -856.0, + "logps/rejected": -1008.0, + "loss": 0.4074, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.71875, + "rewards/rejected": -8.5, + "step": 7970 + }, + { + "epoch": 0.29703523105842067, + "grad_norm": 7.100064140632613, + "learning_rate": 4.4316886791652584e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.84375, + "logps/chosen": -872.0, + "logps/rejected": -988.0, + "loss": 0.415, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -6.90625, + "rewards/margins": 1.234375, + "rewards/rejected": -8.125, + "step": 7980 + }, + { + "epoch": 0.2974074556587445, + "grad_norm": 7.183074534887785, + "learning_rate": 4.429624960694566e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -872.0, + "logps/rejected": -1012.0, + "loss": 0.4212, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.875, + "rewards/margins": 1.53125, + "rewards/rejected": -8.375, + "step": 7990 + }, + { + "epoch": 0.2977796802590683, + "grad_norm": 7.352505423981211, + "learning_rate": 4.42755798436816e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -844.0, + "logps/rejected": -976.0, + "loss": 0.4057, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.65625, + "rewards/margins": 1.546875, + "rewards/rejected": -8.1875, + "step": 8000 + }, + { + "epoch": 0.29815190485939214, + "grad_norm": 5.877784277717734, + "learning_rate": 4.42548775367579e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.703125, + "logps/chosen": -820.0, + "logps/rejected": -960.0, + "loss": 0.4085, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.4375, + "rewards/margins": 1.5703125, + "rewards/rejected": -8.0, + "step": 8010 + }, + { + "epoch": 0.298524129459716, + "grad_norm": 7.025513314364941, + "learning_rate": 4.4234142721127026e-07, + "logits/chosen": -4.1875, + "logits/rejected": -4.03125, + "logps/chosen": -860.0, + "logps/rejected": -1000.0, + "loss": 0.4162, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.5625, + "rewards/rejected": -8.3125, + "step": 8020 + }, + { + "epoch": 0.29889635406003984, + "grad_norm": 5.092026385878604, + "learning_rate": 4.4213375431796316e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.765625, + "logps/chosen": -832.0, + "logps/rejected": -968.0, + "loss": 0.4048, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.6875, + "rewards/margins": 1.5, + "rewards/rejected": -8.1875, + "step": 8030 + }, + { + "epoch": 0.29926857866036366, + "grad_norm": 5.913584346369995, + "learning_rate": 4.419257570382793e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.75, + "logps/chosen": -840.0, + "logps/rejected": -1000.0, + "loss": 0.4273, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.71875, + "rewards/margins": 1.71875, + "rewards/rejected": -8.4375, + "step": 8040 + }, + { + "epoch": 0.2996408032606875, + "grad_norm": 6.406795204967781, + "learning_rate": 4.4171743572338813e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.921875, + "logps/chosen": -860.0, + "logps/rejected": -972.0, + "loss": 0.4598, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.71875, + "rewards/margins": 1.28125, + "rewards/rejected": -8.0, + "step": 8050 + }, + { + "epoch": 0.30001302786101136, + "grad_norm": 5.856699305881422, + "learning_rate": 4.4150879072500604e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.90625, + "logps/chosen": -840.0, + "logps/rejected": -952.0, + "loss": 0.3982, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.5, + "rewards/margins": 1.34375, + "rewards/rejected": -7.84375, + "step": 8060 + }, + { + "epoch": 0.3003852524613352, + "grad_norm": 6.001256951069163, + "learning_rate": 4.4129982239539594e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.9375, + "logps/chosen": -868.0, + "logps/rejected": -992.0, + "loss": 0.4172, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.484375, + "rewards/rejected": -8.25, + "step": 8070 + }, + { + "epoch": 0.300757477061659, + "grad_norm": 5.66074759558905, + "learning_rate": 4.410905310873665e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.890625, + "logps/chosen": -824.0, + "logps/rejected": -940.0, + "loss": 0.4283, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.53125, + "rewards/margins": 1.34375, + "rewards/rejected": -7.875, + "step": 8080 + }, + { + "epoch": 0.30112970166198283, + "grad_norm": 5.482429194736557, + "learning_rate": 4.40880917154272e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.78125, + "logps/chosen": -892.0, + "logps/rejected": -1032.0, + "loss": 0.4026, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.875, + "rewards/margins": 1.4140625, + "rewards/rejected": -8.3125, + "step": 8090 + }, + { + "epoch": 0.30150192626230665, + "grad_norm": 7.2184703453065655, + "learning_rate": 4.4067098095001113e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -840.0, + "logps/rejected": -972.0, + "loss": 0.4157, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.6875, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.1875, + "step": 8100 + }, + { + "epoch": 0.30187415086263053, + "grad_norm": 6.806034531524511, + "learning_rate": 4.4046072282902687e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -800.0, + "logps/rejected": -964.0, + "loss": 0.4116, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.1875, + "rewards/margins": 1.7890625, + "rewards/rejected": -7.96875, + "step": 8110 + }, + { + "epoch": 0.30224637546295435, + "grad_norm": 6.617690856299018, + "learning_rate": 4.402501431463055e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.703125, + "logps/chosen": -840.0, + "logps/rejected": -936.0, + "loss": 0.4321, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.40625, + "rewards/margins": 1.3046875, + "rewards/rejected": -7.71875, + "step": 8120 + }, + { + "epoch": 0.3026186000632782, + "grad_norm": 7.831250227203586, + "learning_rate": 4.4003924225737643e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -764.0, + "logps/rejected": -944.0, + "loss": 0.4109, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.03125, + "rewards/margins": 1.8203125, + "rewards/rejected": -7.84375, + "step": 8130 + }, + { + "epoch": 0.302990824663602, + "grad_norm": 5.535353433361087, + "learning_rate": 4.3982802051831127e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.765625, + "logps/chosen": -832.0, + "logps/rejected": -960.0, + "loss": 0.3959, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.40625, + "rewards/margins": 1.53125, + "rewards/rejected": -7.9375, + "step": 8140 + }, + { + "epoch": 0.3033630492639259, + "grad_norm": 6.2529635387847895, + "learning_rate": 4.396164782857232e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.703125, + "logps/chosen": -864.0, + "logps/rejected": -1012.0, + "loss": 0.4155, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.8125, + "rewards/margins": 1.5625, + "rewards/rejected": -8.375, + "step": 8150 + }, + { + "epoch": 0.3037352738642497, + "grad_norm": 5.425058988784764, + "learning_rate": 4.3940461591676683e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -888.0, + "logps/rejected": -1008.0, + "loss": 0.4025, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.78125, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.25, + "step": 8160 + }, + { + "epoch": 0.3041074984645735, + "grad_norm": 6.526733064420788, + "learning_rate": 4.391924337691368e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.84375, + "logps/chosen": -836.0, + "logps/rejected": -972.0, + "loss": 0.3942, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.46875, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.0625, + "step": 8170 + }, + { + "epoch": 0.30447972306489735, + "grad_norm": 6.922891766106371, + "learning_rate": 4.3897993220106825e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.78125, + "logps/chosen": -844.0, + "logps/rejected": -1004.0, + "loss": 0.4086, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.625, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.3125, + "step": 8180 + }, + { + "epoch": 0.30485194766522117, + "grad_norm": 7.015051177524256, + "learning_rate": 4.3876711157133506e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -812.0, + "logps/rejected": -940.0, + "loss": 0.4089, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.3125, + "rewards/margins": 1.6015625, + "rewards/rejected": -7.90625, + "step": 8190 + }, + { + "epoch": 0.30522417226554505, + "grad_norm": 5.359070975311743, + "learning_rate": 4.385539722392501e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.734375, + "logps/chosen": -840.0, + "logps/rejected": -980.0, + "loss": 0.4023, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.5, + "rewards/margins": 1.53125, + "rewards/rejected": -8.0625, + "step": 8200 + }, + { + "epoch": 0.30559639686586887, + "grad_norm": 6.1864107604357415, + "learning_rate": 4.3834051456466414e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.8125, + "logps/chosen": -824.0, + "logps/rejected": -952.0, + "loss": 0.4138, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.484375, + "rewards/rejected": -7.8125, + "step": 8210 + }, + { + "epoch": 0.3059686214661927, + "grad_norm": 6.6538688532412404, + "learning_rate": 4.381267389079656e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.453125, + "logps/chosen": -792.0, + "logps/rejected": -940.0, + "loss": 0.4024, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.3125, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.0, + "step": 8220 + }, + { + "epoch": 0.3063408460665165, + "grad_norm": 7.855420982081355, + "learning_rate": 4.379126456300796e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.890625, + "logps/chosen": -804.0, + "logps/rejected": -952.0, + "loss": 0.408, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.34375, + "rewards/margins": 1.515625, + "rewards/rejected": -7.875, + "step": 8230 + }, + { + "epoch": 0.3067130706668404, + "grad_norm": 5.520161299022761, + "learning_rate": 4.3769823509246753e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.703125, + "logps/chosen": -840.0, + "logps/rejected": -964.0, + "loss": 0.4346, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.59375, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.0625, + "step": 8240 + }, + { + "epoch": 0.3070852952671642, + "grad_norm": 5.783006987164638, + "learning_rate": 4.374835076571265e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -828.0, + "logps/rejected": -964.0, + "loss": 0.4127, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.34375, + "rewards/margins": 1.3828125, + "rewards/rejected": -7.75, + "step": 8250 + }, + { + "epoch": 0.30745751986748804, + "grad_norm": 7.194195524701205, + "learning_rate": 4.3726846368658874e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.734375, + "logps/chosen": -820.0, + "logps/rejected": -944.0, + "loss": 0.4255, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.4609375, + "rewards/rejected": -7.78125, + "step": 8260 + }, + { + "epoch": 0.30782974446781186, + "grad_norm": 8.487284581586474, + "learning_rate": 4.370531035439206e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.75, + "logps/chosen": -776.0, + "logps/rejected": -920.0, + "loss": 0.4345, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.0, + "rewards/margins": 1.609375, + "rewards/rejected": -7.59375, + "step": 8270 + }, + { + "epoch": 0.30820196906813574, + "grad_norm": 5.503865115363084, + "learning_rate": 4.3683742759272255e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -808.0, + "logps/rejected": -948.0, + "loss": 0.4139, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.3125, + "rewards/margins": 1.546875, + "rewards/rejected": -7.84375, + "step": 8280 + }, + { + "epoch": 0.30857419366845956, + "grad_norm": 5.4597357470381995, + "learning_rate": 4.36621436197128e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.90625, + "logps/chosen": -860.0, + "logps/rejected": -992.0, + "loss": 0.4045, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.90625, + "rewards/margins": 1.328125, + "rewards/rejected": -8.25, + "step": 8290 + }, + { + "epoch": 0.3089464182687834, + "grad_norm": 6.360812426641355, + "learning_rate": 4.364051297218031e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.890625, + "logps/chosen": -864.0, + "logps/rejected": -1032.0, + "loss": 0.4133, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.875, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.5625, + "step": 8300 + }, + { + "epoch": 0.3093186428691072, + "grad_norm": 7.181286945346029, + "learning_rate": 4.361885085319459e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.640625, + "logps/chosen": -816.0, + "logps/rejected": -948.0, + "loss": 0.4352, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.3125, + "rewards/margins": 1.6015625, + "rewards/rejected": -7.90625, + "step": 8310 + }, + { + "epoch": 0.30969086746943103, + "grad_norm": 5.758526971226857, + "learning_rate": 4.359715729932858e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.71875, + "logps/chosen": -812.0, + "logps/rejected": -924.0, + "loss": 0.4186, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.34375, + "rewards/margins": 1.3359375, + "rewards/rejected": -7.6875, + "step": 8320 + }, + { + "epoch": 0.3100630920697549, + "grad_norm": 7.239872111687638, + "learning_rate": 4.357543234720829e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -820.0, + "logps/rejected": -948.0, + "loss": 0.426, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.34375, + "rewards/margins": 1.265625, + "rewards/rejected": -7.625, + "step": 8330 + }, + { + "epoch": 0.31043531667007873, + "grad_norm": 6.238541324845665, + "learning_rate": 4.355367603351275e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.640625, + "logps/chosen": -828.0, + "logps/rejected": -980.0, + "loss": 0.4064, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.65625, + "rewards/margins": 1.515625, + "rewards/rejected": -8.1875, + "step": 8340 + }, + { + "epoch": 0.31080754127040255, + "grad_norm": 5.467215078581045, + "learning_rate": 4.353188839497393e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.984375, + "logps/chosen": -852.0, + "logps/rejected": -984.0, + "loss": 0.4006, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.65625, + "rewards/margins": 1.46875, + "rewards/rejected": -8.125, + "step": 8350 + }, + { + "epoch": 0.3111797658707264, + "grad_norm": 7.133710205092668, + "learning_rate": 4.3510069468376687e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.796875, + "logps/chosen": -844.0, + "logps/rejected": -988.0, + "loss": 0.4061, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.6875, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.25, + "step": 8360 + }, + { + "epoch": 0.31155199047105026, + "grad_norm": 6.78111846598109, + "learning_rate": 4.34882192905587e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -860.0, + "logps/rejected": -980.0, + "loss": 0.3985, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.84375, + "rewards/margins": 1.453125, + "rewards/rejected": -8.3125, + "step": 8370 + }, + { + "epoch": 0.3119242150713741, + "grad_norm": 6.043776866561569, + "learning_rate": 4.3466337898410435e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.9375, + "logps/chosen": -872.0, + "logps/rejected": -996.0, + "loss": 0.4024, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.8125, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.3125, + "step": 8380 + }, + { + "epoch": 0.3122964396716979, + "grad_norm": 6.778031540663945, + "learning_rate": 4.3444425328875013e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.65625, + "logps/chosen": -876.0, + "logps/rejected": -1032.0, + "loss": 0.4169, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.84375, + "rewards/margins": 1.921875, + "rewards/rejected": -8.75, + "step": 8390 + }, + { + "epoch": 0.3126686642720217, + "grad_norm": 6.128481494621989, + "learning_rate": 4.3422481618948236e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.9375, + "logps/chosen": -876.0, + "logps/rejected": -1000.0, + "loss": 0.4053, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.03125, + "rewards/margins": 1.390625, + "rewards/rejected": -8.4375, + "step": 8400 + }, + { + "epoch": 0.31304088887234555, + "grad_norm": 6.150966985232953, + "learning_rate": 4.340050680567846e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.859375, + "logps/chosen": -856.0, + "logps/rejected": -996.0, + "loss": 0.424, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.6875, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.375, + "step": 8410 + }, + { + "epoch": 0.3134131134726694, + "grad_norm": 7.923365210705741, + "learning_rate": 4.337850092616656e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.734375, + "logps/chosen": -828.0, + "logps/rejected": -964.0, + "loss": 0.393, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.40625, + "rewards/margins": 1.7421875, + "rewards/rejected": -8.125, + "step": 8420 + }, + { + "epoch": 0.31378533807299325, + "grad_norm": 5.894568629562948, + "learning_rate": 4.3356464017565856e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.90625, + "logps/chosen": -888.0, + "logps/rejected": -996.0, + "loss": 0.4199, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.03125, + "rewards/margins": 1.2578125, + "rewards/rejected": -8.3125, + "step": 8430 + }, + { + "epoch": 0.31415756267331707, + "grad_norm": 6.13674719047374, + "learning_rate": 4.333439611708206e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.71875, + "logps/chosen": -848.0, + "logps/rejected": -1020.0, + "loss": 0.393, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.703125, + "rewards/rejected": -8.5, + "step": 8440 + }, + { + "epoch": 0.3145297872736409, + "grad_norm": 6.436436029161063, + "learning_rate": 4.3312297261973206e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.8125, + "logps/chosen": -852.0, + "logps/rejected": -988.0, + "loss": 0.4053, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.59375, + "rewards/margins": 1.4375, + "rewards/rejected": -8.0625, + "step": 8450 + }, + { + "epoch": 0.31490201187396477, + "grad_norm": 5.632353398865315, + "learning_rate": 4.32901674895496e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -804.0, + "logps/rejected": -932.0, + "loss": 0.4105, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.25, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.78125, + "step": 8460 + }, + { + "epoch": 0.3152742364742886, + "grad_norm": 6.818178988917069, + "learning_rate": 4.326800683717373e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.6875, + "logps/chosen": -848.0, + "logps/rejected": -1020.0, + "loss": 0.4177, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.65625, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.375, + "step": 8470 + }, + { + "epoch": 0.3156464610746124, + "grad_norm": 5.785602357971954, + "learning_rate": 4.324581534226023e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -904.0, + "logps/rejected": -1004.0, + "loss": 0.4283, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.0625, + "rewards/margins": 1.2734375, + "rewards/rejected": -8.375, + "step": 8480 + }, + { + "epoch": 0.31601868567493624, + "grad_norm": 6.860288559968709, + "learning_rate": 4.32235930422758e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.921875, + "logps/chosen": -872.0, + "logps/rejected": -984.0, + "loss": 0.3962, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.78125, + "rewards/margins": 1.265625, + "rewards/rejected": -8.0625, + "step": 8490 + }, + { + "epoch": 0.3163909102752601, + "grad_norm": 6.6580316008849705, + "learning_rate": 4.3201339974739165e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -852.0, + "logps/rejected": -968.0, + "loss": 0.4244, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.625, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.0625, + "step": 8500 + }, + { + "epoch": 0.31676313487558394, + "grad_norm": 7.4233344738729485, + "learning_rate": 4.3179056177220976e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.890625, + "logps/chosen": -832.0, + "logps/rejected": -968.0, + "loss": 0.4262, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.5625, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.0625, + "step": 8510 + }, + { + "epoch": 0.31713535947590776, + "grad_norm": 6.83893181284603, + "learning_rate": 4.3156741687343776e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.859375, + "logps/chosen": -828.0, + "logps/rejected": -956.0, + "loss": 0.4418, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.53125, + "rewards/margins": 1.3203125, + "rewards/rejected": -7.84375, + "step": 8520 + }, + { + "epoch": 0.3175075840762316, + "grad_norm": 6.014146334675527, + "learning_rate": 4.313439654278194e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.953125, + "logps/chosen": -848.0, + "logps/rejected": -956.0, + "loss": 0.4105, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.5, + "rewards/margins": 1.328125, + "rewards/rejected": -7.84375, + "step": 8530 + }, + { + "epoch": 0.3178798086765554, + "grad_norm": 5.359151664689992, + "learning_rate": 4.311202078126156e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.8125, + "logps/chosen": -868.0, + "logps/rejected": -972.0, + "loss": 0.4162, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.5625, + "rewards/margins": 1.4140625, + "rewards/rejected": -7.96875, + "step": 8540 + }, + { + "epoch": 0.3182520332768793, + "grad_norm": 5.012945828943925, + "learning_rate": 4.308961444056046e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.859375, + "logps/chosen": -828.0, + "logps/rejected": -964.0, + "loss": 0.4209, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.53125, + "rewards/margins": 1.296875, + "rewards/rejected": -7.8125, + "step": 8550 + }, + { + "epoch": 0.3186242578772031, + "grad_norm": 7.952124582877079, + "learning_rate": 4.306717755850808e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.796875, + "logps/chosen": -828.0, + "logps/rejected": -968.0, + "loss": 0.4054, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.4375, + "rewards/margins": 1.484375, + "rewards/rejected": -7.9375, + "step": 8560 + }, + { + "epoch": 0.31899648247752693, + "grad_norm": 5.187751163398861, + "learning_rate": 4.304471017298542e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -860.0, + "logps/rejected": -968.0, + "loss": 0.4079, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.65625, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.0625, + "step": 8570 + }, + { + "epoch": 0.31936870707785076, + "grad_norm": 5.961024049387112, + "learning_rate": 4.302221232192497e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.8125, + "logps/chosen": -856.0, + "logps/rejected": -992.0, + "loss": 0.4286, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.65625, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.1875, + "step": 8580 + }, + { + "epoch": 0.31974093167817463, + "grad_norm": 5.7088461056840245, + "learning_rate": 4.2999684043310667e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.90625, + "logps/chosen": -836.0, + "logps/rejected": -952.0, + "loss": 0.3969, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.375, + "rewards/margins": 1.5, + "rewards/rejected": -7.875, + "step": 8590 + }, + { + "epoch": 0.32011315627849846, + "grad_norm": 5.619002792846216, + "learning_rate": 4.297712537517784e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -836.0, + "logps/rejected": -988.0, + "loss": 0.3823, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -6.5, + "rewards/margins": 1.5, + "rewards/rejected": -8.0, + "step": 8600 + }, + { + "epoch": 0.3204853808788223, + "grad_norm": 8.099589563398085, + "learning_rate": 4.295453635561308e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.84375, + "logps/chosen": -868.0, + "logps/rejected": -1008.0, + "loss": 0.4243, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.625, + "rewards/margins": 1.8046875, + "rewards/rejected": -8.4375, + "step": 8610 + }, + { + "epoch": 0.3208576054791461, + "grad_norm": 4.926184751372829, + "learning_rate": 4.293191702275426e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.71875, + "logps/chosen": -848.0, + "logps/rejected": -976.0, + "loss": 0.3989, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.75, + "rewards/margins": 1.390625, + "rewards/rejected": -8.125, + "step": 8620 + }, + { + "epoch": 0.3212298300794699, + "grad_norm": 6.726433965744231, + "learning_rate": 4.290926741479043e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -824.0, + "logps/rejected": -940.0, + "loss": 0.4241, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.25, + "rewards/margins": 1.5, + "rewards/rejected": -7.75, + "step": 8630 + }, + { + "epoch": 0.3216020546797938, + "grad_norm": 6.553744668409475, + "learning_rate": 4.288658756996172e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.84375, + "logps/chosen": -836.0, + "logps/rejected": -984.0, + "loss": 0.4081, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.46875, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.0625, + "step": 8640 + }, + { + "epoch": 0.3219742792801176, + "grad_norm": 6.188877117500308, + "learning_rate": 4.2863877526559344e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.59375, + "logps/chosen": -856.0, + "logps/rejected": -980.0, + "loss": 0.4081, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.59375, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.0625, + "step": 8650 + }, + { + "epoch": 0.32234650388044145, + "grad_norm": 6.087998287649099, + "learning_rate": 4.2841137322925493e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.828125, + "logps/chosen": -832.0, + "logps/rejected": -980.0, + "loss": 0.3958, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.65625, + "rewards/margins": 1.5625, + "rewards/rejected": -8.25, + "step": 8660 + }, + { + "epoch": 0.32271872848076527, + "grad_norm": 6.23375850844606, + "learning_rate": 4.281836699745327e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.703125, + "logps/chosen": -860.0, + "logps/rejected": -1004.0, + "loss": 0.4059, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.8125, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.4375, + "step": 8670 + }, + { + "epoch": 0.32309095308108915, + "grad_norm": 6.648691687792136, + "learning_rate": 4.279556658858665e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.859375, + "logps/chosen": -864.0, + "logps/rejected": -1000.0, + "loss": 0.4363, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.5, + "rewards/rejected": -8.25, + "step": 8680 + }, + { + "epoch": 0.32346317768141297, + "grad_norm": 5.860269394976744, + "learning_rate": 4.2772736134820385e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.90625, + "logps/chosen": -872.0, + "logps/rejected": -1004.0, + "loss": 0.4016, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.71875, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.3125, + "step": 8690 + }, + { + "epoch": 0.3238354022817368, + "grad_norm": 5.9892684094158035, + "learning_rate": 4.2749875674699954e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.875, + "logps/chosen": -860.0, + "logps/rejected": -992.0, + "loss": 0.4145, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.5625, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.0625, + "step": 8700 + }, + { + "epoch": 0.3242076268820606, + "grad_norm": 6.1944503642342195, + "learning_rate": 4.2726985246821507e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.703125, + "logps/chosen": -820.0, + "logps/rejected": -984.0, + "loss": 0.3929, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.375, + "rewards/margins": 1.625, + "rewards/rejected": -8.0, + "step": 8710 + }, + { + "epoch": 0.3245798514823845, + "grad_norm": 6.44235967655113, + "learning_rate": 4.270406488983177e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.6875, + "logps/chosen": -832.0, + "logps/rejected": -988.0, + "loss": 0.4196, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.53125, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.25, + "step": 8720 + }, + { + "epoch": 0.3249520760827083, + "grad_norm": 7.6313692046854555, + "learning_rate": 4.268111464242803e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -840.0, + "logps/rejected": -984.0, + "loss": 0.4136, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.46875, + "rewards/margins": 1.609375, + "rewards/rejected": -8.0625, + "step": 8730 + }, + { + "epoch": 0.32532430068303214, + "grad_norm": 7.331661181727046, + "learning_rate": 4.2658134543358e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.78125, + "logps/chosen": -844.0, + "logps/rejected": -988.0, + "loss": 0.388, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.625, + "rewards/margins": 1.46875, + "rewards/rejected": -8.125, + "step": 8740 + }, + { + "epoch": 0.32569652528335596, + "grad_norm": 6.390430330476552, + "learning_rate": 4.2635124631419827e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -844.0, + "logps/rejected": -956.0, + "loss": 0.4068, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.65625, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.0625, + "step": 8750 + }, + { + "epoch": 0.3260687498836798, + "grad_norm": 6.260206823127818, + "learning_rate": 4.261208494546198e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.796875, + "logps/chosen": -824.0, + "logps/rejected": -956.0, + "loss": 0.4251, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.5625, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.0625, + "step": 8760 + }, + { + "epoch": 0.32644097448400367, + "grad_norm": 5.761717086475829, + "learning_rate": 4.2589015524383187e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.75, + "logps/chosen": -816.0, + "logps/rejected": -948.0, + "loss": 0.4155, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.28125, + "rewards/margins": 1.6484375, + "rewards/rejected": -7.9375, + "step": 8770 + }, + { + "epoch": 0.3268131990843275, + "grad_norm": 6.3090046654095575, + "learning_rate": 4.2565916407132393e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.828125, + "logps/chosen": -860.0, + "logps/rejected": -960.0, + "loss": 0.4102, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.59375, + "rewards/margins": 1.3046875, + "rewards/rejected": -7.90625, + "step": 8780 + }, + { + "epoch": 0.3271854236846513, + "grad_norm": 6.223308737357057, + "learning_rate": 4.254278763270867e-07, + "logits/chosen": -4.21875, + "logits/rejected": -3.9375, + "logps/chosen": -844.0, + "logps/rejected": -976.0, + "loss": 0.4323, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.65625, + "rewards/margins": 1.3828125, + "rewards/rejected": -8.0625, + "step": 8790 + }, + { + "epoch": 0.32755764828497513, + "grad_norm": 7.208264103283307, + "learning_rate": 4.251962924016117e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.828125, + "logps/chosen": -844.0, + "logps/rejected": -980.0, + "loss": 0.4141, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.65625, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.0625, + "step": 8800 + }, + { + "epoch": 0.327929872885299, + "grad_norm": 8.576776788145699, + "learning_rate": 4.2496441268589047e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.984375, + "logps/chosen": -864.0, + "logps/rejected": -988.0, + "loss": 0.4005, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.53125, + "rewards/margins": 1.578125, + "rewards/rejected": -8.125, + "step": 8810 + }, + { + "epoch": 0.32830209748562283, + "grad_norm": 6.5268376884150685, + "learning_rate": 4.2473223757141386e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.9375, + "logps/chosen": -888.0, + "logps/rejected": -1040.0, + "loss": 0.3926, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -6.875, + "rewards/margins": 1.7421875, + "rewards/rejected": -8.625, + "step": 8820 + }, + { + "epoch": 0.32867432208594666, + "grad_norm": 6.870042330887718, + "learning_rate": 4.2449976745017157e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.859375, + "logps/chosen": -860.0, + "logps/rejected": -1000.0, + "loss": 0.4096, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.625, + "rewards/margins": 1.5703125, + "rewards/rejected": -8.1875, + "step": 8830 + }, + { + "epoch": 0.3290465466862705, + "grad_norm": 6.745719900706627, + "learning_rate": 4.2426700271465134e-07, + "logits/chosen": -4.09375, + "logits/rejected": -4.0625, + "logps/chosen": -840.0, + "logps/rejected": -972.0, + "loss": 0.3994, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.4375, + "rewards/margins": 1.5625, + "rewards/rejected": -8.0, + "step": 8840 + }, + { + "epoch": 0.32941877128659436, + "grad_norm": 6.902855629530909, + "learning_rate": 4.240339437578383e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -804.0, + "logps/rejected": -928.0, + "loss": 0.4104, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.09375, + "rewards/margins": 1.640625, + "rewards/rejected": -7.71875, + "step": 8850 + }, + { + "epoch": 0.3297909958869182, + "grad_norm": 5.8133105508535, + "learning_rate": 4.238005909732144e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -800.0, + "logps/rejected": -956.0, + "loss": 0.3944, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.0625, + "rewards/margins": 1.8515625, + "rewards/rejected": -7.9375, + "step": 8860 + }, + { + "epoch": 0.330163220487242, + "grad_norm": 5.924084881415485, + "learning_rate": 4.235669447547574e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.796875, + "logps/chosen": -816.0, + "logps/rejected": -972.0, + "loss": 0.413, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.40625, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.0625, + "step": 8870 + }, + { + "epoch": 0.3305354450875658, + "grad_norm": 6.033984333254001, + "learning_rate": 4.2333300549694085e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -828.0, + "logps/rejected": -944.0, + "loss": 0.4177, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.6875, + "rewards/margins": 1.359375, + "rewards/rejected": -8.0625, + "step": 8880 + }, + { + "epoch": 0.33090766968788965, + "grad_norm": 5.071695094721961, + "learning_rate": 4.2309877359473277e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.703125, + "logps/chosen": -796.0, + "logps/rejected": -900.0, + "loss": 0.4217, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.375, + "rewards/margins": 1.2578125, + "rewards/rejected": -7.625, + "step": 8890 + }, + { + "epoch": 0.33127989428821353, + "grad_norm": 6.004609156857372, + "learning_rate": 4.2286424944359547e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.953125, + "logps/chosen": -820.0, + "logps/rejected": -944.0, + "loss": 0.4247, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.28125, + "rewards/margins": 1.609375, + "rewards/rejected": -7.875, + "step": 8900 + }, + { + "epoch": 0.33165211888853735, + "grad_norm": 6.8374250518691415, + "learning_rate": 4.2262943343948445e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.6875, + "logps/chosen": -852.0, + "logps/rejected": -976.0, + "loss": 0.4091, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.1953125, + "rewards/rejected": -7.9375, + "step": 8910 + }, + { + "epoch": 0.3320243434888612, + "grad_norm": 5.666561979657318, + "learning_rate": 4.223943259788481e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.703125, + "logps/chosen": -840.0, + "logps/rejected": -988.0, + "loss": 0.3929, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.5, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.0625, + "step": 8920 + }, + { + "epoch": 0.332396568089185, + "grad_norm": 5.56437214907557, + "learning_rate": 4.22158927458627e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.8125, + "logps/chosen": -840.0, + "logps/rejected": -988.0, + "loss": 0.4217, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.5625, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.125, + "step": 8930 + }, + { + "epoch": 0.3327687926895089, + "grad_norm": 5.9009263619579215, + "learning_rate": 4.219232382762528e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -828.0, + "logps/rejected": -976.0, + "loss": 0.4046, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.46875, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.0, + "step": 8940 + }, + { + "epoch": 0.3331410172898327, + "grad_norm": 6.088222804779362, + "learning_rate": 4.2168725882964825e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -780.0, + "logps/rejected": -924.0, + "loss": 0.4241, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.09375, + "rewards/margins": 1.5, + "rewards/rejected": -7.59375, + "step": 8950 + }, + { + "epoch": 0.3335132418901565, + "grad_norm": 5.890491853155072, + "learning_rate": 4.2145098951722584e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.71875, + "logps/chosen": -824.0, + "logps/rejected": -984.0, + "loss": 0.428, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.40625, + "rewards/margins": 1.671875, + "rewards/rejected": -8.0625, + "step": 8960 + }, + { + "epoch": 0.33388546649048034, + "grad_norm": 5.790425010171351, + "learning_rate": 4.2121443073788775e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.703125, + "logps/chosen": -816.0, + "logps/rejected": -980.0, + "loss": 0.3932, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.40625, + "rewards/margins": 1.640625, + "rewards/rejected": -8.0625, + "step": 8970 + }, + { + "epoch": 0.33425769109080417, + "grad_norm": 6.041405800344959, + "learning_rate": 4.209775828910247e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -828.0, + "logps/rejected": -980.0, + "loss": 0.4096, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.34375, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.0, + "step": 8980 + }, + { + "epoch": 0.33462991569112804, + "grad_norm": 5.852364410055907, + "learning_rate": 4.207404463765154e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.96875, + "logps/chosen": -808.0, + "logps/rejected": -960.0, + "loss": 0.3975, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.34375, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.0625, + "step": 8990 + }, + { + "epoch": 0.33500214029145187, + "grad_norm": 6.165639730007472, + "learning_rate": 4.205030215947261e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.6875, + "logps/chosen": -816.0, + "logps/rejected": -956.0, + "loss": 0.4232, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.28125, + "rewards/margins": 1.578125, + "rewards/rejected": -7.84375, + "step": 9000 + }, + { + "epoch": 0.3353743648917757, + "grad_norm": 7.5286732545518245, + "learning_rate": 4.202653089465097e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.796875, + "logps/chosen": -800.0, + "logps/rejected": -956.0, + "loss": 0.4124, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.1875, + "rewards/margins": 1.5703125, + "rewards/rejected": -7.75, + "step": 9010 + }, + { + "epoch": 0.3357465894920995, + "grad_norm": 6.041701210362503, + "learning_rate": 4.2002730883320493e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.96875, + "logps/chosen": -816.0, + "logps/rejected": -968.0, + "loss": 0.4149, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.3125, + "rewards/margins": 1.609375, + "rewards/rejected": -7.90625, + "step": 9020 + }, + { + "epoch": 0.3361188140924234, + "grad_norm": 5.500827668613241, + "learning_rate": 4.1978902165663616e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.859375, + "logps/chosen": -844.0, + "logps/rejected": -972.0, + "loss": 0.4225, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.59375, + "rewards/margins": 1.484375, + "rewards/rejected": -8.125, + "step": 9030 + }, + { + "epoch": 0.3364910386927472, + "grad_norm": 5.807049103425073, + "learning_rate": 4.1955044781911215e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -880.0, + "logps/rejected": -1016.0, + "loss": 0.4421, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.0, + "rewards/margins": 1.3359375, + "rewards/rejected": -8.375, + "step": 9040 + }, + { + "epoch": 0.33686326329307104, + "grad_norm": 7.980671508713517, + "learning_rate": 4.193115877234258e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.875, + "logps/chosen": -848.0, + "logps/rejected": -964.0, + "loss": 0.4251, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -6.71875, + "rewards/margins": 1.28125, + "rewards/rejected": -8.0, + "step": 9050 + }, + { + "epoch": 0.33723548789339486, + "grad_norm": 5.885217286326728, + "learning_rate": 4.1907244177285326e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.953125, + "logps/chosen": -844.0, + "logps/rejected": -956.0, + "loss": 0.4229, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.78125, + "rewards/margins": 1.3046875, + "rewards/rejected": -8.0625, + "step": 9060 + }, + { + "epoch": 0.33760771249371874, + "grad_norm": 5.777807317558145, + "learning_rate": 4.188330103711533e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.828125, + "logps/chosen": -832.0, + "logps/rejected": -984.0, + "loss": 0.4021, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.53125, + "rewards/margins": 1.625, + "rewards/rejected": -8.125, + "step": 9070 + }, + { + "epoch": 0.33797993709404256, + "grad_norm": 7.552208779159908, + "learning_rate": 4.185932939225666e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -880.0, + "logps/rejected": -996.0, + "loss": 0.4264, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.9375, + "rewards/margins": 1.2421875, + "rewards/rejected": -8.1875, + "step": 9080 + }, + { + "epoch": 0.3383521616943664, + "grad_norm": 6.394021170531517, + "learning_rate": 4.1835329283181506e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -848.0, + "logps/rejected": -988.0, + "loss": 0.4021, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.625, + "rewards/margins": 1.421875, + "rewards/rejected": -8.0625, + "step": 9090 + }, + { + "epoch": 0.3387243862946902, + "grad_norm": 8.363072057386074, + "learning_rate": 4.1811300750410137e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.875, + "logps/chosen": -848.0, + "logps/rejected": -964.0, + "loss": 0.4163, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.1875, + "step": 9100 + }, + { + "epoch": 0.33909661089501403, + "grad_norm": 6.225915898034823, + "learning_rate": 4.1787243834510793e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.859375, + "logps/chosen": -856.0, + "logps/rejected": -968.0, + "loss": 0.4194, + "rewards/accuracies": 0.71875, + "rewards/chosen": -6.5625, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.0, + "step": 9110 + }, + { + "epoch": 0.3394688354953379, + "grad_norm": 6.5489406352606165, + "learning_rate": 4.176315857609963e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.9375, + "logps/chosen": -904.0, + "logps/rejected": -980.0, + "loss": 0.4306, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.21875, + "rewards/rejected": -7.96875, + "step": 9120 + }, + { + "epoch": 0.33984106009566173, + "grad_norm": 6.370264442851537, + "learning_rate": 4.173904501584066e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.859375, + "logps/chosen": -876.0, + "logps/rejected": -1000.0, + "loss": 0.427, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.96875, + "rewards/margins": 1.5, + "rewards/rejected": -8.4375, + "step": 9130 + }, + { + "epoch": 0.34021328469598555, + "grad_norm": 6.239792194567684, + "learning_rate": 4.1714903194445686e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.765625, + "logps/chosen": -888.0, + "logps/rejected": -1020.0, + "loss": 0.4211, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -6.875, + "rewards/margins": 1.5, + "rewards/rejected": -8.375, + "step": 9140 + }, + { + "epoch": 0.3405855092963094, + "grad_norm": 7.131153346474517, + "learning_rate": 4.169073315267421e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.96875, + "logps/chosen": -884.0, + "logps/rejected": -964.0, + "loss": 0.4115, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.90625, + "rewards/margins": 1.234375, + "rewards/rejected": -8.125, + "step": 9150 + }, + { + "epoch": 0.34095773389663325, + "grad_norm": 6.791941199489257, + "learning_rate": 4.1666534931333406e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.96875, + "logps/chosen": -864.0, + "logps/rejected": -980.0, + "loss": 0.4201, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.6875, + "rewards/margins": 1.390625, + "rewards/rejected": -8.0625, + "step": 9160 + }, + { + "epoch": 0.3413299584969571, + "grad_norm": 6.861874229852902, + "learning_rate": 4.1642308571277996e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.875, + "logps/chosen": -852.0, + "logps/rejected": -992.0, + "loss": 0.4183, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.65625, + "rewards/margins": 1.609375, + "rewards/rejected": -8.25, + "step": 9170 + }, + { + "epoch": 0.3417021830972809, + "grad_norm": 6.073376330025923, + "learning_rate": 4.1618054113410217e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.78125, + "logps/chosen": -856.0, + "logps/rejected": -992.0, + "loss": 0.393, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.6875, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.125, + "step": 9180 + }, + { + "epoch": 0.3420744076976047, + "grad_norm": 6.766012141847919, + "learning_rate": 4.159377159867976e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.65625, + "logps/chosen": -852.0, + "logps/rejected": -1004.0, + "loss": 0.412, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.96875, + "rewards/margins": 1.53125, + "rewards/rejected": -8.5, + "step": 9190 + }, + { + "epoch": 0.34244663229792854, + "grad_norm": 5.881485789495539, + "learning_rate": 4.1569461068083664e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.828125, + "logps/chosen": -880.0, + "logps/rejected": -1016.0, + "loss": 0.4273, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.90625, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.375, + "step": 9200 + }, + { + "epoch": 0.3428188568982524, + "grad_norm": 6.149657891629919, + "learning_rate": 4.154512256266629e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.859375, + "logps/chosen": -832.0, + "logps/rejected": -948.0, + "loss": 0.4181, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.4375, + "rewards/margins": 1.3515625, + "rewards/rejected": -7.8125, + "step": 9210 + }, + { + "epoch": 0.34319108149857624, + "grad_norm": 6.103269128159296, + "learning_rate": 4.152075612351921e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -852.0, + "logps/rejected": -980.0, + "loss": 0.3943, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.625, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.125, + "step": 9220 + }, + { + "epoch": 0.34356330609890007, + "grad_norm": 6.8721754063831035, + "learning_rate": 4.149636179178117e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.875, + "logps/chosen": -880.0, + "logps/rejected": -992.0, + "loss": 0.4249, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -6.96875, + "rewards/margins": 1.3828125, + "rewards/rejected": -8.3125, + "step": 9230 + }, + { + "epoch": 0.3439355306992239, + "grad_norm": 6.921635966074735, + "learning_rate": 4.1471939608637997e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.84375, + "logps/chosen": -860.0, + "logps/rejected": -1020.0, + "loss": 0.4273, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.8125, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.4375, + "step": 9240 + }, + { + "epoch": 0.34430775529954777, + "grad_norm": 6.068303934933823, + "learning_rate": 4.144748961532255e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -848.0, + "logps/rejected": -984.0, + "loss": 0.4055, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.59375, + "rewards/margins": 1.515625, + "rewards/rejected": -8.125, + "step": 9250 + }, + { + "epoch": 0.3446799798998716, + "grad_norm": 6.6380746622565, + "learning_rate": 4.1423011853114644e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.921875, + "logps/chosen": -856.0, + "logps/rejected": -964.0, + "loss": 0.4191, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.5, + "rewards/margins": 1.40625, + "rewards/rejected": -7.90625, + "step": 9260 + }, + { + "epoch": 0.3450522045001954, + "grad_norm": 5.882505378159859, + "learning_rate": 4.1398506363340965e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -832.0, + "logps/rejected": -960.0, + "loss": 0.401, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.5, + "rewards/margins": 1.421875, + "rewards/rejected": -7.90625, + "step": 9270 + }, + { + "epoch": 0.34542442910051924, + "grad_norm": 6.426011847463431, + "learning_rate": 4.137397318737502e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.6875, + "logps/chosen": -836.0, + "logps/rejected": -984.0, + "loss": 0.4015, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.5625, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.1875, + "step": 9280 + }, + { + "epoch": 0.3457966537008431, + "grad_norm": 7.2104806165875726, + "learning_rate": 4.134941236663706e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.703125, + "logps/chosen": -820.0, + "logps/rejected": -1016.0, + "loss": 0.4209, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.46875, + "rewards/margins": 1.984375, + "rewards/rejected": -8.5, + "step": 9290 + }, + { + "epoch": 0.34616887830116694, + "grad_norm": 7.35171826367392, + "learning_rate": 4.132482394259401e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -800.0, + "logps/rejected": -948.0, + "loss": 0.4099, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.5625, + "rewards/rejected": -7.875, + "step": 9300 + }, + { + "epoch": 0.34654110290149076, + "grad_norm": 6.141606417222074, + "learning_rate": 4.1300207956759395e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.90625, + "logps/chosen": -836.0, + "logps/rejected": -964.0, + "loss": 0.4253, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.59375, + "rewards/margins": 1.421875, + "rewards/rejected": -8.0, + "step": 9310 + }, + { + "epoch": 0.3469133275018146, + "grad_norm": 7.164569397555365, + "learning_rate": 4.127556445069328e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -800.0, + "logps/rejected": -948.0, + "loss": 0.4077, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.21875, + "rewards/margins": 1.625, + "rewards/rejected": -7.84375, + "step": 9320 + }, + { + "epoch": 0.3472855521021384, + "grad_norm": 7.137950738605295, + "learning_rate": 4.125089346600218e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.796875, + "logps/chosen": -860.0, + "logps/rejected": -1008.0, + "loss": 0.4082, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.625, + "rewards/rejected": -8.375, + "step": 9330 + }, + { + "epoch": 0.3476577767024623, + "grad_norm": 7.051170004750458, + "learning_rate": 4.122619504433902e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -852.0, + "logps/rejected": -976.0, + "loss": 0.4213, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.5625, + "rewards/margins": 1.34375, + "rewards/rejected": -7.9375, + "step": 9340 + }, + { + "epoch": 0.3480300013027861, + "grad_norm": 5.536612127727956, + "learning_rate": 4.120146922740303e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.703125, + "logps/chosen": -828.0, + "logps/rejected": -976.0, + "loss": 0.4164, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.40625, + "rewards/margins": 1.578125, + "rewards/rejected": -7.96875, + "step": 9350 + }, + { + "epoch": 0.34840222590310993, + "grad_norm": 5.569949171199698, + "learning_rate": 4.1176716056939715e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.90625, + "logps/chosen": -852.0, + "logps/rejected": -980.0, + "loss": 0.3928, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.5, + "rewards/margins": 1.4765625, + "rewards/rejected": -7.96875, + "step": 9360 + }, + { + "epoch": 0.34877445050343375, + "grad_norm": 6.482695065678995, + "learning_rate": 4.115193557474074e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -804.0, + "logps/rejected": -948.0, + "loss": 0.4086, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.4375, + "rewards/margins": 1.4453125, + "rewards/rejected": -7.875, + "step": 9370 + }, + { + "epoch": 0.34914667510375763, + "grad_norm": 6.889701996051546, + "learning_rate": 4.1127127822643894e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.671875, + "logps/chosen": -836.0, + "logps/rejected": -972.0, + "loss": 0.4133, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.59375, + "rewards/margins": 1.421875, + "rewards/rejected": -8.0, + "step": 9380 + }, + { + "epoch": 0.34951889970408145, + "grad_norm": 6.720031347736244, + "learning_rate": 4.1102292842533004e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -868.0, + "logps/rejected": -1008.0, + "loss": 0.4125, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.78125, + "rewards/margins": 1.625, + "rewards/rejected": -8.4375, + "step": 9390 + }, + { + "epoch": 0.3498911243044053, + "grad_norm": 4.933620099747848, + "learning_rate": 4.1077430676337867e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.5, + "logps/chosen": -832.0, + "logps/rejected": -992.0, + "loss": 0.4053, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.65625, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.25, + "step": 9400 + }, + { + "epoch": 0.3502633489047291, + "grad_norm": 7.255235719368424, + "learning_rate": 4.1052541366034174e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.609375, + "logps/chosen": -800.0, + "logps/rejected": -944.0, + "loss": 0.4025, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.3125, + "rewards/margins": 1.6328125, + "rewards/rejected": -7.9375, + "step": 9410 + }, + { + "epoch": 0.3506355735050529, + "grad_norm": 7.6839958173409055, + "learning_rate": 4.102762495364346e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.859375, + "logps/chosen": -824.0, + "logps/rejected": -972.0, + "loss": 0.4309, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.5625, + "rewards/margins": 1.546875, + "rewards/rejected": -8.125, + "step": 9420 + }, + { + "epoch": 0.3510077981053768, + "grad_norm": 5.841110947628403, + "learning_rate": 4.100268148123299e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.84375, + "logps/chosen": -864.0, + "logps/rejected": -984.0, + "loss": 0.4058, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.625, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.0625, + "step": 9430 + }, + { + "epoch": 0.3513800227057006, + "grad_norm": 5.481293636604824, + "learning_rate": 4.0977710990915747e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.78125, + "logps/chosen": -836.0, + "logps/rejected": -964.0, + "loss": 0.3984, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.71875, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.1875, + "step": 9440 + }, + { + "epoch": 0.35175224730602445, + "grad_norm": 7.690837125250735, + "learning_rate": 4.0952713524850313e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.84375, + "logps/chosen": -852.0, + "logps/rejected": -980.0, + "loss": 0.4106, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.53125, + "rewards/margins": 1.515625, + "rewards/rejected": -8.0625, + "step": 9450 + }, + { + "epoch": 0.35212447190634827, + "grad_norm": 7.095617053942233, + "learning_rate": 4.0927689125240806e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.78125, + "logps/chosen": -832.0, + "logps/rejected": -964.0, + "loss": 0.4277, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.21875, + "rewards/margins": 1.5078125, + "rewards/rejected": -7.71875, + "step": 9460 + }, + { + "epoch": 0.35249669650667215, + "grad_norm": 5.665000442318552, + "learning_rate": 4.090263783433683e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -836.0, + "logps/rejected": -968.0, + "loss": 0.4353, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.53125, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.0, + "step": 9470 + }, + { + "epoch": 0.35286892110699597, + "grad_norm": 6.6790604780930005, + "learning_rate": 4.0877559694433384e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -844.0, + "logps/rejected": -972.0, + "loss": 0.3913, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.59375, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.125, + "step": 9480 + }, + { + "epoch": 0.3532411457073198, + "grad_norm": 7.265344769439008, + "learning_rate": 4.0852454747870807e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.8125, + "logps/chosen": -852.0, + "logps/rejected": -956.0, + "loss": 0.4349, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -6.75, + "rewards/margins": 1.1796875, + "rewards/rejected": -7.90625, + "step": 9490 + }, + { + "epoch": 0.3536133703076436, + "grad_norm": 6.656558714753696, + "learning_rate": 4.082732303703469e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.640625, + "logps/chosen": -804.0, + "logps/rejected": -920.0, + "loss": 0.4135, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.15625, + "rewards/margins": 1.2890625, + "rewards/rejected": -7.4375, + "step": 9500 + }, + { + "epoch": 0.3539855949079675, + "grad_norm": 5.906756468220538, + "learning_rate": 4.0802164604355805e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.8125, + "logps/chosen": -848.0, + "logps/rejected": -956.0, + "loss": 0.4097, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.65625, + "rewards/margins": 1.3046875, + "rewards/rejected": -7.9375, + "step": 9510 + }, + { + "epoch": 0.3543578195082913, + "grad_norm": 6.394831334208994, + "learning_rate": 4.077697949231005e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.71875, + "logps/chosen": -844.0, + "logps/rejected": -984.0, + "loss": 0.4172, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.71875, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.1875, + "step": 9520 + }, + { + "epoch": 0.35473004410861514, + "grad_norm": 6.700397024654636, + "learning_rate": 4.075176774341835e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -848.0, + "logps/rejected": -972.0, + "loss": 0.4128, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.71875, + "rewards/margins": 1.2890625, + "rewards/rejected": -8.0, + "step": 9530 + }, + { + "epoch": 0.35510226870893896, + "grad_norm": 6.421194975246333, + "learning_rate": 4.0726529400246634e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.546875, + "logps/chosen": -788.0, + "logps/rejected": -952.0, + "loss": 0.4137, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.3125, + "rewards/margins": 1.65625, + "rewards/rejected": -7.96875, + "step": 9540 + }, + { + "epoch": 0.3554744933092628, + "grad_norm": 6.507157642196768, + "learning_rate": 4.070126450540569e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.828125, + "logps/chosen": -880.0, + "logps/rejected": -1004.0, + "loss": 0.4091, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.8125, + "rewards/margins": 1.390625, + "rewards/rejected": -8.1875, + "step": 9550 + }, + { + "epoch": 0.35584671790958666, + "grad_norm": 5.867565943804244, + "learning_rate": 4.0675973101551177e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.609375, + "logps/chosen": -808.0, + "logps/rejected": -976.0, + "loss": 0.4041, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.4375, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.0, + "step": 9560 + }, + { + "epoch": 0.3562189425099105, + "grad_norm": 6.552527694586657, + "learning_rate": 4.065065523138347e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.703125, + "logps/chosen": -820.0, + "logps/rejected": -972.0, + "loss": 0.4143, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.53125, + "rewards/margins": 1.5703125, + "rewards/rejected": -8.125, + "step": 9570 + }, + { + "epoch": 0.3565911671102343, + "grad_norm": 6.0695908704161505, + "learning_rate": 4.062531093764764e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.796875, + "logps/chosen": -832.0, + "logps/rejected": -984.0, + "loss": 0.4128, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.375, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.0625, + "step": 9580 + }, + { + "epoch": 0.35696339171055813, + "grad_norm": 6.038046759978597, + "learning_rate": 4.05999402631334e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.71875, + "logps/chosen": -868.0, + "logps/rejected": -1008.0, + "loss": 0.413, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.65625, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.25, + "step": 9590 + }, + { + "epoch": 0.357335616310882, + "grad_norm": 5.787236047699248, + "learning_rate": 4.0574543250674973e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.84375, + "logps/chosen": -868.0, + "logps/rejected": -996.0, + "loss": 0.4198, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.84375, + "rewards/margins": 1.40625, + "rewards/rejected": -8.25, + "step": 9600 + }, + { + "epoch": 0.35770784091120583, + "grad_norm": 6.4799435976085915, + "learning_rate": 4.054911994315104e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.8125, + "logps/chosen": -912.0, + "logps/rejected": -1024.0, + "loss": 0.3904, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.578125, + "rewards/rejected": -8.3125, + "step": 9610 + }, + { + "epoch": 0.35808006551152965, + "grad_norm": 7.598979397793083, + "learning_rate": 4.052367038348471e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -880.0, + "logps/rejected": -1008.0, + "loss": 0.3771, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.875, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.5, + "step": 9620 + }, + { + "epoch": 0.3584522901118535, + "grad_norm": 6.462650275311091, + "learning_rate": 4.049819461464338e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.765625, + "logps/chosen": -856.0, + "logps/rejected": -988.0, + "loss": 0.4052, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.9375, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.5, + "step": 9630 + }, + { + "epoch": 0.3588245147121773, + "grad_norm": 7.127969543442139, + "learning_rate": 4.0472692679638733e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.734375, + "logps/chosen": -840.0, + "logps/rejected": -1016.0, + "loss": 0.3992, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.6875, + "rewards/margins": 1.8359375, + "rewards/rejected": -8.5625, + "step": 9640 + }, + { + "epoch": 0.3591967393125012, + "grad_norm": 7.264604843154183, + "learning_rate": 4.0447164621526586e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.65625, + "logps/chosen": -884.0, + "logps/rejected": -1048.0, + "loss": 0.3966, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.9375, + "rewards/margins": 1.71875, + "rewards/rejected": -8.6875, + "step": 9650 + }, + { + "epoch": 0.359568963912825, + "grad_norm": 6.041655908210674, + "learning_rate": 4.04216104834069e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.75, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.411, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.09375, + "rewards/margins": 1.640625, + "rewards/rejected": -8.6875, + "step": 9660 + }, + { + "epoch": 0.3599411885131488, + "grad_norm": 7.118305214555132, + "learning_rate": 4.0396030308423643e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.625, + "logps/chosen": -864.0, + "logps/rejected": -1040.0, + "loss": 0.4317, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.78125, + "rewards/margins": 1.765625, + "rewards/rejected": -8.5625, + "step": 9670 + }, + { + "epoch": 0.36031341311347265, + "grad_norm": 5.868559425967568, + "learning_rate": 4.037042413976476e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -864.0, + "logps/rejected": -1000.0, + "loss": 0.3892, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.8125, + "rewards/margins": 1.5703125, + "rewards/rejected": -8.375, + "step": 9680 + }, + { + "epoch": 0.3606856377137965, + "grad_norm": 5.408074753055558, + "learning_rate": 4.0344792020662067e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.703125, + "logps/chosen": -836.0, + "logps/rejected": -976.0, + "loss": 0.3867, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.3125, + "step": 9690 + }, + { + "epoch": 0.36105786231412035, + "grad_norm": 7.219656421844504, + "learning_rate": 4.0319133994391206e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.78125, + "logps/chosen": -888.0, + "logps/rejected": -1040.0, + "loss": 0.4187, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.875, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.4375, + "step": 9700 + }, + { + "epoch": 0.36143008691444417, + "grad_norm": 6.40071269787148, + "learning_rate": 4.0293450104271544e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.703125, + "logps/chosen": -856.0, + "logps/rejected": -988.0, + "loss": 0.4109, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.84375, + "rewards/margins": 1.484375, + "rewards/rejected": -8.3125, + "step": 9710 + }, + { + "epoch": 0.361802311514768, + "grad_norm": 6.562244074494197, + "learning_rate": 4.026774039366612e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -856.0, + "logps/rejected": -1012.0, + "loss": 0.4042, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.8125, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.375, + "step": 9720 + }, + { + "epoch": 0.36217453611509187, + "grad_norm": 6.822427416072704, + "learning_rate": 4.0242004905981587e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.828125, + "logps/chosen": -880.0, + "logps/rejected": -988.0, + "loss": 0.4295, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.2890625, + "rewards/rejected": -8.4375, + "step": 9730 + }, + { + "epoch": 0.3625467607154157, + "grad_norm": 5.471950994450153, + "learning_rate": 4.0216243684668073e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -848.0, + "logps/rejected": -988.0, + "loss": 0.4041, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.875, + "rewards/margins": 1.515625, + "rewards/rejected": -8.375, + "step": 9740 + }, + { + "epoch": 0.3629189853157395, + "grad_norm": 7.590254576888013, + "learning_rate": 4.019045677321921e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.796875, + "logps/chosen": -864.0, + "logps/rejected": -980.0, + "loss": 0.4069, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.65625, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.1875, + "step": 9750 + }, + { + "epoch": 0.36329120991606334, + "grad_norm": 6.184365090268907, + "learning_rate": 4.016464421517196e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.859375, + "logps/chosen": -844.0, + "logps/rejected": -980.0, + "loss": 0.4048, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.65625, + "rewards/margins": 1.515625, + "rewards/rejected": -8.125, + "step": 9760 + }, + { + "epoch": 0.36366343451638716, + "grad_norm": 6.879495523485304, + "learning_rate": 4.0138806054106604e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.84375, + "logps/chosen": -900.0, + "logps/rejected": -1012.0, + "loss": 0.4106, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.0625, + "rewards/margins": 1.296875, + "rewards/rejected": -8.375, + "step": 9770 + }, + { + "epoch": 0.36403565911671104, + "grad_norm": 7.191175493183634, + "learning_rate": 4.011294233364664e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.671875, + "logps/chosen": -884.0, + "logps/rejected": -1032.0, + "loss": 0.3942, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.90625, + "rewards/margins": 1.7734375, + "rewards/rejected": -8.6875, + "step": 9780 + }, + { + "epoch": 0.36440788371703486, + "grad_norm": 6.081213370303092, + "learning_rate": 4.0087053097458735e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.3756, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.875, + "step": 9790 + }, + { + "epoch": 0.3647801083173587, + "grad_norm": 7.29763235176727, + "learning_rate": 4.00611383892526e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.78125, + "logps/chosen": -832.0, + "logps/rejected": -988.0, + "loss": 0.4464, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.671875, + "rewards/rejected": -8.4375, + "step": 9800 + }, + { + "epoch": 0.3651523329176825, + "grad_norm": 6.738921621615778, + "learning_rate": 4.003519825278101e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -832.0, + "logps/rejected": -984.0, + "loss": 0.4262, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.40625, + "rewards/margins": 1.625, + "rewards/rejected": -8.0, + "step": 9810 + }, + { + "epoch": 0.3655245575180064, + "grad_norm": 7.030815345440591, + "learning_rate": 4.000923273183961e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -792.0, + "logps/rejected": -948.0, + "loss": 0.4004, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.25, + "rewards/margins": 1.75, + "rewards/rejected": -8.0, + "step": 9820 + }, + { + "epoch": 0.3658967821183302, + "grad_norm": 6.000374566301237, + "learning_rate": 3.9983241870266935e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -860.0, + "logps/rejected": -996.0, + "loss": 0.3927, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.84375, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.25, + "step": 9830 + }, + { + "epoch": 0.36626900671865403, + "grad_norm": 6.583633173464554, + "learning_rate": 3.995722571194431e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.71875, + "logps/chosen": -868.0, + "logps/rejected": -1008.0, + "loss": 0.4069, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.96875, + "rewards/margins": 1.3671875, + "rewards/rejected": -8.3125, + "step": 9840 + }, + { + "epoch": 0.36664123131897786, + "grad_norm": 7.813685347445612, + "learning_rate": 3.9931184300795746e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.78125, + "logps/chosen": -876.0, + "logps/rejected": -1012.0, + "loss": 0.413, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.84375, + "rewards/margins": 1.609375, + "rewards/rejected": -8.5, + "step": 9850 + }, + { + "epoch": 0.36701345591930173, + "grad_norm": 6.3535686751235785, + "learning_rate": 3.9905117680787906e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.8125, + "logps/chosen": -884.0, + "logps/rejected": -1012.0, + "loss": 0.4234, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.96875, + "rewards/margins": 1.421875, + "rewards/rejected": -8.375, + "step": 9860 + }, + { + "epoch": 0.36738568051962556, + "grad_norm": 5.8115365905731435, + "learning_rate": 3.987902589593e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.8125, + "logps/chosen": -888.0, + "logps/rejected": -1012.0, + "loss": 0.4168, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.75, + "rewards/margins": 1.5625, + "rewards/rejected": -8.3125, + "step": 9870 + }, + { + "epoch": 0.3677579051199494, + "grad_norm": 5.460402405508471, + "learning_rate": 3.9852908990273737e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.640625, + "logps/chosen": -868.0, + "logps/rejected": -1008.0, + "loss": 0.4049, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.9375, + "rewards/margins": 1.578125, + "rewards/rejected": -8.5, + "step": 9880 + }, + { + "epoch": 0.3681301297202732, + "grad_norm": 5.7438331257859705, + "learning_rate": 3.9826767007913246e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.4375, + "logps/chosen": -844.0, + "logps/rejected": -1000.0, + "loss": 0.4075, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.6875, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.375, + "step": 9890 + }, + { + "epoch": 0.368502354320597, + "grad_norm": 5.844322694867869, + "learning_rate": 3.9800599992984973e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.640625, + "logps/chosen": -832.0, + "logps/rejected": -984.0, + "loss": 0.4148, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.5, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.1875, + "step": 9900 + }, + { + "epoch": 0.3688745789209209, + "grad_norm": 6.806914404761199, + "learning_rate": 3.9774407989667637e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.59375, + "logps/chosen": -844.0, + "logps/rejected": -964.0, + "loss": 0.4066, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -6.5, + "rewards/margins": 1.5625, + "rewards/rejected": -8.0625, + "step": 9910 + }, + { + "epoch": 0.3692468035212447, + "grad_norm": 6.048428105563145, + "learning_rate": 3.9748191042182143e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.703125, + "logps/chosen": -884.0, + "logps/rejected": -1032.0, + "loss": 0.3822, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.03125, + "rewards/margins": 1.59375, + "rewards/rejected": -8.625, + "step": 9920 + }, + { + "epoch": 0.36961902812156855, + "grad_norm": 7.008262693146331, + "learning_rate": 3.9721949194791527e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -916.0, + "logps/rejected": -1040.0, + "loss": 0.3994, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.0625, + "rewards/margins": 1.75, + "rewards/rejected": -8.8125, + "step": 9930 + }, + { + "epoch": 0.36999125272189237, + "grad_norm": 5.779755677283361, + "learning_rate": 3.969568249180083e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.796875, + "logps/chosen": -880.0, + "logps/rejected": -984.0, + "loss": 0.4346, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.84375, + "rewards/margins": 1.3203125, + "rewards/rejected": -8.1875, + "step": 9940 + }, + { + "epoch": 0.37036347732221625, + "grad_norm": 5.858468681242547, + "learning_rate": 3.96693909775571e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -824.0, + "logps/rejected": -956.0, + "loss": 0.3998, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.375, + "rewards/margins": 1.6015625, + "rewards/rejected": -7.96875, + "step": 9950 + }, + { + "epoch": 0.3707357019225401, + "grad_norm": 6.793562522275051, + "learning_rate": 3.9643074696449235e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.765625, + "logps/chosen": -856.0, + "logps/rejected": -1012.0, + "loss": 0.4056, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.609375, + "rewards/rejected": -8.375, + "step": 9960 + }, + { + "epoch": 0.3711079265228639, + "grad_norm": 6.317373520282721, + "learning_rate": 3.961673369290798e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.859375, + "logps/chosen": -888.0, + "logps/rejected": -1008.0, + "loss": 0.4035, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.84375, + "rewards/margins": 1.390625, + "rewards/rejected": -8.25, + "step": 9970 + }, + { + "epoch": 0.3714801511231877, + "grad_norm": 6.501821857889046, + "learning_rate": 3.9590368011405786e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.796875, + "logps/chosen": -856.0, + "logps/rejected": -1016.0, + "loss": 0.388, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.71875, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.375, + "step": 9980 + }, + { + "epoch": 0.37185237572351154, + "grad_norm": 6.609022314785501, + "learning_rate": 3.956397769645681e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.8125, + "logps/chosen": -856.0, + "logps/rejected": -1004.0, + "loss": 0.3976, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.875, + "rewards/margins": 1.6171875, + "rewards/rejected": -8.5, + "step": 9990 + }, + { + "epoch": 0.3722246003238354, + "grad_norm": 7.090127236159045, + "learning_rate": 3.9537562792616753e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -884.0, + "logps/rejected": -1016.0, + "loss": 0.4132, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.0625, + "rewards/margins": 1.515625, + "rewards/rejected": -8.5625, + "step": 10000 + }, + { + "epoch": 0.3722246003238354, + "eval_logits/chosen": -3.90625, + "eval_logits/rejected": -3.71875, + "eval_logps/chosen": -912.0, + "eval_logps/rejected": -1024.0, + "eval_loss": 0.4587233364582062, + "eval_rewards/accuracies": 0.755190908908844, + "eval_rewards/chosen": -7.125, + "eval_rewards/margins": 1.40625, + "eval_rewards/rejected": -8.5, + "eval_runtime": 6269.7, + "eval_samples_per_second": 30.473, + "eval_steps_per_second": 0.476, + "step": 10000 + }, + { + "epoch": 0.37259682492415924, + "grad_norm": 6.779952102054952, + "learning_rate": 3.951112334448288e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.703125, + "logps/chosen": -876.0, + "logps/rejected": -1004.0, + "loss": 0.4014, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.96875, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.5, + "step": 10010 + }, + { + "epoch": 0.37296904952448307, + "grad_norm": 7.527072668096298, + "learning_rate": 3.948465939669385e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -856.0, + "logps/rejected": -980.0, + "loss": 0.4091, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.71875, + "rewards/margins": 1.421875, + "rewards/rejected": -8.125, + "step": 10020 + }, + { + "epoch": 0.3733412741248069, + "grad_norm": 6.6682252692638695, + "learning_rate": 3.9458170993929705e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.5, + "logps/chosen": -820.0, + "logps/rejected": -960.0, + "loss": 0.4461, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.3125, + "rewards/margins": 1.5390625, + "rewards/rejected": -7.84375, + "step": 10030 + }, + { + "epoch": 0.37371349872513077, + "grad_norm": 5.3998914224314145, + "learning_rate": 3.94316581809118e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.6875, + "logps/chosen": -812.0, + "logps/rejected": -928.0, + "loss": 0.4136, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.25, + "rewards/margins": 1.3984375, + "rewards/rejected": -7.65625, + "step": 10040 + }, + { + "epoch": 0.3740857233254546, + "grad_norm": 6.0041789113424215, + "learning_rate": 3.940512100240264e-07, + "logits/chosen": -3.96875, + "logits/rejected": -4.0, + "logps/chosen": -864.0, + "logps/rejected": -964.0, + "loss": 0.4009, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.53125, + "rewards/margins": 1.453125, + "rewards/rejected": -7.96875, + "step": 10050 + }, + { + "epoch": 0.3744579479257784, + "grad_norm": 6.39066986559693, + "learning_rate": 3.9378559503205934e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.59375, + "logps/chosen": -820.0, + "logps/rejected": -976.0, + "loss": 0.3916, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.5, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.25, + "step": 10060 + }, + { + "epoch": 0.37483017252610223, + "grad_norm": 7.1807120166639615, + "learning_rate": 3.9351973728166407e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.5625, + "logps/chosen": -816.0, + "logps/rejected": -988.0, + "loss": 0.4098, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.4375, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.125, + "step": 10070 + }, + { + "epoch": 0.3752023971264261, + "grad_norm": 5.4249408438593205, + "learning_rate": 3.9325363722169787e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.5625, + "logps/chosen": -868.0, + "logps/rejected": -1032.0, + "loss": 0.4058, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.875, + "rewards/margins": 1.71875, + "rewards/rejected": -8.625, + "step": 10080 + }, + { + "epoch": 0.37557462172674994, + "grad_norm": 5.431048967355182, + "learning_rate": 3.9298729530142716e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.671875, + "logps/chosen": -840.0, + "logps/rejected": -992.0, + "loss": 0.3902, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.6875, + "rewards/margins": 1.5625, + "rewards/rejected": -8.25, + "step": 10090 + }, + { + "epoch": 0.37594684632707376, + "grad_norm": 7.851965006541211, + "learning_rate": 3.927207119705267e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.796875, + "logps/chosen": -872.0, + "logps/rejected": -1004.0, + "loss": 0.4178, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.84375, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.375, + "step": 10100 + }, + { + "epoch": 0.3763190709273976, + "grad_norm": 6.690727711927166, + "learning_rate": 3.924538876790787e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.59375, + "logps/chosen": -876.0, + "logps/rejected": -1056.0, + "loss": 0.3824, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -6.96875, + "rewards/margins": 1.765625, + "rewards/rejected": -8.75, + "step": 10110 + }, + { + "epoch": 0.3766912955277214, + "grad_norm": 7.0085641591138845, + "learning_rate": 3.9218682287757233e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.75, + "logps/chosen": -884.0, + "logps/rejected": -1012.0, + "loss": 0.4086, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.09375, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.5, + "step": 10120 + }, + { + "epoch": 0.3770635201280453, + "grad_norm": 7.1961509641723636, + "learning_rate": 3.9191951801690273e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -896.0, + "logps/rejected": -1016.0, + "loss": 0.4032, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -6.78125, + "rewards/margins": 1.34375, + "rewards/rejected": -8.125, + "step": 10130 + }, + { + "epoch": 0.3774357447283691, + "grad_norm": 6.592048642055363, + "learning_rate": 3.916519735483703e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -824.0, + "logps/rejected": -1000.0, + "loss": 0.4032, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.65625, + "rewards/margins": 1.765625, + "rewards/rejected": -8.4375, + "step": 10140 + }, + { + "epoch": 0.3778079693286929, + "grad_norm": 7.014300630950333, + "learning_rate": 3.913841899236803e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.8125, + "logps/chosen": -852.0, + "logps/rejected": -984.0, + "loss": 0.4033, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.625, + "rewards/margins": 1.515625, + "rewards/rejected": -8.125, + "step": 10150 + }, + { + "epoch": 0.37818019392901675, + "grad_norm": 6.059582641874987, + "learning_rate": 3.911161675949412e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.890625, + "logps/chosen": -832.0, + "logps/rejected": -972.0, + "loss": 0.4061, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -6.5625, + "rewards/margins": 1.59375, + "rewards/rejected": -8.125, + "step": 10160 + }, + { + "epoch": 0.37855241852934063, + "grad_norm": 6.625511979713202, + "learning_rate": 3.90847907014665e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.78125, + "logps/chosen": -856.0, + "logps/rejected": -1016.0, + "loss": 0.4139, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.84375, + "rewards/margins": 1.5625, + "rewards/rejected": -8.4375, + "step": 10170 + }, + { + "epoch": 0.37892464312966445, + "grad_norm": 6.85028678316669, + "learning_rate": 3.905794086357658e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.8125, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.4179, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.625, + "rewards/rejected": -8.6875, + "step": 10180 + }, + { + "epoch": 0.3792968677299883, + "grad_norm": 7.014468726531082, + "learning_rate": 3.903106729115591e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.90625, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.4115, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.8125, + "rewards/margins": 1.765625, + "rewards/rejected": -8.5625, + "step": 10190 + }, + { + "epoch": 0.3796690923303121, + "grad_norm": 7.019860578223725, + "learning_rate": 3.90041700295761e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.8125, + "logps/chosen": -856.0, + "logps/rejected": -984.0, + "loss": 0.4033, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.84375, + "rewards/margins": 1.484375, + "rewards/rejected": -8.3125, + "step": 10200 + }, + { + "epoch": 0.3800413169306359, + "grad_norm": 6.013423111216983, + "learning_rate": 3.897724912424879e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -832.0, + "logps/rejected": -972.0, + "loss": 0.4031, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.53125, + "rewards/margins": 1.5625, + "rewards/rejected": -8.0625, + "step": 10210 + }, + { + "epoch": 0.3804135415309598, + "grad_norm": 5.008164120417849, + "learning_rate": 3.8950304620625514e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.609375, + "logps/chosen": -836.0, + "logps/rejected": -968.0, + "loss": 0.4133, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.84375, + "rewards/margins": 1.3828125, + "rewards/rejected": -8.25, + "step": 10220 + }, + { + "epoch": 0.3807857661312836, + "grad_norm": 7.008040983170978, + "learning_rate": 3.892333656419765e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.671875, + "logps/chosen": -884.0, + "logps/rejected": -1040.0, + "loss": 0.4279, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.96875, + "rewards/margins": 1.609375, + "rewards/rejected": -8.5625, + "step": 10230 + }, + { + "epoch": 0.38115799073160744, + "grad_norm": 5.54756499531245, + "learning_rate": 3.8896345000496343e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -876.0, + "logps/rejected": -984.0, + "loss": 0.3984, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.84375, + "rewards/margins": 1.4375, + "rewards/rejected": -8.3125, + "step": 10240 + }, + { + "epoch": 0.38153021533193127, + "grad_norm": 5.910114821266497, + "learning_rate": 3.886932997509244e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -888.0, + "logps/rejected": -1040.0, + "loss": 0.3724, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.9375, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.6875, + "step": 10250 + }, + { + "epoch": 0.38190243993225514, + "grad_norm": 9.517838636654623, + "learning_rate": 3.884229153359637e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -872.0, + "logps/rejected": -992.0, + "loss": 0.4233, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.875, + "rewards/margins": 1.359375, + "rewards/rejected": -8.25, + "step": 10260 + }, + { + "epoch": 0.38227466453257897, + "grad_norm": 5.6218446486798594, + "learning_rate": 3.881522972165812e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.625, + "logps/chosen": -864.0, + "logps/rejected": -1008.0, + "loss": 0.392, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.9375, + "rewards/margins": 1.40625, + "rewards/rejected": -8.3125, + "step": 10270 + }, + { + "epoch": 0.3826468891329028, + "grad_norm": 6.465995179565068, + "learning_rate": 3.8788144584967135e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.71875, + "logps/chosen": -908.0, + "logps/rejected": -1088.0, + "loss": 0.3857, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.984375, + "rewards/rejected": -9.125, + "step": 10280 + }, + { + "epoch": 0.3830191137332266, + "grad_norm": 7.416653607793235, + "learning_rate": 3.876103616925223e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.6875, + "logps/chosen": -884.0, + "logps/rejected": -1032.0, + "loss": 0.4063, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.03125, + "rewards/margins": 1.578125, + "rewards/rejected": -8.625, + "step": 10290 + }, + { + "epoch": 0.3833913383335505, + "grad_norm": 7.149011353925458, + "learning_rate": 3.873390452028151e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -888.0, + "logps/rejected": -1048.0, + "loss": 0.393, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.8046875, + "rewards/rejected": -8.875, + "step": 10300 + }, + { + "epoch": 0.3837635629338743, + "grad_norm": 5.911789008322568, + "learning_rate": 3.870674968386234e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.5625, + "logps/chosen": -900.0, + "logps/rejected": -1072.0, + "loss": 0.3878, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.796875, + "rewards/rejected": -8.9375, + "step": 10310 + }, + { + "epoch": 0.38413578753419814, + "grad_norm": 6.4930095025304215, + "learning_rate": 3.86795717058412e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -884.0, + "logps/rejected": -1040.0, + "loss": 0.3981, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.90625, + "rewards/margins": 1.78125, + "rewards/rejected": -8.6875, + "step": 10320 + }, + { + "epoch": 0.38450801213452196, + "grad_norm": 7.509556789613068, + "learning_rate": 3.8652370632103665e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.75, + "logps/chosen": -880.0, + "logps/rejected": -1048.0, + "loss": 0.4102, + "rewards/accuracies": 0.875, + "rewards/chosen": -6.90625, + "rewards/margins": 1.9609375, + "rewards/rejected": -8.875, + "step": 10330 + }, + { + "epoch": 0.3848802367348458, + "grad_norm": 6.394014077669874, + "learning_rate": 3.862514650857428e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.765625, + "logps/chosen": -912.0, + "logps/rejected": -1040.0, + "loss": 0.4372, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.234375, + "rewards/rejected": -8.625, + "step": 10340 + }, + { + "epoch": 0.38525246133516966, + "grad_norm": 5.755408873492995, + "learning_rate": 3.859789938121654e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.796875, + "logps/chosen": -888.0, + "logps/rejected": -1032.0, + "loss": 0.4127, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.96875, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.5, + "step": 10350 + }, + { + "epoch": 0.3856246859354935, + "grad_norm": 7.318901102559693, + "learning_rate": 3.8570629296032734e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.890625, + "logps/chosen": -860.0, + "logps/rejected": -976.0, + "loss": 0.4003, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.75, + "rewards/margins": 1.3359375, + "rewards/rejected": -8.0625, + "step": 10360 + }, + { + "epoch": 0.3859969105358173, + "grad_norm": 6.835292810820879, + "learning_rate": 3.854333629906395e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.71875, + "logps/chosen": -880.0, + "logps/rejected": -976.0, + "loss": 0.434, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.84375, + "rewards/margins": 1.3359375, + "rewards/rejected": -8.1875, + "step": 10370 + }, + { + "epoch": 0.38636913513614113, + "grad_norm": 6.625679992018827, + "learning_rate": 3.851602043638994e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -900.0, + "logps/rejected": -1040.0, + "loss": 0.3991, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.5, + "step": 10380 + }, + { + "epoch": 0.386741359736465, + "grad_norm": 5.791124585353487, + "learning_rate": 3.848868175412906e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.875, + "logps/chosen": -908.0, + "logps/rejected": -1008.0, + "loss": 0.399, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.34375, + "rewards/rejected": -8.625, + "step": 10390 + }, + { + "epoch": 0.38711358433678883, + "grad_norm": 5.887120632025183, + "learning_rate": 3.8461320298438206e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.8125, + "logps/chosen": -892.0, + "logps/rejected": -1004.0, + "loss": 0.4177, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -7.125, + "rewards/margins": 1.296875, + "rewards/rejected": -8.4375, + "step": 10400 + }, + { + "epoch": 0.38748580893711265, + "grad_norm": 6.091872714444972, + "learning_rate": 3.84339361155127e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -888.0, + "logps/rejected": -1024.0, + "loss": 0.4048, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.0625, + "rewards/margins": 1.4375, + "rewards/rejected": -8.5, + "step": 10410 + }, + { + "epoch": 0.3878580335374365, + "grad_norm": 7.134751282084675, + "learning_rate": 3.8406529251586254e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.75, + "logps/chosen": -888.0, + "logps/rejected": -1056.0, + "loss": 0.408, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.09375, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.75, + "step": 10420 + }, + { + "epoch": 0.3882302581377603, + "grad_norm": 7.076803676298143, + "learning_rate": 3.837909975293088e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -860.0, + "logps/rejected": -992.0, + "loss": 0.4066, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.71875, + "rewards/margins": 1.65625, + "rewards/rejected": -8.375, + "step": 10430 + }, + { + "epoch": 0.3886024827380842, + "grad_norm": 7.654813186699686, + "learning_rate": 3.835164766585679e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -864.0, + "logps/rejected": -1012.0, + "loss": 0.4047, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.90625, + "rewards/margins": 1.53125, + "rewards/rejected": -8.4375, + "step": 10440 + }, + { + "epoch": 0.388974707338408, + "grad_norm": 6.954083232717519, + "learning_rate": 3.8324173036712336e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.765625, + "logps/chosen": -860.0, + "logps/rejected": -996.0, + "loss": 0.4087, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.84375, + "rewards/margins": 1.453125, + "rewards/rejected": -8.3125, + "step": 10450 + }, + { + "epoch": 0.3893469319387318, + "grad_norm": 6.3829840903074375, + "learning_rate": 3.829667591188393e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.546875, + "logps/chosen": -852.0, + "logps/rejected": -1008.0, + "loss": 0.3889, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.78125, + "rewards/margins": 1.75, + "rewards/rejected": -8.5, + "step": 10460 + }, + { + "epoch": 0.38971915653905564, + "grad_norm": 5.7369481688581745, + "learning_rate": 3.826915633779596e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.734375, + "logps/chosen": -920.0, + "logps/rejected": -1040.0, + "loss": 0.4083, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.421875, + "rewards/rejected": -8.8125, + "step": 10470 + }, + { + "epoch": 0.3900913811393795, + "grad_norm": 6.881795636096312, + "learning_rate": 3.8241614360910726e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -884.0, + "logps/rejected": -1032.0, + "loss": 0.3991, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.09375, + "rewards/margins": 1.5625, + "rewards/rejected": -8.625, + "step": 10480 + }, + { + "epoch": 0.39046360573970335, + "grad_norm": 12.19675475207699, + "learning_rate": 3.8214050027728335e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.65625, + "logps/chosen": -884.0, + "logps/rejected": -1012.0, + "loss": 0.4019, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.9375, + "rewards/margins": 1.4140625, + "rewards/rejected": -8.3125, + "step": 10490 + }, + { + "epoch": 0.39083583034002717, + "grad_norm": 6.160453179830614, + "learning_rate": 3.818646338478665e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -872.0, + "logps/rejected": -1004.0, + "loss": 0.4182, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.65625, + "rewards/margins": 1.4375, + "rewards/rejected": -8.125, + "step": 10500 + }, + { + "epoch": 0.391208054940351, + "grad_norm": 6.482497191122117, + "learning_rate": 3.815885447866121e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.75, + "logps/chosen": -896.0, + "logps/rejected": -992.0, + "loss": 0.4389, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.9375, + "rewards/margins": 1.3125, + "rewards/rejected": -8.25, + "step": 10510 + }, + { + "epoch": 0.39158027954067487, + "grad_norm": 6.62221266883809, + "learning_rate": 3.813122335596513e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.6875, + "logps/chosen": -880.0, + "logps/rejected": -1000.0, + "loss": 0.4275, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.96875, + "rewards/margins": 1.375, + "rewards/rejected": -8.375, + "step": 10520 + }, + { + "epoch": 0.3919525041409987, + "grad_norm": 6.5872740656990105, + "learning_rate": 3.8103570063349027e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.71875, + "logps/chosen": -872.0, + "logps/rejected": -984.0, + "loss": 0.4077, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.65625, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.0625, + "step": 10530 + }, + { + "epoch": 0.3923247287413225, + "grad_norm": 5.803158514867611, + "learning_rate": 3.807589464750097e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -884.0, + "logps/rejected": -1012.0, + "loss": 0.3975, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.75, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.4375, + "step": 10540 + }, + { + "epoch": 0.39269695334164634, + "grad_norm": 6.6768162088198615, + "learning_rate": 3.8048197155146343e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.796875, + "logps/chosen": -888.0, + "logps/rejected": -1056.0, + "loss": 0.3902, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.875, + "rewards/margins": 1.78125, + "rewards/rejected": -8.6875, + "step": 10550 + }, + { + "epoch": 0.39306917794197016, + "grad_norm": 6.0859183911204395, + "learning_rate": 3.8020477633047847e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.890625, + "logps/chosen": -888.0, + "logps/rejected": -992.0, + "loss": 0.4338, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.0625, + "rewards/margins": 1.1875, + "rewards/rejected": -8.25, + "step": 10560 + }, + { + "epoch": 0.39344140254229404, + "grad_norm": 6.697776696519422, + "learning_rate": 3.7992736128005344e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.9375, + "logps/chosen": -868.0, + "logps/rejected": -1008.0, + "loss": 0.4491, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.8125, + "rewards/margins": 1.546875, + "rewards/rejected": -8.375, + "step": 10570 + }, + { + "epoch": 0.39381362714261786, + "grad_norm": 6.444776844580686, + "learning_rate": 3.7964972686855833e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.8125, + "logps/chosen": -888.0, + "logps/rejected": -996.0, + "loss": 0.4133, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.0, + "rewards/margins": 1.234375, + "rewards/rejected": -8.25, + "step": 10580 + }, + { + "epoch": 0.3941858517429417, + "grad_norm": 6.808662867286216, + "learning_rate": 3.7937187356473323e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.859375, + "logps/chosen": -900.0, + "logps/rejected": -1024.0, + "loss": 0.3935, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.875, + "rewards/margins": 1.625, + "rewards/rejected": -8.5, + "step": 10590 + }, + { + "epoch": 0.3945580763432655, + "grad_norm": 6.612542544177442, + "learning_rate": 3.7909380183768796e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.765625, + "logps/chosen": -852.0, + "logps/rejected": -1032.0, + "loss": 0.3928, + "rewards/accuracies": 0.893750011920929, + "rewards/chosen": -6.65625, + "rewards/margins": 2.0, + "rewards/rejected": -8.625, + "step": 10600 + }, + { + "epoch": 0.3949303009435894, + "grad_norm": 6.718268064693689, + "learning_rate": 3.7881551215690123e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.734375, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.4276, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.125, + "rewards/margins": 1.5, + "rewards/rejected": -8.625, + "step": 10610 + }, + { + "epoch": 0.3953025255439132, + "grad_norm": 7.142340690198998, + "learning_rate": 3.785370049922194e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.765625, + "logps/chosen": -872.0, + "logps/rejected": -1040.0, + "loss": 0.3911, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.96875, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.625, + "step": 10620 + }, + { + "epoch": 0.39567475014423703, + "grad_norm": 5.887605153552629, + "learning_rate": 3.782582808138564e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.859375, + "logps/chosen": -880.0, + "logps/rejected": -1000.0, + "loss": 0.4152, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -6.8125, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.25, + "step": 10630 + }, + { + "epoch": 0.39604697474456085, + "grad_norm": 6.5068864417704, + "learning_rate": 3.7797934009239217e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.953125, + "logps/chosen": -864.0, + "logps/rejected": -972.0, + "loss": 0.3934, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.75, + "rewards/margins": 1.5, + "rewards/rejected": -8.25, + "step": 10640 + }, + { + "epoch": 0.3964191993448847, + "grad_norm": 7.631467171481536, + "learning_rate": 3.777001832987726e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.71875, + "logps/chosen": -888.0, + "logps/rejected": -1032.0, + "loss": 0.4275, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.0, + "rewards/margins": 1.34375, + "rewards/rejected": -8.3125, + "step": 10650 + }, + { + "epoch": 0.39679142394520855, + "grad_norm": 6.667257571188621, + "learning_rate": 3.77420810904308e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.78125, + "logps/chosen": -884.0, + "logps/rejected": -1008.0, + "loss": 0.4139, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.03125, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.5, + "step": 10660 + }, + { + "epoch": 0.3971636485455324, + "grad_norm": 7.122972460286967, + "learning_rate": 3.771412233806731e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.96875, + "logps/chosen": -900.0, + "logps/rejected": -1032.0, + "loss": 0.4038, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.0, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.4375, + "step": 10670 + }, + { + "epoch": 0.3975358731458562, + "grad_norm": 6.286075833117893, + "learning_rate": 3.768614211999056e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.75, + "logps/chosen": -864.0, + "logps/rejected": -1016.0, + "loss": 0.3894, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.875, + "rewards/margins": 1.59375, + "rewards/rejected": -8.4375, + "step": 10680 + }, + { + "epoch": 0.39790809774618, + "grad_norm": 6.3483774252560075, + "learning_rate": 3.765814048344056e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.75, + "logps/chosen": -868.0, + "logps/rejected": -1004.0, + "loss": 0.4098, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.03125, + "rewards/margins": 1.453125, + "rewards/rejected": -8.5, + "step": 10690 + }, + { + "epoch": 0.3982803223465039, + "grad_norm": 7.015847191948804, + "learning_rate": 3.76301174756935e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.90625, + "logps/chosen": -900.0, + "logps/rejected": -1040.0, + "loss": 0.4033, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.0, + "rewards/margins": 1.703125, + "rewards/rejected": -8.6875, + "step": 10700 + }, + { + "epoch": 0.3986525469468277, + "grad_norm": 5.953411572352932, + "learning_rate": 3.7602073144061617e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.90625, + "logps/chosen": -848.0, + "logps/rejected": -996.0, + "loss": 0.3957, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.625, + "rewards/margins": 1.7421875, + "rewards/rejected": -8.375, + "step": 10710 + }, + { + "epoch": 0.39902477154715155, + "grad_norm": 6.576501786367329, + "learning_rate": 3.757400753589319e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.828125, + "logps/chosen": -848.0, + "logps/rejected": -992.0, + "loss": 0.4021, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.53125, + "rewards/margins": 1.703125, + "rewards/rejected": -8.25, + "step": 10720 + }, + { + "epoch": 0.39939699614747537, + "grad_norm": 6.361995504737115, + "learning_rate": 3.7545920698572393e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.828125, + "logps/chosen": -852.0, + "logps/rejected": -988.0, + "loss": 0.3903, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.625, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.125, + "step": 10730 + }, + { + "epoch": 0.39976922074779925, + "grad_norm": 6.7723565173790865, + "learning_rate": 3.7517812679519255e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.78125, + "logps/chosen": -876.0, + "logps/rejected": -1012.0, + "loss": 0.4104, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.03125, + "rewards/margins": 1.4375, + "rewards/rejected": -8.4375, + "step": 10740 + }, + { + "epoch": 0.40014144534812307, + "grad_norm": 6.419614099192593, + "learning_rate": 3.748968352618957e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.78125, + "logps/chosen": -904.0, + "logps/rejected": -1008.0, + "loss": 0.3821, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.9375, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.4375, + "step": 10750 + }, + { + "epoch": 0.4005136699484469, + "grad_norm": 6.5055714975763115, + "learning_rate": 3.7461533286074785e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.859375, + "logps/chosen": -864.0, + "logps/rejected": -1024.0, + "loss": 0.3985, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.8125, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.5625, + "step": 10760 + }, + { + "epoch": 0.4008858945487707, + "grad_norm": 7.786187395627907, + "learning_rate": 3.743336200670199e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.8125, + "logps/chosen": -880.0, + "logps/rejected": -1040.0, + "loss": 0.376, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.90625, + "rewards/margins": 1.875, + "rewards/rejected": -8.8125, + "step": 10770 + }, + { + "epoch": 0.40125811914909454, + "grad_norm": 5.821122867200847, + "learning_rate": 3.7405169735633766e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.8125, + "logps/chosen": -888.0, + "logps/rejected": -1032.0, + "loss": 0.4128, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.90625, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.5625, + "step": 10780 + }, + { + "epoch": 0.4016303437494184, + "grad_norm": 6.679817159363863, + "learning_rate": 3.7376956520468154e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.8125, + "logps/chosen": -876.0, + "logps/rejected": -1032.0, + "loss": 0.4086, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.0, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.6875, + "step": 10790 + }, + { + "epoch": 0.40200256834974224, + "grad_norm": 6.188724194323378, + "learning_rate": 3.734872240883854e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.90625, + "logps/chosen": -852.0, + "logps/rejected": -956.0, + "loss": 0.4089, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.65625, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.125, + "step": 10800 + }, + { + "epoch": 0.40237479295006606, + "grad_norm": 6.616489539438808, + "learning_rate": 3.73204674484136e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -844.0, + "logps/rejected": -984.0, + "loss": 0.4272, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.625, + "rewards/margins": 1.484375, + "rewards/rejected": -8.125, + "step": 10810 + }, + { + "epoch": 0.4027470175503899, + "grad_norm": 6.738522652674378, + "learning_rate": 3.729219168689721e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.84375, + "logps/chosen": -840.0, + "logps/rejected": -960.0, + "loss": 0.4123, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.4375, + "rewards/margins": 1.421875, + "rewards/rejected": -7.875, + "step": 10820 + }, + { + "epoch": 0.40311924215071376, + "grad_norm": 6.299065511718082, + "learning_rate": 3.7263895172028345e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.859375, + "logps/chosen": -880.0, + "logps/rejected": -1004.0, + "loss": 0.4024, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.875, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.4375, + "step": 10830 + }, + { + "epoch": 0.4034914667510376, + "grad_norm": 7.637405274053756, + "learning_rate": 3.7235577951581063e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.75, + "logps/chosen": -852.0, + "logps/rejected": -976.0, + "loss": 0.4245, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.78125, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.3125, + "step": 10840 + }, + { + "epoch": 0.4038636913513614, + "grad_norm": 6.6084839877862365, + "learning_rate": 3.7207240073364334e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.84375, + "logps/chosen": -836.0, + "logps/rejected": -968.0, + "loss": 0.4122, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.6875, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.25, + "step": 10850 + }, + { + "epoch": 0.40423591595168523, + "grad_norm": 7.943948882425527, + "learning_rate": 3.7178881585222035e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.71875, + "logps/chosen": -868.0, + "logps/rejected": -1004.0, + "loss": 0.3997, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.515625, + "rewards/rejected": -8.25, + "step": 10860 + }, + { + "epoch": 0.40460814055200905, + "grad_norm": 7.236277675557204, + "learning_rate": 3.7150502535032825e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.78125, + "logps/chosen": -904.0, + "logps/rejected": -1000.0, + "loss": 0.4237, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.21875, + "rewards/rejected": -8.375, + "step": 10870 + }, + { + "epoch": 0.40498036515233293, + "grad_norm": 6.420221226781848, + "learning_rate": 3.7122102970710065e-07, + "logits/chosen": -4.125, + "logits/rejected": -3.84375, + "logps/chosen": -908.0, + "logps/rejected": -1064.0, + "loss": 0.4163, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.3125, + "rewards/margins": 1.546875, + "rewards/rejected": -8.875, + "step": 10880 + }, + { + "epoch": 0.40535258975265676, + "grad_norm": 6.498767483538408, + "learning_rate": 3.7093682940201803e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.921875, + "logps/chosen": -900.0, + "logps/rejected": -1040.0, + "loss": 0.3978, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.6875, + "step": 10890 + }, + { + "epoch": 0.4057248143529806, + "grad_norm": 6.591848975257687, + "learning_rate": 3.7065242491490576e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.859375, + "logps/chosen": -896.0, + "logps/rejected": -1048.0, + "loss": 0.4087, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.09375, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.8125, + "step": 10900 + }, + { + "epoch": 0.4060970389533044, + "grad_norm": 7.232364710768949, + "learning_rate": 3.703678167259344e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.796875, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.4099, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.125, + "step": 10910 + }, + { + "epoch": 0.4064692635536283, + "grad_norm": 6.3469364138211715, + "learning_rate": 3.700830053156182e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.921875, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.408, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.6171875, + "rewards/rejected": -8.875, + "step": 10920 + }, + { + "epoch": 0.4068414881539521, + "grad_norm": 6.818244911795219, + "learning_rate": 3.6979799116481457e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.828125, + "logps/chosen": -896.0, + "logps/rejected": -1056.0, + "loss": 0.3782, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.09375, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.0625, + "step": 10930 + }, + { + "epoch": 0.4072137127542759, + "grad_norm": 5.573239320530639, + "learning_rate": 3.6951277475472333e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.859375, + "logps/chosen": -920.0, + "logps/rejected": -1048.0, + "loss": 0.4023, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.609375, + "rewards/rejected": -8.8125, + "step": 10940 + }, + { + "epoch": 0.40758593735459975, + "grad_norm": 8.264525110485382, + "learning_rate": 3.6922735656688545e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -888.0, + "logps/rejected": -1040.0, + "loss": 0.3815, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.8125, + "step": 10950 + }, + { + "epoch": 0.4079581619549236, + "grad_norm": 5.763152866962167, + "learning_rate": 3.6894173708318305e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -832.0, + "logps/rejected": -976.0, + "loss": 0.4002, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.5625, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.125, + "step": 10960 + }, + { + "epoch": 0.40833038655524745, + "grad_norm": 6.475956590857558, + "learning_rate": 3.686559167858377e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -884.0, + "logps/rejected": -1024.0, + "loss": 0.3992, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.96875, + "rewards/margins": 1.53125, + "rewards/rejected": -8.5, + "step": 10970 + }, + { + "epoch": 0.40870261115557127, + "grad_norm": 5.942462445160721, + "learning_rate": 3.683698961574102e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -912.0, + "logps/rejected": -1048.0, + "loss": 0.4012, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.75, + "step": 10980 + }, + { + "epoch": 0.4090748357558951, + "grad_norm": 6.662979366187995, + "learning_rate": 3.680836756807995e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.671875, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.4168, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.125, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.6875, + "step": 10990 + }, + { + "epoch": 0.4094470603562189, + "grad_norm": 7.7282084896525856, + "learning_rate": 3.677972558392421e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.84375, + "logps/chosen": -908.0, + "logps/rejected": -1064.0, + "loss": 0.3928, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.09375, + "rewards/margins": 1.703125, + "rewards/rejected": -8.8125, + "step": 11000 + }, + { + "epoch": 0.4098192849565428, + "grad_norm": 6.433159281650206, + "learning_rate": 3.675106371163109e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -868.0, + "logps/rejected": -1032.0, + "loss": 0.4313, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.0625, + "rewards/margins": 1.671875, + "rewards/rejected": -8.75, + "step": 11010 + }, + { + "epoch": 0.4101915095568666, + "grad_norm": 5.969507914737734, + "learning_rate": 3.672238199959146e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -836.0, + "logps/rejected": -984.0, + "loss": 0.3947, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.78125, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.375, + "step": 11020 + }, + { + "epoch": 0.41056373415719044, + "grad_norm": 6.113990119094154, + "learning_rate": 3.6693680496229717e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.90625, + "logps/chosen": -876.0, + "logps/rejected": -988.0, + "loss": 0.4159, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.84375, + "rewards/margins": 1.453125, + "rewards/rejected": -8.3125, + "step": 11030 + }, + { + "epoch": 0.41093595875751426, + "grad_norm": 6.5558802486834935, + "learning_rate": 3.6664959250003623e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -884.0, + "logps/rejected": -1008.0, + "loss": 0.4079, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.0, + "rewards/margins": 1.59375, + "rewards/rejected": -8.5625, + "step": 11040 + }, + { + "epoch": 0.41130818335783814, + "grad_norm": 6.238805184196473, + "learning_rate": 3.663621830940432e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.59375, + "logps/chosen": -948.0, + "logps/rejected": -1056.0, + "loss": 0.4254, + "rewards/accuracies": 0.71875, + "rewards/chosen": -7.4375, + "rewards/margins": 1.2890625, + "rewards/rejected": -8.75, + "step": 11050 + }, + { + "epoch": 0.41168040795816196, + "grad_norm": 6.635715430655651, + "learning_rate": 3.6607457722956163e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.859375, + "logps/chosen": -904.0, + "logps/rejected": -1004.0, + "loss": 0.4111, + "rewards/accuracies": 0.706250011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.2265625, + "rewards/rejected": -8.4375, + "step": 11060 + }, + { + "epoch": 0.4120526325584858, + "grad_norm": 6.8325176519490025, + "learning_rate": 3.6578677539216704e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.953125, + "logps/chosen": -908.0, + "logps/rejected": -1032.0, + "loss": 0.4103, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.0, + "rewards/margins": 1.484375, + "rewards/rejected": -8.5, + "step": 11070 + }, + { + "epoch": 0.4124248571588096, + "grad_norm": 8.600177716278951, + "learning_rate": 3.6549877806776555e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.6875, + "logps/chosen": -856.0, + "logps/rejected": -1004.0, + "loss": 0.4152, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.75, + "rewards/margins": 1.6875, + "rewards/rejected": -8.4375, + "step": 11080 + }, + { + "epoch": 0.4127970817591335, + "grad_norm": 7.092758630206045, + "learning_rate": 3.6521058574259355e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.828125, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.4342, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.0625, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.5625, + "step": 11090 + }, + { + "epoch": 0.4131693063594573, + "grad_norm": 6.3969931507011, + "learning_rate": 3.6492219890321674e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.828125, + "logps/chosen": -872.0, + "logps/rejected": -1004.0, + "loss": 0.4268, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.875, + "rewards/margins": 1.453125, + "rewards/rejected": -8.3125, + "step": 11100 + }, + { + "epoch": 0.41354153095978113, + "grad_norm": 5.658395164903331, + "learning_rate": 3.6463361803652877e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.859375, + "logps/chosen": -860.0, + "logps/rejected": -976.0, + "loss": 0.3833, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.75, + "rewards/margins": 1.3203125, + "rewards/rejected": -8.0625, + "step": 11110 + }, + { + "epoch": 0.41391375556010496, + "grad_norm": 7.08682175998033, + "learning_rate": 3.6434484362975135e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -920.0, + "logps/rejected": -1024.0, + "loss": 0.3998, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.265625, + "rewards/rejected": -8.625, + "step": 11120 + }, + { + "epoch": 0.4142859801604288, + "grad_norm": 7.435242637533934, + "learning_rate": 3.640558761704328e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -880.0, + "logps/rejected": -1016.0, + "loss": 0.4218, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.515625, + "rewards/rejected": -8.6875, + "step": 11130 + }, + { + "epoch": 0.41465820476075266, + "grad_norm": 7.875089854942056, + "learning_rate": 3.6376671614644726e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.65625, + "logps/chosen": -856.0, + "logps/rejected": -1012.0, + "loss": 0.408, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.4375, + "step": 11140 + }, + { + "epoch": 0.4150304293610765, + "grad_norm": 6.559910759253231, + "learning_rate": 3.6347736404599404e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -884.0, + "logps/rejected": -1032.0, + "loss": 0.4253, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.125, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.5625, + "step": 11150 + }, + { + "epoch": 0.4154026539614003, + "grad_norm": 7.696509083770465, + "learning_rate": 3.631878203575969e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -876.0, + "logps/rejected": -1048.0, + "loss": 0.3837, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.96875, + "rewards/margins": 1.703125, + "rewards/rejected": -8.6875, + "step": 11160 + }, + { + "epoch": 0.4157748785617241, + "grad_norm": 6.488778256005278, + "learning_rate": 3.628980855701028e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.90625, + "logps/chosen": -920.0, + "logps/rejected": -1048.0, + "loss": 0.3932, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.09375, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.5625, + "step": 11170 + }, + { + "epoch": 0.416147103162048, + "grad_norm": 5.512923982266312, + "learning_rate": 3.626081601726816e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -868.0, + "logps/rejected": -1032.0, + "loss": 0.4059, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.90625, + "rewards/margins": 1.625, + "rewards/rejected": -8.5625, + "step": 11180 + }, + { + "epoch": 0.4165193277623718, + "grad_norm": 6.854984497702953, + "learning_rate": 3.623180446548248e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.65625, + "logps/chosen": -908.0, + "logps/rejected": -1032.0, + "loss": 0.4101, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.125, + "rewards/margins": 1.3046875, + "rewards/rejected": -8.4375, + "step": 11190 + }, + { + "epoch": 0.41689155236269565, + "grad_norm": 6.547269073537186, + "learning_rate": 3.620277395063449e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.671875, + "logps/chosen": -844.0, + "logps/rejected": -996.0, + "loss": 0.3848, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.6875, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.375, + "step": 11200 + }, + { + "epoch": 0.4172637769630195, + "grad_norm": 6.3116315324294865, + "learning_rate": 3.6173724521737467e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.734375, + "logps/chosen": -884.0, + "logps/rejected": -1048.0, + "loss": 0.3913, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.5625, + "rewards/rejected": -8.75, + "step": 11210 + }, + { + "epoch": 0.4176360015633433, + "grad_norm": 6.280073811486498, + "learning_rate": 3.61446562278366e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.828125, + "logps/chosen": -928.0, + "logps/rejected": -1040.0, + "loss": 0.4195, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.34375, + "rewards/margins": 1.5, + "rewards/rejected": -8.875, + "step": 11220 + }, + { + "epoch": 0.4180082261636672, + "grad_norm": 5.729524434327027, + "learning_rate": 3.6115569118008966e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.3909, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.4375, + "rewards/rejected": -8.875, + "step": 11230 + }, + { + "epoch": 0.418380450763991, + "grad_norm": 6.663094828679094, + "learning_rate": 3.6086463241363365e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.828125, + "logps/chosen": -896.0, + "logps/rejected": -1048.0, + "loss": 0.4134, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.0625, + "rewards/margins": 1.8046875, + "rewards/rejected": -8.875, + "step": 11240 + }, + { + "epoch": 0.4187526753643148, + "grad_norm": 6.335296904615711, + "learning_rate": 3.605733864704031e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.609375, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.4177, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.1875, + "step": 11250 + }, + { + "epoch": 0.41912489996463864, + "grad_norm": 6.4824982688731, + "learning_rate": 3.602819538421191e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -912.0, + "logps/rejected": -1040.0, + "loss": 0.4008, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.5625, + "step": 11260 + }, + { + "epoch": 0.4194971245649625, + "grad_norm": 6.43990169822606, + "learning_rate": 3.5999033502081783e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.65625, + "logps/chosen": -860.0, + "logps/rejected": -980.0, + "loss": 0.4169, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.84375, + "rewards/margins": 1.375, + "rewards/rejected": -8.1875, + "step": 11270 + }, + { + "epoch": 0.41986934916528634, + "grad_norm": 5.902525567368692, + "learning_rate": 3.596985304988501e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.71875, + "logps/chosen": -896.0, + "logps/rejected": -1032.0, + "loss": 0.4011, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.03125, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.5625, + "step": 11280 + }, + { + "epoch": 0.42024157376561017, + "grad_norm": 7.472901600971799, + "learning_rate": 3.5940654076887977e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.859375, + "logps/chosen": -876.0, + "logps/rejected": -1020.0, + "loss": 0.4213, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.84375, + "rewards/margins": 1.6875, + "rewards/rejected": -8.5625, + "step": 11290 + }, + { + "epoch": 0.420613798365934, + "grad_norm": 6.8218428066398875, + "learning_rate": 3.5911436632388396e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.8125, + "logps/chosen": -880.0, + "logps/rejected": -1016.0, + "loss": 0.4016, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.0625, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.5, + "step": 11300 + }, + { + "epoch": 0.42098602296625787, + "grad_norm": 8.301590494880626, + "learning_rate": 3.588220076571513e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.78125, + "logps/chosen": -864.0, + "logps/rejected": -1040.0, + "loss": 0.4188, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.9375, + "rewards/margins": 1.8046875, + "rewards/rejected": -8.75, + "step": 11310 + }, + { + "epoch": 0.4213582475665817, + "grad_norm": 6.2147088452492545, + "learning_rate": 3.5852946526228136e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.96875, + "logps/chosen": -868.0, + "logps/rejected": -1000.0, + "loss": 0.3812, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.75, + "rewards/margins": 1.625, + "rewards/rejected": -8.375, + "step": 11320 + }, + { + "epoch": 0.4217304721669055, + "grad_norm": 7.2286454887347125, + "learning_rate": 3.582367396331842e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.828125, + "logps/chosen": -900.0, + "logps/rejected": -1032.0, + "loss": 0.4022, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.5703125, + "rewards/rejected": -8.6875, + "step": 11330 + }, + { + "epoch": 0.42210269676722934, + "grad_norm": 6.510837401631301, + "learning_rate": 3.5794383126407905e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.84375, + "logps/chosen": -908.0, + "logps/rejected": -1040.0, + "loss": 0.3872, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.125, + "rewards/margins": 1.640625, + "rewards/rejected": -8.75, + "step": 11340 + }, + { + "epoch": 0.42247492136755316, + "grad_norm": 6.730071761397383, + "learning_rate": 3.5765074064949376e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.625, + "logps/chosen": -880.0, + "logps/rejected": -1056.0, + "loss": 0.3794, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.15625, + "rewards/margins": 1.8125, + "rewards/rejected": -8.9375, + "step": 11350 + }, + { + "epoch": 0.42284714596787704, + "grad_norm": 8.268960838735984, + "learning_rate": 3.573574682842637e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.78125, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.3927, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.1875, + "step": 11360 + }, + { + "epoch": 0.42321937056820086, + "grad_norm": 8.242338172819547, + "learning_rate": 3.5706401466353146e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.84375, + "logps/chosen": -880.0, + "logps/rejected": -1020.0, + "loss": 0.418, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.96875, + "rewards/margins": 1.515625, + "rewards/rejected": -8.5, + "step": 11370 + }, + { + "epoch": 0.4235915951685247, + "grad_norm": 5.98485116947097, + "learning_rate": 3.567703802827453e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.609375, + "logps/chosen": -876.0, + "logps/rejected": -1032.0, + "loss": 0.4131, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.84375, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.5625, + "step": 11380 + }, + { + "epoch": 0.4239638197688485, + "grad_norm": 7.085582904588452, + "learning_rate": 3.564765656376587e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.75, + "logps/chosen": -908.0, + "logps/rejected": -1032.0, + "loss": 0.4028, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.625, + "step": 11390 + }, + { + "epoch": 0.4243360443691724, + "grad_norm": 7.086842233489581, + "learning_rate": 3.561825712243297e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.4375, + "logps/chosen": -876.0, + "logps/rejected": -1032.0, + "loss": 0.3838, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.0, + "rewards/margins": 1.75, + "rewards/rejected": -8.75, + "step": 11400 + }, + { + "epoch": 0.4247082689694962, + "grad_norm": 7.772866376047485, + "learning_rate": 3.5588839753911964e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.78125, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3828, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.9375, + "step": 11410 + }, + { + "epoch": 0.42508049356982003, + "grad_norm": 6.025987701400948, + "learning_rate": 3.555940450786926e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.4163, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.546875, + "rewards/rejected": -9.1875, + "step": 11420 + }, + { + "epoch": 0.42545271817014385, + "grad_norm": 6.52332487394145, + "learning_rate": 3.5529951434001453e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.71875, + "logps/chosen": -904.0, + "logps/rejected": -1080.0, + "loss": 0.4098, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.34375, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.875, + "step": 11430 + }, + { + "epoch": 0.4258249427704677, + "grad_norm": 6.391070174335603, + "learning_rate": 3.5500480582035236e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.828125, + "logps/chosen": -892.0, + "logps/rejected": -1020.0, + "loss": 0.405, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.15625, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.5625, + "step": 11440 + }, + { + "epoch": 0.42619716737079155, + "grad_norm": 6.794901532120129, + "learning_rate": 3.547099200172731e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.796875, + "logps/chosen": -900.0, + "logps/rejected": -1032.0, + "loss": 0.3967, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.53125, + "rewards/rejected": -8.75, + "step": 11450 + }, + { + "epoch": 0.4265693919711154, + "grad_norm": 7.070180251968737, + "learning_rate": 3.544148574286432e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.765625, + "logps/chosen": -900.0, + "logps/rejected": -1024.0, + "loss": 0.3961, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.09375, + "rewards/margins": 1.53125, + "rewards/rejected": -8.625, + "step": 11460 + }, + { + "epoch": 0.4269416165714392, + "grad_norm": 6.888236186071729, + "learning_rate": 3.541196185526275e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.78125, + "logps/chosen": -904.0, + "logps/rejected": -1032.0, + "loss": 0.3888, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.15625, + "rewards/margins": 1.546875, + "rewards/rejected": -8.6875, + "step": 11470 + }, + { + "epoch": 0.427313841171763, + "grad_norm": 6.815452822485508, + "learning_rate": 3.538242038876885e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.6875, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.3992, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.640625, + "rewards/rejected": -9.0625, + "step": 11480 + }, + { + "epoch": 0.4276860657720869, + "grad_norm": 6.007329183570532, + "learning_rate": 3.5352861393258535e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.765625, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.4028, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.15625, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.75, + "step": 11490 + }, + { + "epoch": 0.4280582903724107, + "grad_norm": 7.180646487065023, + "learning_rate": 3.5323284918637346e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -892.0, + "logps/rejected": -1024.0, + "loss": 0.3968, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.0, + "rewards/margins": 1.546875, + "rewards/rejected": -8.5625, + "step": 11500 + }, + { + "epoch": 0.42843051497273454, + "grad_norm": 7.710644278996495, + "learning_rate": 3.529369101484031e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -852.0, + "logps/rejected": -1032.0, + "loss": 0.4339, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.875, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.5625, + "step": 11510 + }, + { + "epoch": 0.42880273957305837, + "grad_norm": 6.710524331773978, + "learning_rate": 3.526407973183188e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.65625, + "logps/chosen": -900.0, + "logps/rejected": -1064.0, + "loss": 0.3814, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.8125, + "step": 11520 + }, + { + "epoch": 0.42917496417338225, + "grad_norm": 7.344507172595124, + "learning_rate": 3.5234451119605864e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3969, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.25, + "step": 11530 + }, + { + "epoch": 0.42954718877370607, + "grad_norm": 6.458039134295703, + "learning_rate": 3.520480522818532e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.625, + "logps/chosen": -904.0, + "logps/rejected": -1072.0, + "loss": 0.4044, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.21875, + "rewards/margins": 1.8125, + "rewards/rejected": -9.0625, + "step": 11540 + }, + { + "epoch": 0.4299194133740299, + "grad_norm": 6.366652978265848, + "learning_rate": 3.517514210762248e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.828125, + "logps/chosen": -912.0, + "logps/rejected": -1040.0, + "loss": 0.427, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.6875, + "step": 11550 + }, + { + "epoch": 0.4302916379743537, + "grad_norm": 6.0544512660302985, + "learning_rate": 3.514546180799867e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.828125, + "logps/chosen": -892.0, + "logps/rejected": -1020.0, + "loss": 0.4197, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.125, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.625, + "step": 11560 + }, + { + "epoch": 0.43066386257467754, + "grad_norm": 6.021327109199788, + "learning_rate": 3.5115764379424204e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.65625, + "logps/chosen": -872.0, + "logps/rejected": -1020.0, + "loss": 0.4022, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.9375, + "rewards/margins": 1.546875, + "rewards/rejected": -8.5, + "step": 11570 + }, + { + "epoch": 0.4310360871750014, + "grad_norm": 6.986428522047901, + "learning_rate": 3.508604987203834e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.4192, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.21875, + "rewards/margins": 1.5703125, + "rewards/rejected": -8.75, + "step": 11580 + }, + { + "epoch": 0.43140831177532524, + "grad_norm": 7.596201585770056, + "learning_rate": 3.505631833600914e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.78125, + "logps/chosen": -960.0, + "logps/rejected": -1048.0, + "loss": 0.4065, + "rewards/accuracies": 0.71875, + "rewards/chosen": -7.5, + "rewards/margins": 1.296875, + "rewards/rejected": -8.8125, + "step": 11590 + }, + { + "epoch": 0.43178053637564906, + "grad_norm": 6.635880522010002, + "learning_rate": 3.5026569821533445e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.59375, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3653, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.46875, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.25, + "step": 11600 + }, + { + "epoch": 0.4321527609759729, + "grad_norm": 6.337035010996294, + "learning_rate": 3.4996804378836755e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.640625, + "logps/chosen": -880.0, + "logps/rejected": -1064.0, + "loss": 0.3944, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.125, + "rewards/margins": 2.03125, + "rewards/rejected": -9.1875, + "step": 11610 + }, + { + "epoch": 0.43252498557629676, + "grad_norm": 7.555615364918259, + "learning_rate": 3.496702205817313e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3801, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.25, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.6875, + "step": 11620 + }, + { + "epoch": 0.4328972101766206, + "grad_norm": 6.718830120269611, + "learning_rate": 3.4937222909825153e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.453125, + "logps/chosen": -892.0, + "logps/rejected": -1072.0, + "loss": 0.4043, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.0, + "rewards/margins": 1.96875, + "rewards/rejected": -9.0, + "step": 11630 + }, + { + "epoch": 0.4332694347769444, + "grad_norm": 6.741132147475561, + "learning_rate": 3.4907406984103794e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -908.0, + "logps/rejected": -1072.0, + "loss": 0.3933, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.21875, + "rewards/margins": 1.828125, + "rewards/rejected": -9.0625, + "step": 11640 + }, + { + "epoch": 0.43364165937726823, + "grad_norm": 6.687695972980779, + "learning_rate": 3.4877574331348376e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.3755, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.21875, + "rewards/margins": 1.8125, + "rewards/rejected": -9.0, + "step": 11650 + }, + { + "epoch": 0.43401388397759205, + "grad_norm": 6.5494745816039, + "learning_rate": 3.484772500192643e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.640625, + "logps/chosen": -884.0, + "logps/rejected": -1064.0, + "loss": 0.4192, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.09375, + "rewards/margins": 1.7734375, + "rewards/rejected": -8.875, + "step": 11660 + }, + { + "epoch": 0.43438610857791593, + "grad_norm": 6.055053654173566, + "learning_rate": 3.481785904623368e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -852.0, + "logps/rejected": -976.0, + "loss": 0.4159, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.625, + "rewards/margins": 1.71875, + "rewards/rejected": -8.3125, + "step": 11670 + }, + { + "epoch": 0.43475833317823975, + "grad_norm": 6.312866434204354, + "learning_rate": 3.4787976514693873e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.796875, + "logps/chosen": -864.0, + "logps/rejected": -988.0, + "loss": 0.4042, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -6.78125, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.1875, + "step": 11680 + }, + { + "epoch": 0.4351305577785636, + "grad_norm": 6.79282235431904, + "learning_rate": 3.475807745775879e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.828125, + "logps/chosen": -896.0, + "logps/rejected": -1024.0, + "loss": 0.4117, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.0625, + "rewards/margins": 1.3515625, + "rewards/rejected": -8.375, + "step": 11690 + }, + { + "epoch": 0.4355027823788874, + "grad_norm": 5.734823622141035, + "learning_rate": 3.4728161925908093e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.734375, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.3929, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.640625, + "rewards/rejected": -8.8125, + "step": 11700 + }, + { + "epoch": 0.4358750069792113, + "grad_norm": 6.955294931778068, + "learning_rate": 3.4698229969649246e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.828125, + "logps/chosen": -872.0, + "logps/rejected": -996.0, + "loss": 0.4077, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.875, + "rewards/margins": 1.4375, + "rewards/rejected": -8.3125, + "step": 11710 + }, + { + "epoch": 0.4362472315795351, + "grad_norm": 6.732014289225819, + "learning_rate": 3.466828163951747e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.859375, + "logps/chosen": -868.0, + "logps/rejected": -1004.0, + "loss": 0.4203, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -6.96875, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.375, + "step": 11720 + }, + { + "epoch": 0.4366194561798589, + "grad_norm": 6.593255125872756, + "learning_rate": 3.46383169860756e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -884.0, + "logps/rejected": -1004.0, + "loss": 0.3862, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.0, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.4375, + "step": 11730 + }, + { + "epoch": 0.43699168078018275, + "grad_norm": 6.4191259891609205, + "learning_rate": 3.460833605991405e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.75, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3994, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.3125, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.8125, + "step": 11740 + }, + { + "epoch": 0.4373639053805066, + "grad_norm": 8.81076635751982, + "learning_rate": 3.4578338911650713e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.6875, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.4539, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.125, + "step": 11750 + }, + { + "epoch": 0.43773612998083045, + "grad_norm": 7.2599110967793, + "learning_rate": 3.454832559193085e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.515625, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3888, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.375, + "step": 11760 + }, + { + "epoch": 0.43810835458115427, + "grad_norm": 7.298180359939871, + "learning_rate": 3.4518296151427036e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -896.0, + "logps/rejected": -1064.0, + "loss": 0.3824, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.03125, + "rewards/margins": 1.8359375, + "rewards/rejected": -8.875, + "step": 11770 + }, + { + "epoch": 0.4384805791814781, + "grad_norm": 8.408466939444446, + "learning_rate": 3.448825064083907e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.3995, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.625, + "step": 11780 + }, + { + "epoch": 0.4388528037818019, + "grad_norm": 7.267261745415541, + "learning_rate": 3.445818911089387e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.5625, + "logps/chosen": -880.0, + "logps/rejected": -1032.0, + "loss": 0.3814, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.09375, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.75, + "step": 11790 + }, + { + "epoch": 0.4392250283821258, + "grad_norm": 5.746071784931887, + "learning_rate": 3.4428111612345413e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.78125, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.4103, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.1875, + "rewards/margins": 1.609375, + "rewards/rejected": -8.8125, + "step": 11800 + }, + { + "epoch": 0.4395972529824496, + "grad_norm": 5.86383513948349, + "learning_rate": 3.439801819597462e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.984375, + "logps/chosen": -932.0, + "logps/rejected": -1056.0, + "loss": 0.4222, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.3828125, + "rewards/rejected": -8.8125, + "step": 11810 + }, + { + "epoch": 0.43996947758277344, + "grad_norm": 6.772936580351455, + "learning_rate": 3.4367908912589307e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.890625, + "logps/chosen": -860.0, + "logps/rejected": -988.0, + "loss": 0.4007, + "rewards/accuracies": 0.75, + "rewards/chosen": -6.96875, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.375, + "step": 11820 + }, + { + "epoch": 0.44034170218309726, + "grad_norm": 6.1945131757780105, + "learning_rate": 3.4337783813024057e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.5, + "logps/chosen": -872.0, + "logps/rejected": -1032.0, + "loss": 0.4001, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.9375, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.5, + "step": 11830 + }, + { + "epoch": 0.44071392678342114, + "grad_norm": 6.862471970226016, + "learning_rate": 3.430764294814017e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.640625, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3806, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.9375, + "step": 11840 + }, + { + "epoch": 0.44108615138374496, + "grad_norm": 6.509274860036443, + "learning_rate": 3.4277486368825557e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.8125, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.4051, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 1.671875, + "rewards/rejected": -9.0, + "step": 11850 + }, + { + "epoch": 0.4414583759840688, + "grad_norm": 7.389703915353271, + "learning_rate": 3.4247314125994677e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.640625, + "logps/chosen": -904.0, + "logps/rejected": -1072.0, + "loss": 0.3721, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.21875, + "rewards/margins": 1.671875, + "rewards/rejected": -8.875, + "step": 11860 + }, + { + "epoch": 0.4418306005843926, + "grad_norm": 6.764597605776528, + "learning_rate": 3.421712627058841e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.8125, + "logps/chosen": -868.0, + "logps/rejected": -1000.0, + "loss": 0.3963, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.84375, + "rewards/margins": 1.65625, + "rewards/rejected": -8.5, + "step": 11870 + }, + { + "epoch": 0.44220282518471643, + "grad_norm": 7.350574701122705, + "learning_rate": 3.4186922853573996e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.53125, + "logps/chosen": -860.0, + "logps/rejected": -1000.0, + "loss": 0.3817, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.90625, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.5625, + "step": 11880 + }, + { + "epoch": 0.4425750497850403, + "grad_norm": 6.904535173446593, + "learning_rate": 3.415670392594498e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.765625, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.399, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.0625, + "step": 11890 + }, + { + "epoch": 0.44294727438536413, + "grad_norm": 6.771487081602254, + "learning_rate": 3.4126469538721053e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.703125, + "logps/chosen": -872.0, + "logps/rejected": -1032.0, + "loss": 0.4147, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.03125, + "rewards/margins": 1.640625, + "rewards/rejected": -8.6875, + "step": 11900 + }, + { + "epoch": 0.44331949898568795, + "grad_norm": 5.470812682079132, + "learning_rate": 3.409621974294804e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.3776, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.125, + "rewards/margins": 1.921875, + "rewards/rejected": -9.0625, + "step": 11910 + }, + { + "epoch": 0.4436917235860118, + "grad_norm": 5.431784429199158, + "learning_rate": 3.4065954589697753e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.84375, + "logps/chosen": -864.0, + "logps/rejected": -1008.0, + "loss": 0.4329, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.90625, + "rewards/margins": 1.59375, + "rewards/rejected": -8.5, + "step": 11920 + }, + { + "epoch": 0.44406394818633566, + "grad_norm": 5.338494629109279, + "learning_rate": 3.403567413006796e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -864.0, + "logps/rejected": -1012.0, + "loss": 0.4113, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.78125, + "rewards/margins": 1.65625, + "rewards/rejected": -8.4375, + "step": 11930 + }, + { + "epoch": 0.4444361727866595, + "grad_norm": 6.759455649052316, + "learning_rate": 3.400537841518224e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.8125, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.3947, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -6.90625, + "rewards/margins": 1.578125, + "rewards/rejected": -8.5, + "step": 11940 + }, + { + "epoch": 0.4448083973869833, + "grad_norm": 6.271101849982418, + "learning_rate": 3.3975067496189963e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.828125, + "logps/chosen": -888.0, + "logps/rejected": -1040.0, + "loss": 0.4002, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.9375, + "rewards/margins": 1.765625, + "rewards/rejected": -8.6875, + "step": 11950 + }, + { + "epoch": 0.4451806219873071, + "grad_norm": 6.80850833405418, + "learning_rate": 3.394474142426615e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.9375, + "logps/chosen": -904.0, + "logps/rejected": -1048.0, + "loss": 0.3824, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.03125, + "rewards/margins": 1.546875, + "rewards/rejected": -8.625, + "step": 11960 + }, + { + "epoch": 0.445552846587631, + "grad_norm": 7.235157172512589, + "learning_rate": 3.39144002506114e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.703125, + "logps/chosen": -920.0, + "logps/rejected": -1048.0, + "loss": 0.4182, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.390625, + "rewards/rejected": -8.6875, + "step": 11970 + }, + { + "epoch": 0.4459250711879548, + "grad_norm": 7.541911784147671, + "learning_rate": 3.388404402645182e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.3932, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.8125, + "rewards/margins": 1.7734375, + "rewards/rejected": -8.5625, + "step": 11980 + }, + { + "epoch": 0.44629729578827865, + "grad_norm": 6.838470908312442, + "learning_rate": 3.3853672803038916e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.734375, + "logps/chosen": -904.0, + "logps/rejected": -1024.0, + "loss": 0.4229, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.96875, + "rewards/margins": 1.578125, + "rewards/rejected": -8.5625, + "step": 11990 + }, + { + "epoch": 0.44666952038860247, + "grad_norm": 7.647284370875841, + "learning_rate": 3.382328663164954e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.4084, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.0625, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.6875, + "step": 12000 + }, + { + "epoch": 0.4470417449889263, + "grad_norm": 6.083463324058337, + "learning_rate": 3.379288556358574e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.671875, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.411, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.96875, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.625, + "step": 12010 + }, + { + "epoch": 0.44741396958925017, + "grad_norm": 6.37327251697913, + "learning_rate": 3.376246965017476e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.953125, + "logps/chosen": -888.0, + "logps/rejected": -1020.0, + "loss": 0.4039, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.9375, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.5625, + "step": 12020 + }, + { + "epoch": 0.447786194189574, + "grad_norm": 6.626369617816579, + "learning_rate": 3.3732038942768895e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -904.0, + "logps/rejected": -1020.0, + "loss": 0.3928, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.03125, + "rewards/margins": 1.515625, + "rewards/rejected": -8.5625, + "step": 12030 + }, + { + "epoch": 0.4481584187898978, + "grad_norm": 8.323270022542616, + "learning_rate": 3.3701593492745386e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -848.0, + "logps/rejected": -992.0, + "loss": 0.4257, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.84375, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.5, + "step": 12040 + }, + { + "epoch": 0.44853064339022164, + "grad_norm": 6.454485607014557, + "learning_rate": 3.36711333515064e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -900.0, + "logps/rejected": -1040.0, + "loss": 0.3841, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.0, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.6875, + "step": 12050 + }, + { + "epoch": 0.4489028679905455, + "grad_norm": 5.553920606747376, + "learning_rate": 3.364065857047891e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.796875, + "logps/chosen": -904.0, + "logps/rejected": -1048.0, + "loss": 0.3976, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.09375, + "rewards/margins": 1.609375, + "rewards/rejected": -8.6875, + "step": 12060 + }, + { + "epoch": 0.44927509259086934, + "grad_norm": 7.324551460649139, + "learning_rate": 3.361016920111458e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.84375, + "logps/chosen": -920.0, + "logps/rejected": -1056.0, + "loss": 0.3907, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.46875, + "rewards/rejected": -9.0625, + "step": 12070 + }, + { + "epoch": 0.44964731719119316, + "grad_norm": 7.364201298314512, + "learning_rate": 3.3579665294889714e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.78125, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.4086, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.125, + "step": 12080 + }, + { + "epoch": 0.450019541791517, + "grad_norm": 6.033128198507223, + "learning_rate": 3.354914690330517e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.796875, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3998, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.609375, + "rewards/rejected": -9.0625, + "step": 12090 + }, + { + "epoch": 0.45039176639184086, + "grad_norm": 6.265204334716435, + "learning_rate": 3.3518614077886246e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.78125, + "logps/chosen": -864.0, + "logps/rejected": -1012.0, + "loss": 0.3849, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.90625, + "rewards/margins": 1.75, + "rewards/rejected": -8.625, + "step": 12100 + }, + { + "epoch": 0.4507639909921647, + "grad_norm": 6.405911221847536, + "learning_rate": 3.348806687018262e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.90625, + "logps/chosen": -904.0, + "logps/rejected": -1032.0, + "loss": 0.3928, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.96875, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.5, + "step": 12110 + }, + { + "epoch": 0.4511362155924885, + "grad_norm": 8.220475361194373, + "learning_rate": 3.3457505331768254e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -884.0, + "logps/rejected": -1056.0, + "loss": 0.4217, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.03125, + "rewards/margins": 1.7734375, + "rewards/rejected": -8.8125, + "step": 12120 + }, + { + "epoch": 0.45150844019281233, + "grad_norm": 7.212318421612806, + "learning_rate": 3.3426929514241294e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.875, + "logps/chosen": -980.0, + "logps/rejected": -1096.0, + "loss": 0.3888, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.1875, + "step": 12130 + }, + { + "epoch": 0.45188066479313616, + "grad_norm": 6.609095144366113, + "learning_rate": 3.3396339469224e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.65625, + "logps/chosen": -908.0, + "logps/rejected": -1072.0, + "loss": 0.4271, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.3125, + "rewards/margins": 1.703125, + "rewards/rejected": -9.0, + "step": 12140 + }, + { + "epoch": 0.45225288939346003, + "grad_norm": 6.736685892609171, + "learning_rate": 3.336573524836266e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.703125, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.4035, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.796875, + "rewards/rejected": -9.3125, + "step": 12150 + }, + { + "epoch": 0.45262511399378386, + "grad_norm": 6.212656206276573, + "learning_rate": 3.3335116903327485e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.859375, + "logps/chosen": -892.0, + "logps/rejected": -1064.0, + "loss": 0.3933, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.0, + "rewards/margins": 1.75, + "rewards/rejected": -8.75, + "step": 12160 + }, + { + "epoch": 0.4529973385941077, + "grad_norm": 6.5944710708386, + "learning_rate": 3.330448448581254e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -876.0, + "logps/rejected": -1020.0, + "loss": 0.4112, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.96875, + "rewards/margins": 1.515625, + "rewards/rejected": -8.5, + "step": 12170 + }, + { + "epoch": 0.4533695631944315, + "grad_norm": 8.380177448591247, + "learning_rate": 3.327383804753563e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.703125, + "logps/chosen": -888.0, + "logps/rejected": -1064.0, + "loss": 0.3953, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.125, + "rewards/margins": 1.53125, + "rewards/rejected": -8.625, + "step": 12180 + }, + { + "epoch": 0.4537417877947554, + "grad_norm": 6.595114343936548, + "learning_rate": 3.3243177640238263e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.625, + "logps/chosen": -900.0, + "logps/rejected": -1080.0, + "loss": 0.391, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.125, + "rewards/margins": 2.078125, + "rewards/rejected": -9.1875, + "step": 12190 + }, + { + "epoch": 0.4541140123950792, + "grad_norm": 8.15009807353792, + "learning_rate": 3.32125033156855e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.734375, + "logps/chosen": -944.0, + "logps/rejected": -1080.0, + "loss": 0.3962, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.0625, + "step": 12200 + }, + { + "epoch": 0.454486236995403, + "grad_norm": 8.100630262206934, + "learning_rate": 3.3181815125665943e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.453125, + "logps/chosen": -912.0, + "logps/rejected": -1096.0, + "loss": 0.3972, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.28125, + "rewards/margins": 1.984375, + "rewards/rejected": -9.25, + "step": 12210 + }, + { + "epoch": 0.45485846159572685, + "grad_norm": 6.605985772792216, + "learning_rate": 3.315111312199154e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -928.0, + "logps/rejected": -1064.0, + "loss": 0.4019, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.875, + "step": 12220 + }, + { + "epoch": 0.45523068619605067, + "grad_norm": 6.483013658820195, + "learning_rate": 3.312039735649761e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.828125, + "logps/chosen": -860.0, + "logps/rejected": -1024.0, + "loss": 0.3961, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -6.71875, + "rewards/margins": 1.9375, + "rewards/rejected": -8.6875, + "step": 12230 + }, + { + "epoch": 0.45560291079637455, + "grad_norm": 7.2980888956191405, + "learning_rate": 3.308966788104271e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.828125, + "logps/chosen": -928.0, + "logps/rejected": -1056.0, + "loss": 0.4055, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.875, + "step": 12240 + }, + { + "epoch": 0.45597513539669837, + "grad_norm": 8.01813755943812, + "learning_rate": 3.305892474750849e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.890625, + "logps/chosen": -904.0, + "logps/rejected": -1048.0, + "loss": 0.3954, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.671875, + "rewards/rejected": -8.75, + "step": 12250 + }, + { + "epoch": 0.4563473599970222, + "grad_norm": 7.782975124175755, + "learning_rate": 3.3028168007799736e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.71875, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.4155, + "rewards/accuracies": 0.71875, + "rewards/chosen": -7.40625, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.875, + "step": 12260 + }, + { + "epoch": 0.456719584597346, + "grad_norm": 6.814143219773761, + "learning_rate": 3.299739771384413e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -896.0, + "logps/rejected": -1056.0, + "loss": 0.4141, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.0625, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.75, + "step": 12270 + }, + { + "epoch": 0.4570918091976699, + "grad_norm": 6.4585312813292735, + "learning_rate": 3.296661391759229e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.515625, + "logps/chosen": -888.0, + "logps/rejected": -1048.0, + "loss": 0.4109, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.625, + "step": 12280 + }, + { + "epoch": 0.4574640337979937, + "grad_norm": 6.518093987936251, + "learning_rate": 3.2935816671017624e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.3736, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.875, + "step": 12290 + }, + { + "epoch": 0.45783625839831754, + "grad_norm": 9.594075542197025, + "learning_rate": 3.290500602611622e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3968, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.0625, + "step": 12300 + }, + { + "epoch": 0.45820848299864136, + "grad_norm": 6.579180903035412, + "learning_rate": 3.2874182034906816e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.78125, + "logps/chosen": -924.0, + "logps/rejected": -1064.0, + "loss": 0.4095, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.375, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.9375, + "step": 12310 + }, + { + "epoch": 0.45858070759896524, + "grad_norm": 5.776181335611089, + "learning_rate": 3.2843344749430666e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -892.0, + "logps/rejected": -1024.0, + "loss": 0.4018, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.0, + "rewards/margins": 1.5, + "rewards/rejected": -8.5, + "step": 12320 + }, + { + "epoch": 0.45895293219928907, + "grad_norm": 7.145279810794003, + "learning_rate": 3.28124942217515e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.75, + "logps/chosen": -876.0, + "logps/rejected": -1024.0, + "loss": 0.4137, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.90625, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.625, + "step": 12330 + }, + { + "epoch": 0.4593251567996129, + "grad_norm": 6.571820871824894, + "learning_rate": 3.2781630503955344e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -924.0, + "logps/rejected": -1056.0, + "loss": 0.4007, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.40625, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.9375, + "step": 12340 + }, + { + "epoch": 0.4596973813999367, + "grad_norm": 7.288027414885038, + "learning_rate": 3.275075364815056e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.796875, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.391, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.0, + "step": 12350 + }, + { + "epoch": 0.46006960600026053, + "grad_norm": 6.211743239121556, + "learning_rate": 3.271986370646764e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.8125, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.3823, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.34375, + "rewards/margins": 1.671875, + "rewards/rejected": -9.0, + "step": 12360 + }, + { + "epoch": 0.4604418306005844, + "grad_norm": 7.189661480883692, + "learning_rate": 3.2688960731059204e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.90625, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.3859, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.21875, + "rewards/margins": 1.5625, + "rewards/rejected": -8.75, + "step": 12370 + }, + { + "epoch": 0.46081405520090823, + "grad_norm": 7.7777417284402075, + "learning_rate": 3.2658044774099875e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.6875, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3962, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.0625, + "step": 12380 + }, + { + "epoch": 0.46118627980123206, + "grad_norm": 7.651220886293237, + "learning_rate": 3.262711588778616e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.875, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.389, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.25, + "rewards/margins": 1.578125, + "rewards/rejected": -8.8125, + "step": 12390 + }, + { + "epoch": 0.4615585044015559, + "grad_norm": 7.627509775274965, + "learning_rate": 3.259617412433644e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.859375, + "logps/chosen": -928.0, + "logps/rejected": -1056.0, + "loss": 0.4007, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.5625, + "rewards/rejected": -9.0, + "step": 12400 + }, + { + "epoch": 0.46193072900187976, + "grad_norm": 7.43723128599684, + "learning_rate": 3.25652195359908e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.78125, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.3949, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.09375, + "rewards/margins": 1.84375, + "rewards/rejected": -8.9375, + "step": 12410 + }, + { + "epoch": 0.4623029536022036, + "grad_norm": 7.458451346683611, + "learning_rate": 3.2534252175010994e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.765625, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.4019, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.9375, + "rewards/margins": 1.625, + "rewards/rejected": -8.5625, + "step": 12420 + }, + { + "epoch": 0.4626751782025274, + "grad_norm": 5.765995983801743, + "learning_rate": 3.2503272093680347e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.84375, + "logps/chosen": -868.0, + "logps/rejected": -1008.0, + "loss": 0.4091, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -6.90625, + "rewards/margins": 1.578125, + "rewards/rejected": -8.5, + "step": 12430 + }, + { + "epoch": 0.4630474028028512, + "grad_norm": 6.298829065535838, + "learning_rate": 3.247227934430364e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.3657, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.09375, + "rewards/margins": 1.6171875, + "rewards/rejected": -8.6875, + "step": 12440 + }, + { + "epoch": 0.46341962740317505, + "grad_norm": 6.431434763296798, + "learning_rate": 3.2441273979207074e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -880.0, + "logps/rejected": -1048.0, + "loss": 0.3822, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.734375, + "rewards/rejected": -8.8125, + "step": 12450 + }, + { + "epoch": 0.46379185200349893, + "grad_norm": 8.507177938511202, + "learning_rate": 3.2410256050738107e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -908.0, + "logps/rejected": -1088.0, + "loss": 0.395, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.28125, + "rewards/margins": 1.84375, + "rewards/rejected": -9.125, + "step": 12460 + }, + { + "epoch": 0.46416407660382275, + "grad_norm": 6.640655048480872, + "learning_rate": 3.237922561126545e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.84375, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3876, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.671875, + "rewards/rejected": -9.0625, + "step": 12470 + }, + { + "epoch": 0.4645363012041466, + "grad_norm": 7.602003158744994, + "learning_rate": 3.23481827131789e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.875, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.4214, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.75, + "rewards/rejected": -9.125, + "step": 12480 + }, + { + "epoch": 0.4649085258044704, + "grad_norm": 5.8056812809450555, + "learning_rate": 3.2317127408889327e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.609375, + "logps/chosen": -912.0, + "logps/rejected": -1080.0, + "loss": 0.3971, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.7890625, + "rewards/rejected": -8.875, + "step": 12490 + }, + { + "epoch": 0.4652807504047943, + "grad_norm": 6.203526634243301, + "learning_rate": 3.228605975082851e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.71875, + "logps/chosen": -896.0, + "logps/rejected": -1012.0, + "loss": 0.394, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.09375, + "rewards/margins": 1.40625, + "rewards/rejected": -8.5, + "step": 12500 + }, + { + "epoch": 0.4656529750051181, + "grad_norm": 7.085750730027124, + "learning_rate": 3.225497979144911e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.609375, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.4059, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.0625, + "step": 12510 + }, + { + "epoch": 0.4660251996054419, + "grad_norm": 6.819002495727156, + "learning_rate": 3.222388758322454e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.9375, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.4248, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.625, + "rewards/rejected": -9.1875, + "step": 12520 + }, + { + "epoch": 0.46639742420576574, + "grad_norm": 7.365070395464945, + "learning_rate": 3.219278317864891e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.671875, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.4127, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.4140625, + "rewards/rejected": -8.875, + "step": 12530 + }, + { + "epoch": 0.4667696488060896, + "grad_norm": 7.3870441506528755, + "learning_rate": 3.2161666630236913e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -920.0, + "logps/rejected": -1064.0, + "loss": 0.3765, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.25, + "rewards/margins": 1.53125, + "rewards/rejected": -8.8125, + "step": 12540 + }, + { + "epoch": 0.46714187340641344, + "grad_norm": 7.185447895897448, + "learning_rate": 3.213053799052373e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.671875, + "logps/chosen": -892.0, + "logps/rejected": -1064.0, + "loss": 0.3796, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.125, + "rewards/margins": 1.84375, + "rewards/rejected": -8.9375, + "step": 12550 + }, + { + "epoch": 0.46751409800673727, + "grad_norm": 5.68511396521476, + "learning_rate": 3.209939731206499e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.609375, + "logps/chosen": -876.0, + "logps/rejected": -1040.0, + "loss": 0.3984, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.7734375, + "rewards/rejected": -8.875, + "step": 12560 + }, + { + "epoch": 0.4678863226070611, + "grad_norm": 7.198198273069706, + "learning_rate": 3.206824464743662e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.765625, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.3886, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.9375, + "step": 12570 + }, + { + "epoch": 0.4682585472073849, + "grad_norm": 8.054355419588779, + "learning_rate": 3.2037080049234795e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.828125, + "logps/chosen": -908.0, + "logps/rejected": -1032.0, + "loss": 0.4082, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.4140625, + "rewards/rejected": -8.8125, + "step": 12580 + }, + { + "epoch": 0.4686307718077088, + "grad_norm": 5.892042449947636, + "learning_rate": 3.2005903570075826e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.984375, + "logps/chosen": -932.0, + "logps/rejected": -1080.0, + "loss": 0.3999, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.125, + "step": 12590 + }, + { + "epoch": 0.4690029964080326, + "grad_norm": 5.865260354898958, + "learning_rate": 3.197471526259611e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.609375, + "logps/chosen": -872.0, + "logps/rejected": -1064.0, + "loss": 0.4088, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.15625, + "rewards/margins": 1.78125, + "rewards/rejected": -8.9375, + "step": 12600 + }, + { + "epoch": 0.46937522100835644, + "grad_norm": 6.594156402463973, + "learning_rate": 3.194351517945197e-07, + "logits/chosen": -4.0625, + "logits/rejected": -4.09375, + "logps/chosen": -936.0, + "logps/rejected": -1048.0, + "loss": 0.4075, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.265625, + "rewards/rejected": -8.6875, + "step": 12610 + }, + { + "epoch": 0.46974744560868026, + "grad_norm": 6.512954220848175, + "learning_rate": 3.1912303373319654e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.9375, + "logps/chosen": -896.0, + "logps/rejected": -1056.0, + "loss": 0.3934, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.15625, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.8125, + "step": 12620 + }, + { + "epoch": 0.47011967020900414, + "grad_norm": 6.224345093076355, + "learning_rate": 3.1881079896895187e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.828125, + "logps/chosen": -868.0, + "logps/rejected": -1032.0, + "loss": 0.3809, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.96875, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.6875, + "step": 12630 + }, + { + "epoch": 0.47049189480932796, + "grad_norm": 6.782096908382096, + "learning_rate": 3.184984480289429e-07, + "logits/chosen": -4.15625, + "logits/rejected": -3.890625, + "logps/chosen": -892.0, + "logps/rejected": -1040.0, + "loss": 0.3706, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.6875, + "rewards/rejected": -8.875, + "step": 12640 + }, + { + "epoch": 0.4708641194096518, + "grad_norm": 8.51401362820416, + "learning_rate": 3.18185981440523e-07, + "logits/chosen": -4.15625, + "logits/rejected": -4.03125, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.4015, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.625, + "rewards/rejected": -8.9375, + "step": 12650 + }, + { + "epoch": 0.4712363440099756, + "grad_norm": 9.35535760938938, + "learning_rate": 3.1787339973124087e-07, + "logits/chosen": -4.09375, + "logits/rejected": -3.84375, + "logps/chosen": -896.0, + "logps/rejected": -1048.0, + "loss": 0.3888, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.09375, + "rewards/margins": 1.7734375, + "rewards/rejected": -8.875, + "step": 12660 + }, + { + "epoch": 0.47160856861029943, + "grad_norm": 9.039959859179886, + "learning_rate": 3.1756070342883955e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.765625, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.4058, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.3125, + "rewards/margins": 1.578125, + "rewards/rejected": -8.875, + "step": 12670 + }, + { + "epoch": 0.4719807932106233, + "grad_norm": 6.893091282299248, + "learning_rate": 3.1724789306125556e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.671875, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.3879, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.15625, + "rewards/margins": 1.765625, + "rewards/rejected": -8.9375, + "step": 12680 + }, + { + "epoch": 0.47235301781094713, + "grad_norm": 6.949622802357949, + "learning_rate": 3.1693496915661776e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -896.0, + "logps/rejected": -1048.0, + "loss": 0.3914, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.0, + "rewards/margins": 1.8046875, + "rewards/rejected": -8.8125, + "step": 12690 + }, + { + "epoch": 0.47272524241127095, + "grad_norm": 6.600419829101733, + "learning_rate": 3.1662193224324717e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.84375, + "logps/chosen": -872.0, + "logps/rejected": -1008.0, + "loss": 0.4084, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.75, + "rewards/margins": 1.609375, + "rewards/rejected": -8.375, + "step": 12700 + }, + { + "epoch": 0.4730974670115948, + "grad_norm": 6.168669759880037, + "learning_rate": 3.163087828496553e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.734375, + "logps/chosen": -884.0, + "logps/rejected": -1008.0, + "loss": 0.4109, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.03125, + "rewards/margins": 1.375, + "rewards/rejected": -8.375, + "step": 12710 + }, + { + "epoch": 0.47346969161191865, + "grad_norm": 6.599623140371136, + "learning_rate": 3.1599552150454357e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.828125, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.3816, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.9375, + "rewards/margins": 1.484375, + "rewards/rejected": -8.4375, + "step": 12720 + }, + { + "epoch": 0.4738419162122425, + "grad_norm": 6.855131597969373, + "learning_rate": 3.1568214873680245e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.8125, + "logps/chosen": -896.0, + "logps/rejected": -1032.0, + "loss": 0.4093, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.65625, + "rewards/rejected": -8.8125, + "step": 12730 + }, + { + "epoch": 0.4742141408125663, + "grad_norm": 6.511510080991066, + "learning_rate": 3.1536866507551047e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.796875, + "logps/chosen": -956.0, + "logps/rejected": -1072.0, + "loss": 0.3817, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.71875, + "rewards/margins": 1.3984375, + "rewards/rejected": -9.125, + "step": 12740 + }, + { + "epoch": 0.4745863654128901, + "grad_norm": 6.08175048096123, + "learning_rate": 3.150550710499336e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.6875, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3863, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.5, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.0, + "step": 12750 + }, + { + "epoch": 0.474958590013214, + "grad_norm": 6.399816140501925, + "learning_rate": 3.1474136718952384e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.71875, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.396, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.125, + "step": 12760 + }, + { + "epoch": 0.4753308146135378, + "grad_norm": 7.214214506783356, + "learning_rate": 3.144275540239189e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -912.0, + "logps/rejected": -1032.0, + "loss": 0.398, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.5, + "rewards/margins": 1.28125, + "rewards/rejected": -8.75, + "step": 12770 + }, + { + "epoch": 0.47570303921386164, + "grad_norm": 7.559991830832495, + "learning_rate": 3.1411363208294077e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -888.0, + "logps/rejected": -1000.0, + "loss": 0.3952, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.0, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.4375, + "step": 12780 + }, + { + "epoch": 0.47607526381418547, + "grad_norm": 8.52872459705108, + "learning_rate": 3.137996018965955e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.71875, + "logps/chosen": -880.0, + "logps/rejected": -1048.0, + "loss": 0.4308, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.9375, + "rewards/margins": 1.7421875, + "rewards/rejected": -8.6875, + "step": 12790 + }, + { + "epoch": 0.4764474884145093, + "grad_norm": 6.985948781124637, + "learning_rate": 3.1348546399507137e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.78125, + "logps/chosen": -920.0, + "logps/rejected": -1056.0, + "loss": 0.3996, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.34375, + "rewards/margins": 1.2890625, + "rewards/rejected": -8.625, + "step": 12800 + }, + { + "epoch": 0.47681971301483317, + "grad_norm": 6.729873673956851, + "learning_rate": 3.131712189087389e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.828125, + "logps/chosen": -872.0, + "logps/rejected": -1004.0, + "loss": 0.3944, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.03125, + "rewards/margins": 1.5, + "rewards/rejected": -8.5625, + "step": 12810 + }, + { + "epoch": 0.477191937615157, + "grad_norm": 7.109909968980753, + "learning_rate": 3.128568671681494e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -852.0, + "logps/rejected": -1012.0, + "loss": 0.4045, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.71875, + "rewards/margins": 1.71875, + "rewards/rejected": -8.4375, + "step": 12820 + }, + { + "epoch": 0.4775641622154808, + "grad_norm": 7.183690820278653, + "learning_rate": 3.1254240930403424e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.625, + "logps/chosen": -876.0, + "logps/rejected": -1032.0, + "loss": 0.3894, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.09375, + "rewards/margins": 1.8515625, + "rewards/rejected": -8.9375, + "step": 12830 + }, + { + "epoch": 0.47793638681580464, + "grad_norm": 7.651837683202167, + "learning_rate": 3.122278458473042e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.6875, + "logps/chosen": -860.0, + "logps/rejected": -1020.0, + "loss": 0.3919, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.8125, + "rewards/margins": 1.8359375, + "rewards/rejected": -8.625, + "step": 12840 + }, + { + "epoch": 0.4783086114161285, + "grad_norm": 6.72730358426319, + "learning_rate": 3.1191317732904803e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.84375, + "logps/chosen": -860.0, + "logps/rejected": -1012.0, + "loss": 0.4001, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.78125, + "rewards/margins": 1.578125, + "rewards/rejected": -8.375, + "step": 12850 + }, + { + "epoch": 0.47868083601645234, + "grad_norm": 5.562202844199672, + "learning_rate": 3.11598404280532e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.953125, + "logps/chosen": -912.0, + "logps/rejected": -1020.0, + "loss": 0.3917, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.15625, + "rewards/margins": 1.484375, + "rewards/rejected": -8.625, + "step": 12860 + }, + { + "epoch": 0.47905306061677616, + "grad_norm": 7.398567449737131, + "learning_rate": 3.112835272331989e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -916.0, + "logps/rejected": -1056.0, + "loss": 0.3866, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.21875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.0, + "step": 12870 + }, + { + "epoch": 0.4794252852171, + "grad_norm": 7.467933641221229, + "learning_rate": 3.1096854671866696e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -912.0, + "logps/rejected": -1048.0, + "loss": 0.4153, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.25, + "rewards/margins": 1.46875, + "rewards/rejected": -8.75, + "step": 12880 + }, + { + "epoch": 0.4797975098174238, + "grad_norm": 7.473429311962256, + "learning_rate": 3.106534632687293e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.765625, + "logps/chosen": -924.0, + "logps/rejected": -1056.0, + "loss": 0.4111, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.359375, + "rewards/rejected": -8.8125, + "step": 12890 + }, + { + "epoch": 0.4801697344177477, + "grad_norm": 5.046857360975577, + "learning_rate": 3.103382774153526e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.765625, + "logps/chosen": -904.0, + "logps/rejected": -1032.0, + "loss": 0.3775, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.15625, + "rewards/margins": 1.3671875, + "rewards/rejected": -8.5625, + "step": 12900 + }, + { + "epoch": 0.4805419590180715, + "grad_norm": 7.2772556946750075, + "learning_rate": 3.1002298969067676e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -896.0, + "logps/rejected": -1032.0, + "loss": 0.4166, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.25, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.625, + "step": 12910 + }, + { + "epoch": 0.48091418361839533, + "grad_norm": 6.828368371772935, + "learning_rate": 3.097076006270132e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.71875, + "logps/chosen": -892.0, + "logps/rejected": -1032.0, + "loss": 0.3963, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.0625, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.6875, + "step": 12920 + }, + { + "epoch": 0.48128640821871915, + "grad_norm": 7.400053186729568, + "learning_rate": 3.093921107568449e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.5625, + "logps/chosen": -880.0, + "logps/rejected": -1032.0, + "loss": 0.4117, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.6875, + "step": 12930 + }, + { + "epoch": 0.48165863281904303, + "grad_norm": 5.577829235822006, + "learning_rate": 3.0907652061282467e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.65625, + "logps/chosen": -876.0, + "logps/rejected": -1016.0, + "loss": 0.4077, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.90625, + "rewards/margins": 1.6875, + "rewards/rejected": -8.625, + "step": 12940 + }, + { + "epoch": 0.48203085741936685, + "grad_norm": 6.709279093390351, + "learning_rate": 3.087608307277749e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.6875, + "logps/chosen": -832.0, + "logps/rejected": -976.0, + "loss": 0.4001, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.5, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.1875, + "step": 12950 + }, + { + "epoch": 0.4824030820196907, + "grad_norm": 6.251984450490257, + "learning_rate": 3.0844504163468634e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.3964, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.03125, + "rewards/margins": 1.578125, + "rewards/rejected": -8.625, + "step": 12960 + }, + { + "epoch": 0.4827753066200145, + "grad_norm": 7.062457537454555, + "learning_rate": 3.081291538667169e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.765625, + "logps/chosen": -924.0, + "logps/rejected": -1096.0, + "loss": 0.4011, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.5, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.0625, + "step": 12970 + }, + { + "epoch": 0.4831475312203384, + "grad_norm": 7.072167019965112, + "learning_rate": 3.0781316795719165e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.4044, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.1875, + "rewards/margins": 1.640625, + "rewards/rejected": -8.8125, + "step": 12980 + }, + { + "epoch": 0.4835197558206622, + "grad_norm": 7.04881342348994, + "learning_rate": 3.0749708443960076e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.828125, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.4092, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.28125, + "rewards/margins": 1.671875, + "rewards/rejected": -8.9375, + "step": 12990 + }, + { + "epoch": 0.483891980420986, + "grad_norm": 7.355018445604345, + "learning_rate": 3.071809038475997e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -908.0, + "logps/rejected": -1064.0, + "loss": 0.4, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.03125, + "rewards/margins": 1.796875, + "rewards/rejected": -8.8125, + "step": 13000 + }, + { + "epoch": 0.48426420502130985, + "grad_norm": 6.132355405641413, + "learning_rate": 3.0686462671500744e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.796875, + "logps/chosen": -952.0, + "logps/rejected": -1056.0, + "loss": 0.4345, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.2890625, + "rewards/rejected": -8.9375, + "step": 13010 + }, + { + "epoch": 0.48463642962163367, + "grad_norm": 6.8525123112205195, + "learning_rate": 3.065482535758063e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -884.0, + "logps/rejected": -1024.0, + "loss": 0.4048, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.09375, + "rewards/margins": 1.5, + "rewards/rejected": -8.625, + "step": 13020 + }, + { + "epoch": 0.48500865422195755, + "grad_norm": 7.430971869898991, + "learning_rate": 3.0623178496414025e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.671875, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.4009, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.46875, + "rewards/margins": 1.2890625, + "rewards/rejected": -8.75, + "step": 13030 + }, + { + "epoch": 0.48538087882228137, + "grad_norm": 7.862159378352481, + "learning_rate": 3.0591522141431495e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.546875, + "logps/chosen": -872.0, + "logps/rejected": -1056.0, + "loss": 0.4142, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.96875, + "rewards/margins": 1.8671875, + "rewards/rejected": -8.8125, + "step": 13040 + }, + { + "epoch": 0.4857531034226052, + "grad_norm": 6.546177146850429, + "learning_rate": 3.0559856346079605e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -892.0, + "logps/rejected": -1040.0, + "loss": 0.4038, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.0, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.6875, + "step": 13050 + }, + { + "epoch": 0.486125328022929, + "grad_norm": 5.589274012809965, + "learning_rate": 3.052818116382086e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.671875, + "logps/chosen": -876.0, + "logps/rejected": -1024.0, + "loss": 0.398, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.03125, + "rewards/margins": 1.59375, + "rewards/rejected": -8.625, + "step": 13060 + }, + { + "epoch": 0.4864975526232529, + "grad_norm": 6.084558369243841, + "learning_rate": 3.0496496648133623e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.796875, + "logps/chosen": -908.0, + "logps/rejected": -1064.0, + "loss": 0.3808, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.640625, + "rewards/rejected": -8.875, + "step": 13070 + }, + { + "epoch": 0.4868697772235767, + "grad_norm": 6.017961614205846, + "learning_rate": 3.0464802852512e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.65625, + "logps/chosen": -892.0, + "logps/rejected": -1040.0, + "loss": 0.3852, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.796875, + "rewards/rejected": -8.9375, + "step": 13080 + }, + { + "epoch": 0.48724200182390054, + "grad_norm": 7.874544081895002, + "learning_rate": 3.0433099830465784e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -904.0, + "logps/rejected": -1032.0, + "loss": 0.3997, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.5, + "rewards/rejected": -8.6875, + "step": 13090 + }, + { + "epoch": 0.48761422642422436, + "grad_norm": 6.0594709895588545, + "learning_rate": 3.040138763552034e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.6875, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.3695, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.3125, + "rewards/margins": 1.71875, + "rewards/rejected": -9.0625, + "step": 13100 + }, + { + "epoch": 0.48798645102454824, + "grad_norm": 6.694824975453483, + "learning_rate": 3.0369666321216494e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.59375, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3871, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.859375, + "rewards/rejected": -9.25, + "step": 13110 + }, + { + "epoch": 0.48835867562487206, + "grad_norm": 7.274905715251884, + "learning_rate": 3.03379359411105e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.4026, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.28125, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.9375, + "step": 13120 + }, + { + "epoch": 0.4887309002251959, + "grad_norm": 7.0889423315338425, + "learning_rate": 3.0306196548773914e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -888.0, + "logps/rejected": -1064.0, + "loss": 0.4004, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.03125, + "rewards/margins": 1.8359375, + "rewards/rejected": -8.875, + "step": 13130 + }, + { + "epoch": 0.4891031248255197, + "grad_norm": 6.390432931779669, + "learning_rate": 3.027444819779351e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.828125, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.3944, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.25, + "rewards/margins": 1.546875, + "rewards/rejected": -8.8125, + "step": 13140 + }, + { + "epoch": 0.48947534942584353, + "grad_norm": 6.273661359354513, + "learning_rate": 3.024269094177116e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -912.0, + "logps/rejected": -1048.0, + "loss": 0.3718, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.21875, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.6875, + "step": 13150 + }, + { + "epoch": 0.4898475740261674, + "grad_norm": 6.9996439549691525, + "learning_rate": 3.0210924834323794e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3957, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.28125, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.125, + "step": 13160 + }, + { + "epoch": 0.49021979862649123, + "grad_norm": 8.921952239176647, + "learning_rate": 3.0179149929083293e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.75, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.4279, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.0, + "step": 13170 + }, + { + "epoch": 0.49059202322681505, + "grad_norm": 6.833806593735758, + "learning_rate": 3.014736627969636e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.796875, + "logps/chosen": -928.0, + "logps/rejected": -1056.0, + "loss": 0.4003, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.421875, + "rewards/rejected": -8.875, + "step": 13180 + }, + { + "epoch": 0.4909642478271389, + "grad_norm": 7.335370522611424, + "learning_rate": 3.0115573939824507e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.84375, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.4014, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.3046875, + "rewards/rejected": -8.8125, + "step": 13190 + }, + { + "epoch": 0.49133647242746276, + "grad_norm": 6.7882540774683715, + "learning_rate": 3.0083772963143866e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.890625, + "logps/chosen": -912.0, + "logps/rejected": -1048.0, + "loss": 0.4128, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.15625, + "rewards/margins": 1.546875, + "rewards/rejected": -8.6875, + "step": 13200 + }, + { + "epoch": 0.4917086970277866, + "grad_norm": 6.7188755571681975, + "learning_rate": 3.00519634033452e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -916.0, + "logps/rejected": -1056.0, + "loss": 0.3761, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.125, + "rewards/margins": 1.671875, + "rewards/rejected": -8.8125, + "step": 13210 + }, + { + "epoch": 0.4920809216281104, + "grad_norm": 7.117010040223568, + "learning_rate": 3.002014531413374e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -916.0, + "logps/rejected": -1056.0, + "loss": 0.4084, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.9375, + "step": 13220 + }, + { + "epoch": 0.4924531462284342, + "grad_norm": 6.165706369471509, + "learning_rate": 2.99883187492291e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -900.0, + "logps/rejected": -1056.0, + "loss": 0.3972, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.0, + "step": 13230 + }, + { + "epoch": 0.49282537082875805, + "grad_norm": 6.751520608576958, + "learning_rate": 2.995648376236524e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.609375, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.4107, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.125, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.6875, + "step": 13240 + }, + { + "epoch": 0.4931975954290819, + "grad_norm": 6.286419334736631, + "learning_rate": 2.992464040729031e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.671875, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.3953, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.609375, + "rewards/rejected": -8.875, + "step": 13250 + }, + { + "epoch": 0.49356982002940575, + "grad_norm": 6.229940154358909, + "learning_rate": 2.989278873776661e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.78125, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.4029, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.375, + "rewards/margins": 1.640625, + "rewards/rejected": -9.0, + "step": 13260 + }, + { + "epoch": 0.49394204462972957, + "grad_norm": 6.66179650506066, + "learning_rate": 2.986092880757046e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -904.0, + "logps/rejected": -1032.0, + "loss": 0.3891, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.75, + "step": 13270 + }, + { + "epoch": 0.4943142692300534, + "grad_norm": 5.597643114110202, + "learning_rate": 2.9829060670492134e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.84375, + "logps/chosen": -932.0, + "logps/rejected": -1080.0, + "loss": 0.3903, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.25, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.9375, + "step": 13280 + }, + { + "epoch": 0.49468649383037727, + "grad_norm": 7.326201588013259, + "learning_rate": 2.9797184380335763e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.625, + "logps/chosen": -924.0, + "logps/rejected": -1104.0, + "loss": 0.3821, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.375, + "rewards/margins": 1.953125, + "rewards/rejected": -9.3125, + "step": 13290 + }, + { + "epoch": 0.4950587184307011, + "grad_norm": 7.111472483298179, + "learning_rate": 2.976529999091924e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.625, + "logps/chosen": -916.0, + "logps/rejected": -1088.0, + "loss": 0.3797, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.3125, + "step": 13300 + }, + { + "epoch": 0.4954309430310249, + "grad_norm": 7.716132583708576, + "learning_rate": 2.9733407556074146e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.6875, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.4005, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.765625, + "rewards/rejected": -9.3125, + "step": 13310 + }, + { + "epoch": 0.49580316763134874, + "grad_norm": 7.291029333117921, + "learning_rate": 2.9701507129645625e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.765625, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.4051, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.46875, + "rewards/rejected": -9.1875, + "step": 13320 + }, + { + "epoch": 0.4961753922316726, + "grad_norm": 6.975640447117475, + "learning_rate": 2.966959876549233e-07, + "logits/chosen": -4.0625, + "logits/rejected": -3.828125, + "logps/chosen": -936.0, + "logps/rejected": -1056.0, + "loss": 0.3779, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.484375, + "rewards/rejected": -8.9375, + "step": 13330 + }, + { + "epoch": 0.49654761683199644, + "grad_norm": 5.811556544381152, + "learning_rate": 2.9637682517486284e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -896.0, + "logps/rejected": -1072.0, + "loss": 0.3969, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.09375, + "rewards/margins": 1.8828125, + "rewards/rejected": -8.9375, + "step": 13340 + }, + { + "epoch": 0.49691984143232026, + "grad_norm": 6.389579764880233, + "learning_rate": 2.9605758439512874e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.859375, + "logps/chosen": -900.0, + "logps/rejected": -1056.0, + "loss": 0.4088, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.21875, + "rewards/margins": 1.7421875, + "rewards/rejected": -8.9375, + "step": 13350 + }, + { + "epoch": 0.4972920660326441, + "grad_norm": 7.639908634178015, + "learning_rate": 2.957382658547066e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.546875, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.3881, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.734375, + "rewards/rejected": -8.9375, + "step": 13360 + }, + { + "epoch": 0.4976642906329679, + "grad_norm": 7.9037749476669985, + "learning_rate": 2.9541887009271354e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.3944, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.0, + "step": 13370 + }, + { + "epoch": 0.4980365152332918, + "grad_norm": 8.274766209947646, + "learning_rate": 2.95099397648397e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.734375, + "logps/chosen": -880.0, + "logps/rejected": -1032.0, + "loss": 0.4256, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.0625, + "rewards/margins": 1.703125, + "rewards/rejected": -8.75, + "step": 13380 + }, + { + "epoch": 0.4984087398336156, + "grad_norm": 6.939253435817808, + "learning_rate": 2.947798490611339e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.5625, + "logps/chosen": -872.0, + "logps/rejected": -1048.0, + "loss": 0.4107, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.0, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.6875, + "step": 13390 + }, + { + "epoch": 0.49878096443393943, + "grad_norm": 7.110764194936422, + "learning_rate": 2.9446022487042966e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.578125, + "logps/chosen": -916.0, + "logps/rejected": -1056.0, + "loss": 0.3995, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.3671875, + "rewards/rejected": -8.875, + "step": 13400 + }, + { + "epoch": 0.49915318903426326, + "grad_norm": 7.2359431302636485, + "learning_rate": 2.9414052561591727e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.65625, + "logps/chosen": -952.0, + "logps/rejected": -1088.0, + "loss": 0.3813, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.25, + "step": 13410 + }, + { + "epoch": 0.49952541363458713, + "grad_norm": 5.577183399555977, + "learning_rate": 2.9382075183735675e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.671875, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3942, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.0, + "step": 13420 + }, + { + "epoch": 0.49989763823491096, + "grad_norm": 6.764218319626137, + "learning_rate": 2.9350090407463363e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -904.0, + "logps/rejected": -1072.0, + "loss": 0.3847, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.9375, + "step": 13430 + }, + { + "epoch": 0.5002698628352348, + "grad_norm": 6.672285878207189, + "learning_rate": 2.9318098286775857e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -876.0, + "logps/rejected": -1020.0, + "loss": 0.3969, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.03125, + "rewards/margins": 1.421875, + "rewards/rejected": -8.4375, + "step": 13440 + }, + { + "epoch": 0.5006420874355586, + "grad_norm": 7.754931542748165, + "learning_rate": 2.92860988756866e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.59375, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.3878, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.03125, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.4375, + "step": 13450 + }, + { + "epoch": 0.5010143120358824, + "grad_norm": 6.2994203496128405, + "learning_rate": 2.9254092228221365e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.859375, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.375, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.0, + "step": 13460 + }, + { + "epoch": 0.5013865366362062, + "grad_norm": 7.464695502491214, + "learning_rate": 2.922207839841814e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -884.0, + "logps/rejected": -1032.0, + "loss": 0.3758, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.03125, + "rewards/margins": 1.6484375, + "rewards/rejected": -8.6875, + "step": 13470 + }, + { + "epoch": 0.5017587612365301, + "grad_norm": 6.747544237608699, + "learning_rate": 2.919005744032702e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3827, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.25, + "step": 13480 + }, + { + "epoch": 0.502130985836854, + "grad_norm": 6.497671086988043, + "learning_rate": 2.915802940801016e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -924.0, + "logps/rejected": -1048.0, + "loss": 0.4102, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.46875, + "rewards/rejected": -8.8125, + "step": 13490 + }, + { + "epoch": 0.5025032104371778, + "grad_norm": 6.026109437129896, + "learning_rate": 2.9125994355541637e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.578125, + "logps/chosen": -892.0, + "logps/rejected": -1072.0, + "loss": 0.3702, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.15625, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.0625, + "step": 13500 + }, + { + "epoch": 0.5028754350375017, + "grad_norm": 6.475623166606656, + "learning_rate": 2.9093952337007404e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.53125, + "logps/chosen": -920.0, + "logps/rejected": -1056.0, + "loss": 0.3845, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.3125, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.8125, + "step": 13510 + }, + { + "epoch": 0.5032476596378255, + "grad_norm": 7.344987462213634, + "learning_rate": 2.9061903406505153e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -892.0, + "logps/rejected": -1016.0, + "loss": 0.398, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.125, + "rewards/margins": 1.59375, + "rewards/rejected": -8.6875, + "step": 13520 + }, + { + "epoch": 0.5036198842381493, + "grad_norm": 7.085970155412669, + "learning_rate": 2.9029847618144243e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.53125, + "logps/chosen": -856.0, + "logps/rejected": -992.0, + "loss": 0.4165, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -6.71875, + "rewards/margins": 1.515625, + "rewards/rejected": -8.25, + "step": 13530 + }, + { + "epoch": 0.5039921088384731, + "grad_norm": 7.363738387936339, + "learning_rate": 2.8997785026045643e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.421875, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.4056, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.90625, + "rewards/margins": 1.59375, + "rewards/rejected": -8.5, + "step": 13540 + }, + { + "epoch": 0.5043643334387969, + "grad_norm": 6.998877344146602, + "learning_rate": 2.8965715684341767e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.578125, + "logps/chosen": -904.0, + "logps/rejected": -1096.0, + "loss": 0.4015, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.34375, + "rewards/margins": 1.90625, + "rewards/rejected": -9.25, + "step": 13550 + }, + { + "epoch": 0.5047365580391208, + "grad_norm": 7.143534472914478, + "learning_rate": 2.893363964717647e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.640625, + "logps/chosen": -952.0, + "logps/rejected": -1128.0, + "loss": 0.3999, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.671875, + "rewards/rejected": -9.25, + "step": 13560 + }, + { + "epoch": 0.5051087826394446, + "grad_norm": 6.323383197595003, + "learning_rate": 2.8901556968704875e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.859375, + "logps/chosen": -952.0, + "logps/rejected": -1048.0, + "loss": 0.4073, + "rewards/accuracies": 0.71875, + "rewards/chosen": -7.65625, + "rewards/margins": 1.0546875, + "rewards/rejected": -8.75, + "step": 13570 + }, + { + "epoch": 0.5054810072397685, + "grad_norm": 6.080059376626755, + "learning_rate": 2.886946770309333e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.78125, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.379, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.8125, + "step": 13580 + }, + { + "epoch": 0.5058532318400923, + "grad_norm": 6.556190332809324, + "learning_rate": 2.8837371904519315e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.78125, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.376, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.125, + "step": 13590 + }, + { + "epoch": 0.5062254564404162, + "grad_norm": 6.567243992544531, + "learning_rate": 2.88052696271713e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -948.0, + "logps/rejected": -1072.0, + "loss": 0.4225, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.4453125, + "rewards/rejected": -9.0625, + "step": 13600 + }, + { + "epoch": 0.50659768104074, + "grad_norm": 8.000388311643157, + "learning_rate": 2.877316092524876e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.765625, + "logps/chosen": -940.0, + "logps/rejected": -1056.0, + "loss": 0.4103, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.421875, + "rewards/rejected": -8.8125, + "step": 13610 + }, + { + "epoch": 0.5069699056410638, + "grad_norm": 6.555055678154845, + "learning_rate": 2.8741045852961955e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.65625, + "logps/chosen": -868.0, + "logps/rejected": -1004.0, + "loss": 0.3952, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.875, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.4375, + "step": 13620 + }, + { + "epoch": 0.5073421302413876, + "grad_norm": 6.9170995820241465, + "learning_rate": 2.870892446453193e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.609375, + "logps/chosen": -852.0, + "logps/rejected": -1020.0, + "loss": 0.3729, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -6.875, + "rewards/margins": 1.65625, + "rewards/rejected": -8.5, + "step": 13630 + }, + { + "epoch": 0.5077143548417115, + "grad_norm": 5.813734355044847, + "learning_rate": 2.867679681419039e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.3689, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.09375, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.8125, + "step": 13640 + }, + { + "epoch": 0.5080865794420353, + "grad_norm": 9.141899225782703, + "learning_rate": 2.8644662956179617e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.640625, + "logps/chosen": -916.0, + "logps/rejected": -1048.0, + "loss": 0.4083, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.125, + "rewards/margins": 1.578125, + "rewards/rejected": -8.6875, + "step": 13650 + }, + { + "epoch": 0.5084588040423592, + "grad_norm": 8.631118529723661, + "learning_rate": 2.861252294475236e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.828125, + "logps/chosen": -956.0, + "logps/rejected": -1096.0, + "loss": 0.4017, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.1875, + "step": 13660 + }, + { + "epoch": 0.508831028642683, + "grad_norm": 6.521938112568747, + "learning_rate": 2.858037683417176e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.3999, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.25, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.9375, + "step": 13670 + }, + { + "epoch": 0.5092032532430069, + "grad_norm": 6.549383508279262, + "learning_rate": 2.8548224678711276e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -908.0, + "logps/rejected": -1032.0, + "loss": 0.4082, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.46875, + "rewards/rejected": -8.625, + "step": 13680 + }, + { + "epoch": 0.5095754778433307, + "grad_norm": 8.841371418894543, + "learning_rate": 2.8516066532654536e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.859375, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.423, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.9375, + "step": 13690 + }, + { + "epoch": 0.5099477024436545, + "grad_norm": 5.83511935808375, + "learning_rate": 2.8483902450295324e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.71875, + "logps/chosen": -892.0, + "logps/rejected": -1056.0, + "loss": 0.3874, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.875, + "rewards/rejected": -8.9375, + "step": 13700 + }, + { + "epoch": 0.5103199270439783, + "grad_norm": 6.619263578889869, + "learning_rate": 2.8451732485937405e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.75, + "logps/chosen": -888.0, + "logps/rejected": -996.0, + "loss": 0.3844, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.8125, + "rewards/margins": 1.578125, + "rewards/rejected": -8.375, + "step": 13710 + }, + { + "epoch": 0.5106921516443022, + "grad_norm": 7.267685266782704, + "learning_rate": 2.841955669389451e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.578125, + "logps/chosen": -884.0, + "logps/rejected": -1004.0, + "loss": 0.4171, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.0625, + "rewards/margins": 1.4609375, + "rewards/rejected": -8.5625, + "step": 13720 + }, + { + "epoch": 0.511064376244626, + "grad_norm": 5.437362953991143, + "learning_rate": 2.838737512849019e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.96875, + "logps/chosen": -912.0, + "logps/rejected": -1024.0, + "loss": 0.397, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.28125, + "rewards/margins": 1.2734375, + "rewards/rejected": -8.5625, + "step": 13730 + }, + { + "epoch": 0.5114366008449498, + "grad_norm": 7.514609538332915, + "learning_rate": 2.8355187844057736e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.3845, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.65625, + "rewards/rejected": -8.8125, + "step": 13740 + }, + { + "epoch": 0.5118088254452737, + "grad_norm": 6.166823259623254, + "learning_rate": 2.8322994894940127e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.78125, + "logps/chosen": -876.0, + "logps/rejected": -1000.0, + "loss": 0.4283, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.09375, + "rewards/margins": 1.46875, + "rewards/rejected": -8.5625, + "step": 13750 + }, + { + "epoch": 0.5121810500455976, + "grad_norm": 6.962333570731038, + "learning_rate": 2.829079633548987e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -928.0, + "logps/rejected": -1064.0, + "loss": 0.4026, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.0, + "step": 13760 + }, + { + "epoch": 0.5125532746459214, + "grad_norm": 7.679134970085725, + "learning_rate": 2.8258592220068966e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.734375, + "logps/chosen": -876.0, + "logps/rejected": -1032.0, + "loss": 0.4042, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -6.875, + "rewards/margins": 1.78125, + "rewards/rejected": -8.6875, + "step": 13770 + }, + { + "epoch": 0.5129254992462452, + "grad_norm": 6.419079021618556, + "learning_rate": 2.8226382603048784e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.8125, + "logps/chosen": -896.0, + "logps/rejected": -1032.0, + "loss": 0.399, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.5625, + "step": 13780 + }, + { + "epoch": 0.513297723846569, + "grad_norm": 6.76090948052491, + "learning_rate": 2.819416753880999e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -892.0, + "logps/rejected": -1016.0, + "loss": 0.3973, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.90625, + "rewards/margins": 1.5, + "rewards/rejected": -8.375, + "step": 13790 + }, + { + "epoch": 0.5136699484468928, + "grad_norm": 7.3501492048347, + "learning_rate": 2.8161947081742447e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.5, + "logps/chosen": -880.0, + "logps/rejected": -1040.0, + "loss": 0.4017, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.84375, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.5625, + "step": 13800 + }, + { + "epoch": 0.5140421730472167, + "grad_norm": 7.603046836679688, + "learning_rate": 2.812972128624511e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.3738, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.21875, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.75, + "step": 13810 + }, + { + "epoch": 0.5144143976475405, + "grad_norm": 6.17781555589395, + "learning_rate": 2.8097490206725976e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -884.0, + "logps/rejected": -1048.0, + "loss": 0.3854, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.15625, + "rewards/margins": 1.78125, + "rewards/rejected": -8.9375, + "step": 13820 + }, + { + "epoch": 0.5147866222478643, + "grad_norm": 7.931441540053952, + "learning_rate": 2.806525389760192e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.625, + "logps/chosen": -908.0, + "logps/rejected": -1104.0, + "loss": 0.4179, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.34375, + "rewards/margins": 1.84375, + "rewards/rejected": -9.1875, + "step": 13830 + }, + { + "epoch": 0.5151588468481882, + "grad_norm": 7.252242636046333, + "learning_rate": 2.803301241329869e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -888.0, + "logps/rejected": -1032.0, + "loss": 0.4094, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -6.9375, + "rewards/margins": 1.5625, + "rewards/rejected": -8.5, + "step": 13840 + }, + { + "epoch": 0.5155310714485121, + "grad_norm": 7.276005920488118, + "learning_rate": 2.800076580825074e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.71875, + "logps/chosen": -840.0, + "logps/rejected": -980.0, + "loss": 0.4071, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -6.71875, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.1875, + "step": 13850 + }, + { + "epoch": 0.5159032960488359, + "grad_norm": 6.935979321801387, + "learning_rate": 2.796851413690119e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.671875, + "logps/chosen": -864.0, + "logps/rejected": -1020.0, + "loss": 0.4094, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -6.8125, + "rewards/margins": 1.6875, + "rewards/rejected": -8.5, + "step": 13860 + }, + { + "epoch": 0.5162755206491597, + "grad_norm": 9.22004815539808, + "learning_rate": 2.7936257453701693e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -916.0, + "logps/rejected": -1048.0, + "loss": 0.3944, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.9375, + "step": 13870 + }, + { + "epoch": 0.5166477452494835, + "grad_norm": 7.192174398609411, + "learning_rate": 2.790399581311238e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.59375, + "logps/chosen": -880.0, + "logps/rejected": -1040.0, + "loss": 0.3952, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.0, + "step": 13880 + }, + { + "epoch": 0.5170199698498074, + "grad_norm": 7.6085407913319845, + "learning_rate": 2.7871729269601763e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.53125, + "logps/chosen": -884.0, + "logps/rejected": -1064.0, + "loss": 0.3909, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.0, + "rewards/margins": 1.8203125, + "rewards/rejected": -8.8125, + "step": 13890 + }, + { + "epoch": 0.5173921944501312, + "grad_norm": 6.786052907009634, + "learning_rate": 2.7839457877646587e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -892.0, + "logps/rejected": -1032.0, + "loss": 0.3901, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.09375, + "rewards/margins": 1.546875, + "rewards/rejected": -8.625, + "step": 13900 + }, + { + "epoch": 0.517764419050455, + "grad_norm": 9.97123525062437, + "learning_rate": 2.780718169173184e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.5625, + "logps/chosen": -908.0, + "logps/rejected": -1064.0, + "loss": 0.3835, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.1875, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.0625, + "step": 13910 + }, + { + "epoch": 0.5181366436507788, + "grad_norm": 7.024367355973595, + "learning_rate": 2.7774900766350564e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -932.0, + "logps/rejected": -1048.0, + "loss": 0.4169, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.390625, + "rewards/rejected": -8.8125, + "step": 13920 + }, + { + "epoch": 0.5185088682511028, + "grad_norm": 6.701742032772339, + "learning_rate": 2.7742615156003805e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.625, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3884, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.1875, + "step": 13930 + }, + { + "epoch": 0.5188810928514266, + "grad_norm": 6.610007938253779, + "learning_rate": 2.7710324915200546e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.6875, + "logps/chosen": -880.0, + "logps/rejected": -1040.0, + "loss": 0.3912, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.84375, + "rewards/margins": 1.765625, + "rewards/rejected": -8.625, + "step": 13940 + }, + { + "epoch": 0.5192533174517504, + "grad_norm": 6.9465246907194516, + "learning_rate": 2.767803009845756e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.578125, + "logps/chosen": -892.0, + "logps/rejected": -1040.0, + "loss": 0.4003, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.09375, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.625, + "step": 13950 + }, + { + "epoch": 0.5196255420520742, + "grad_norm": 6.787787473874666, + "learning_rate": 2.764573076029935e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -940.0, + "logps/rejected": -1064.0, + "loss": 0.3908, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.28125, + "rewards/margins": 1.53125, + "rewards/rejected": -8.8125, + "step": 13960 + }, + { + "epoch": 0.519997766652398, + "grad_norm": 7.8614911088252, + "learning_rate": 2.7613426955258074e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -912.0, + "logps/rejected": -1048.0, + "loss": 0.3956, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.28125, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.875, + "step": 13970 + }, + { + "epoch": 0.5203699912527219, + "grad_norm": 6.420281750004171, + "learning_rate": 2.758111873787341e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.96875, + "logps/chosen": -924.0, + "logps/rejected": -1040.0, + "loss": 0.4271, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.46875, + "rewards/rejected": -8.875, + "step": 13980 + }, + { + "epoch": 0.5207422158530457, + "grad_norm": 7.298458475561115, + "learning_rate": 2.754880616269248e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -908.0, + "logps/rejected": -1016.0, + "loss": 0.3945, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.3515625, + "rewards/rejected": -8.5, + "step": 13990 + }, + { + "epoch": 0.5211144404533695, + "grad_norm": 7.895141105525205, + "learning_rate": 2.75164892842698e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.765625, + "logps/chosen": -924.0, + "logps/rejected": -1088.0, + "loss": 0.3745, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.125, + "step": 14000 + }, + { + "epoch": 0.5214866650536933, + "grad_norm": 7.61218935106479, + "learning_rate": 2.7484168157167095e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.71875, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3988, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6875, + "rewards/rejected": -9.1875, + "step": 14010 + }, + { + "epoch": 0.5218588896540173, + "grad_norm": 6.390207414536727, + "learning_rate": 2.7451842835953326e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.625, + "logps/chosen": -916.0, + "logps/rejected": -1080.0, + "loss": 0.4212, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.25, + "rewards/margins": 1.78125, + "rewards/rejected": -9.0625, + "step": 14020 + }, + { + "epoch": 0.5222311142543411, + "grad_norm": 6.238814572122423, + "learning_rate": 2.7419513375204485e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.3782, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.46875, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.0, + "step": 14030 + }, + { + "epoch": 0.5226033388546649, + "grad_norm": 11.746337063902551, + "learning_rate": 2.738717982950357e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -896.0, + "logps/rejected": -1024.0, + "loss": 0.4074, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.28125, + "rewards/margins": 1.453125, + "rewards/rejected": -8.6875, + "step": 14040 + }, + { + "epoch": 0.5229755634549887, + "grad_norm": 6.590535935014694, + "learning_rate": 2.7354842253440484e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.3678, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.65625, + "rewards/rejected": -9.0, + "step": 14050 + }, + { + "epoch": 0.5233477880553126, + "grad_norm": 7.903293723031568, + "learning_rate": 2.7322500701611926e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.398, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.125, + "rewards/margins": 1.7734375, + "rewards/rejected": -8.9375, + "step": 14060 + }, + { + "epoch": 0.5237200126556364, + "grad_norm": 7.700506217889851, + "learning_rate": 2.7290155228621315e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.71875, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3864, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.0625, + "step": 14070 + }, + { + "epoch": 0.5240922372559602, + "grad_norm": 7.866654860741371, + "learning_rate": 2.7257805889078677e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.578125, + "logps/chosen": -908.0, + "logps/rejected": -1080.0, + "loss": 0.4052, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.09375, + "rewards/margins": 1.8359375, + "rewards/rejected": -8.9375, + "step": 14080 + }, + { + "epoch": 0.524464461856284, + "grad_norm": 7.50839285832117, + "learning_rate": 2.7225452737600574e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.6875, + "logps/chosen": -864.0, + "logps/rejected": -1012.0, + "loss": 0.4138, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.875, + "rewards/margins": 1.640625, + "rewards/rejected": -8.5, + "step": 14090 + }, + { + "epoch": 0.524836686456608, + "grad_norm": 7.659388191111035, + "learning_rate": 2.7193095828810016e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -912.0, + "logps/rejected": -1048.0, + "loss": 0.4012, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.25, + "rewards/margins": 1.6875, + "rewards/rejected": -8.9375, + "step": 14100 + }, + { + "epoch": 0.5252089110569318, + "grad_norm": 8.55681528191728, + "learning_rate": 2.7160735217336314e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.71875, + "logps/chosen": -868.0, + "logps/rejected": -1056.0, + "loss": 0.4024, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -6.9375, + "rewards/margins": 1.9921875, + "rewards/rejected": -8.9375, + "step": 14110 + }, + { + "epoch": 0.5255811356572556, + "grad_norm": 7.16727339555467, + "learning_rate": 2.71283709578151e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -900.0, + "logps/rejected": -1064.0, + "loss": 0.3792, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.0, + "step": 14120 + }, + { + "epoch": 0.5259533602575794, + "grad_norm": 11.73206706711725, + "learning_rate": 2.709600310488809e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.3863, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.75, + "rewards/rejected": -9.0625, + "step": 14130 + }, + { + "epoch": 0.5263255848579033, + "grad_norm": 6.823026753277971, + "learning_rate": 2.706363171320313e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.3886, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.625, + "rewards/rejected": -9.125, + "step": 14140 + }, + { + "epoch": 0.5266978094582271, + "grad_norm": 8.110746857819453, + "learning_rate": 2.7031256837414e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.4039, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.4375, + "step": 14150 + }, + { + "epoch": 0.5270700340585509, + "grad_norm": 6.902529471191516, + "learning_rate": 2.6998878532180374e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3914, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.5625, + "rewards/margins": 1.453125, + "rewards/rejected": -9.0, + "step": 14160 + }, + { + "epoch": 0.5274422586588747, + "grad_norm": 7.585718456674298, + "learning_rate": 2.6966496852167723e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.4357, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.9375, + "step": 14170 + }, + { + "epoch": 0.5278144832591986, + "grad_norm": 7.11490323887478, + "learning_rate": 2.693411185204721e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.671875, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.3987, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.5625, + "rewards/rejected": -9.0, + "step": 14180 + }, + { + "epoch": 0.5281867078595225, + "grad_norm": 6.41907278214237, + "learning_rate": 2.69017235864956e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.671875, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.398, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.125, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.6875, + "step": 14190 + }, + { + "epoch": 0.5285589324598463, + "grad_norm": 6.479034925223726, + "learning_rate": 2.686933211019517e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.671875, + "logps/chosen": -876.0, + "logps/rejected": -1040.0, + "loss": 0.3901, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.96875, + "rewards/margins": 1.703125, + "rewards/rejected": -8.6875, + "step": 14200 + }, + { + "epoch": 0.5289311570601701, + "grad_norm": 7.087539680153311, + "learning_rate": 2.6836937477833637e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.640625, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.3933, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.65625, + "rewards/rejected": -8.875, + "step": 14210 + }, + { + "epoch": 0.529303381660494, + "grad_norm": 8.862543061376018, + "learning_rate": 2.680453974410402e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.5625, + "logps/chosen": -896.0, + "logps/rejected": -1032.0, + "loss": 0.4195, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.5625, + "rewards/rejected": -8.8125, + "step": 14220 + }, + { + "epoch": 0.5296756062608178, + "grad_norm": 8.11738752886338, + "learning_rate": 2.677213896370459e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.609375, + "logps/chosen": -884.0, + "logps/rejected": -1040.0, + "loss": 0.4032, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.09375, + "rewards/margins": 1.75, + "rewards/rejected": -8.8125, + "step": 14230 + }, + { + "epoch": 0.5300478308611416, + "grad_norm": 7.567257769775458, + "learning_rate": 2.6739735191338765e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.953125, + "logps/chosen": -880.0, + "logps/rejected": -996.0, + "loss": 0.3969, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -6.90625, + "rewards/margins": 1.3828125, + "rewards/rejected": -8.3125, + "step": 14240 + }, + { + "epoch": 0.5304200554614654, + "grad_norm": 6.837647398955726, + "learning_rate": 2.6707328481714997e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -912.0, + "logps/rejected": -1072.0, + "loss": 0.4026, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.15625, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.0, + "step": 14250 + }, + { + "epoch": 0.5307922800617892, + "grad_norm": 6.894529418949448, + "learning_rate": 2.6674918889546713e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.3788, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.75, + "rewards/rejected": -8.875, + "step": 14260 + }, + { + "epoch": 0.5311645046621131, + "grad_norm": 6.998955700140186, + "learning_rate": 2.6642506469552197e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.372, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.875, + "rewards/rejected": -9.3125, + "step": 14270 + }, + { + "epoch": 0.531536729262437, + "grad_norm": 8.340806207523931, + "learning_rate": 2.6610091276454523e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3983, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.0625, + "step": 14280 + }, + { + "epoch": 0.5319089538627608, + "grad_norm": 6.546477513724081, + "learning_rate": 2.657767336498142e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3887, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.890625, + "rewards/rejected": -9.4375, + "step": 14290 + }, + { + "epoch": 0.5322811784630846, + "grad_norm": 6.664434790918801, + "learning_rate": 2.654525278986523e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -916.0, + "logps/rejected": -1040.0, + "loss": 0.3967, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.453125, + "rewards/rejected": -8.8125, + "step": 14300 + }, + { + "epoch": 0.5326534030634085, + "grad_norm": 6.176735499675511, + "learning_rate": 2.651282960584279e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.625, + "logps/chosen": -892.0, + "logps/rejected": -1040.0, + "loss": 0.4031, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.15625, + "rewards/margins": 1.578125, + "rewards/rejected": -8.6875, + "step": 14310 + }, + { + "epoch": 0.5330256276637323, + "grad_norm": 6.652636948850704, + "learning_rate": 2.6480403867655325e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.765625, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.3914, + "rewards/accuracies": 0.887499988079071, + "rewards/chosen": -7.0625, + "rewards/margins": 1.90625, + "rewards/rejected": -9.0, + "step": 14320 + }, + { + "epoch": 0.5333978522640561, + "grad_norm": 6.720265649775818, + "learning_rate": 2.644797563004839e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.59375, + "logps/chosen": -920.0, + "logps/rejected": -1048.0, + "loss": 0.395, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.3125, + "rewards/margins": 1.5, + "rewards/rejected": -8.8125, + "step": 14330 + }, + { + "epoch": 0.5337700768643799, + "grad_norm": 7.103271810767403, + "learning_rate": 2.641554494777175e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.59375, + "logps/chosen": -916.0, + "logps/rejected": -1096.0, + "loss": 0.3828, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.0625, + "step": 14340 + }, + { + "epoch": 0.5341423014647038, + "grad_norm": 7.4953286855316135, + "learning_rate": 2.6383111875579313e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.3985, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.375, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.9375, + "step": 14350 + }, + { + "epoch": 0.5345145260650276, + "grad_norm": 6.831448675863622, + "learning_rate": 2.635067646822898e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.40625, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3956, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.25, + "step": 14360 + }, + { + "epoch": 0.5348867506653515, + "grad_norm": 7.596768554508921, + "learning_rate": 2.631823878048266e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.78125, + "logps/chosen": -900.0, + "logps/rejected": -1040.0, + "loss": 0.3993, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.15625, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.75, + "step": 14370 + }, + { + "epoch": 0.5352589752656753, + "grad_norm": 6.564407084319504, + "learning_rate": 2.628579886710605e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.453125, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.4009, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.5625, + "rewards/rejected": -8.75, + "step": 14380 + }, + { + "epoch": 0.5356311998659992, + "grad_norm": 8.432970770474082, + "learning_rate": 2.625335678286864e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.59375, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.4021, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6171875, + "rewards/rejected": -8.9375, + "step": 14390 + }, + { + "epoch": 0.536003424466323, + "grad_norm": 5.972038101446805, + "learning_rate": 2.622091258254358e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.78125, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.3808, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.609375, + "rewards/rejected": -9.0625, + "step": 14400 + }, + { + "epoch": 0.5363756490666468, + "grad_norm": 6.282918379790417, + "learning_rate": 2.618846632090758e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.5, + "logps/chosen": -892.0, + "logps/rejected": -1032.0, + "loss": 0.3872, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.9375, + "step": 14410 + }, + { + "epoch": 0.5367478736669706, + "grad_norm": 6.482026013361085, + "learning_rate": 2.6156018052740844e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.578125, + "logps/chosen": -888.0, + "logps/rejected": -1048.0, + "loss": 0.4114, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.734375, + "rewards/rejected": -8.875, + "step": 14420 + }, + { + "epoch": 0.5371200982672945, + "grad_norm": 6.533841135317475, + "learning_rate": 2.6123567832826955e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -876.0, + "logps/rejected": -1040.0, + "loss": 0.3907, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -6.875, + "rewards/margins": 1.828125, + "rewards/rejected": -8.6875, + "step": 14430 + }, + { + "epoch": 0.5374923228676183, + "grad_norm": 9.343072999522697, + "learning_rate": 2.60911157159528e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.5, + "logps/chosen": -856.0, + "logps/rejected": -996.0, + "loss": 0.4061, + "rewards/accuracies": 0.78125, + "rewards/chosen": -6.9375, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.5, + "step": 14440 + }, + { + "epoch": 0.5378645474679422, + "grad_norm": 6.4917376309419685, + "learning_rate": 2.6058661756908463e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -888.0, + "logps/rejected": -1024.0, + "loss": 0.3727, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.0, + "rewards/margins": 1.5625, + "rewards/rejected": -8.5625, + "step": 14450 + }, + { + "epoch": 0.538236772068266, + "grad_norm": 6.606339290189657, + "learning_rate": 2.6026206010487135e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -888.0, + "logps/rejected": -1024.0, + "loss": 0.3986, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.625, + "step": 14460 + }, + { + "epoch": 0.5386089966685899, + "grad_norm": 7.242716998437837, + "learning_rate": 2.599374853148502e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.796875, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3865, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.21875, + "rewards/margins": 1.6875, + "rewards/rejected": -8.875, + "step": 14470 + }, + { + "epoch": 0.5389812212689137, + "grad_norm": 6.750422533669666, + "learning_rate": 2.596128937470127e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.796875, + "logps/chosen": -904.0, + "logps/rejected": -1048.0, + "loss": 0.3882, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.25, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.9375, + "step": 14480 + }, + { + "epoch": 0.5393534458692375, + "grad_norm": 7.378663444926177, + "learning_rate": 2.592882859493785e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.734375, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.3964, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.28125, + "rewards/margins": 1.59375, + "rewards/rejected": -8.875, + "step": 14490 + }, + { + "epoch": 0.5397256704695613, + "grad_norm": 6.180996814914712, + "learning_rate": 2.5896366246999474e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.484375, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.3816, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.1875, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.875, + "step": 14500 + }, + { + "epoch": 0.5400978950698851, + "grad_norm": 7.312809225518716, + "learning_rate": 2.586390238569349e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -868.0, + "logps/rejected": -1040.0, + "loss": 0.3892, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.125, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.8125, + "step": 14510 + }, + { + "epoch": 0.540470119670209, + "grad_norm": 7.735931403716923, + "learning_rate": 2.583143706582983e-07, + "logits/chosen": -3.640625, + "logits/rejected": -3.484375, + "logps/chosen": -868.0, + "logps/rejected": -1016.0, + "loss": 0.4042, + "rewards/accuracies": 0.8125, + "rewards/chosen": -6.96875, + "rewards/margins": 1.75, + "rewards/rejected": -8.75, + "step": 14520 + }, + { + "epoch": 0.5408423442705328, + "grad_norm": 7.386550142635529, + "learning_rate": 2.579897034222084e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.640625, + "logps/chosen": -904.0, + "logps/rejected": -1080.0, + "loss": 0.3923, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.25, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.0, + "step": 14530 + }, + { + "epoch": 0.5412145688708567, + "grad_norm": 7.801685311116698, + "learning_rate": 2.57665022696813e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -904.0, + "logps/rejected": -1072.0, + "loss": 0.372, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.0, + "step": 14540 + }, + { + "epoch": 0.5415867934711805, + "grad_norm": 7.950857417470352, + "learning_rate": 2.573403290302819e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.5, + "logps/chosen": -872.0, + "logps/rejected": -1040.0, + "loss": 0.3697, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.0, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.6875, + "step": 14550 + }, + { + "epoch": 0.5419590180715044, + "grad_norm": 6.054736592005576, + "learning_rate": 2.5701562297080755e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.515625, + "logps/chosen": -908.0, + "logps/rejected": -1088.0, + "loss": 0.3788, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -6.96875, + "rewards/margins": 1.953125, + "rewards/rejected": -8.9375, + "step": 14560 + }, + { + "epoch": 0.5423312426718282, + "grad_norm": 8.32299315563001, + "learning_rate": 2.5669090506660284e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -944.0, + "logps/rejected": -1080.0, + "loss": 0.4043, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.5, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.0625, + "step": 14570 + }, + { + "epoch": 0.542703467272152, + "grad_norm": 7.457508532114577, + "learning_rate": 2.563661758659007e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.71875, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.4103, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.125, + "rewards/margins": 1.859375, + "rewards/rejected": -9.0, + "step": 14580 + }, + { + "epoch": 0.5430756918724758, + "grad_norm": 7.923365062566301, + "learning_rate": 2.560414359169533e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.546875, + "logps/chosen": -936.0, + "logps/rejected": -1056.0, + "loss": 0.381, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.9375, + "step": 14590 + }, + { + "epoch": 0.5434479164727997, + "grad_norm": 7.612168570836311, + "learning_rate": 2.5571668576803083e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.59375, + "logps/chosen": -908.0, + "logps/rejected": -1040.0, + "loss": 0.3862, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.375, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.875, + "step": 14600 + }, + { + "epoch": 0.5438201410731235, + "grad_norm": 6.4994103046870135, + "learning_rate": 2.553919259674207e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.640625, + "logps/chosen": -924.0, + "logps/rejected": -1064.0, + "loss": 0.3893, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.0625, + "step": 14610 + }, + { + "epoch": 0.5441923656734473, + "grad_norm": 6.326789197760104, + "learning_rate": 2.5506715706342665e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -896.0, + "logps/rejected": -1056.0, + "loss": 0.4096, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.578125, + "rewards/rejected": -8.75, + "step": 14620 + }, + { + "epoch": 0.5445645902737712, + "grad_norm": 6.648732167687645, + "learning_rate": 2.547423796043678e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.625, + "logps/chosen": -868.0, + "logps/rejected": -1048.0, + "loss": 0.374, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.0, + "rewards/margins": 1.8671875, + "rewards/rejected": -8.875, + "step": 14630 + }, + { + "epoch": 0.5449368148740951, + "grad_norm": 8.329275976348509, + "learning_rate": 2.5441759413857764e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.5625, + "logps/chosen": -888.0, + "logps/rejected": -1040.0, + "loss": 0.4001, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.1875, + "rewards/margins": 1.640625, + "rewards/rejected": -8.8125, + "step": 14640 + }, + { + "epoch": 0.5453090394744189, + "grad_norm": 6.639693503014401, + "learning_rate": 2.540928012144033e-07, + "logits/chosen": -3.5625, + "logits/rejected": -3.46875, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.3906, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.0625, + "rewards/margins": 1.65625, + "rewards/rejected": -8.75, + "step": 14650 + }, + { + "epoch": 0.5456812640747427, + "grad_norm": 6.5496829902143645, + "learning_rate": 2.537680013802045e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.609375, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.4075, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.671875, + "rewards/rejected": -9.0625, + "step": 14660 + }, + { + "epoch": 0.5460534886750665, + "grad_norm": 6.909218409126343, + "learning_rate": 2.534431951843524e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.53125, + "logps/chosen": -916.0, + "logps/rejected": -1040.0, + "loss": 0.417, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.34375, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.9375, + "step": 14670 + }, + { + "epoch": 0.5464257132753904, + "grad_norm": 6.348519960071836, + "learning_rate": 2.5311838317522924e-07, + "logits/chosen": -3.578125, + "logits/rejected": -3.53125, + "logps/chosen": -912.0, + "logps/rejected": -1072.0, + "loss": 0.3841, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.609375, + "rewards/rejected": -9.0625, + "step": 14680 + }, + { + "epoch": 0.5467979378757142, + "grad_norm": 6.937539087482061, + "learning_rate": 2.5279356590122674e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3941, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.0625, + "step": 14690 + }, + { + "epoch": 0.547170162476038, + "grad_norm": 6.832408581548504, + "learning_rate": 2.524687439107458e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.8125, + "logps/chosen": -928.0, + "logps/rejected": -1064.0, + "loss": 0.4046, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.3125, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.8125, + "step": 14700 + }, + { + "epoch": 0.5475423870763618, + "grad_norm": 7.087045214872431, + "learning_rate": 2.5214391775219506e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.4062, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.09375, + "rewards/margins": 1.5, + "rewards/rejected": -8.625, + "step": 14710 + }, + { + "epoch": 0.5479146116766858, + "grad_norm": 6.7539895024040595, + "learning_rate": 2.5181908797399033e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.734375, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.4139, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.1875, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.8125, + "step": 14720 + }, + { + "epoch": 0.5482868362770096, + "grad_norm": 7.0379271465608335, + "learning_rate": 2.5149425512455346e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -884.0, + "logps/rejected": -1032.0, + "loss": 0.3925, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.03125, + "rewards/margins": 1.6796875, + "rewards/rejected": -8.6875, + "step": 14730 + }, + { + "epoch": 0.5486590608773334, + "grad_norm": 8.444929390256299, + "learning_rate": 2.5116941975231153e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -912.0, + "logps/rejected": -1048.0, + "loss": 0.3954, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.21875, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.6875, + "step": 14740 + }, + { + "epoch": 0.5490312854776572, + "grad_norm": 6.37472531782827, + "learning_rate": 2.5084458240569595e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.5625, + "logps/chosen": -900.0, + "logps/rejected": -1040.0, + "loss": 0.3953, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.1875, + "rewards/margins": 1.5390625, + "rewards/rejected": -8.6875, + "step": 14750 + }, + { + "epoch": 0.549403510077981, + "grad_norm": 6.670881706016348, + "learning_rate": 2.5051974363314126e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -920.0, + "logps/rejected": -1056.0, + "loss": 0.3658, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.1875, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.75, + "step": 14760 + }, + { + "epoch": 0.5497757346783049, + "grad_norm": 7.496262564377888, + "learning_rate": 2.501949039830846e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.546875, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3798, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.21875, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.125, + "step": 14770 + }, + { + "epoch": 0.5501479592786287, + "grad_norm": 6.279229063064921, + "learning_rate": 2.4987006400396445e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -864.0, + "logps/rejected": -1020.0, + "loss": 0.3787, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.78125, + "rewards/margins": 1.7578125, + "rewards/rejected": -8.5625, + "step": 14780 + }, + { + "epoch": 0.5505201838789525, + "grad_norm": 6.801680844243791, + "learning_rate": 2.4954522424422e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.609375, + "logps/chosen": -864.0, + "logps/rejected": -1016.0, + "loss": 0.4005, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -6.96875, + "rewards/margins": 1.515625, + "rewards/rejected": -8.5, + "step": 14790 + }, + { + "epoch": 0.5508924084792763, + "grad_norm": 8.321305950386638, + "learning_rate": 2.492203852522898e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.65625, + "logps/chosen": -908.0, + "logps/rejected": -1032.0, + "loss": 0.3855, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.0625, + "rewards/margins": 1.5703125, + "rewards/rejected": -8.625, + "step": 14800 + }, + { + "epoch": 0.5512646330796003, + "grad_norm": 7.522646117401838, + "learning_rate": 2.4889554757661154e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -920.0, + "logps/rejected": -1064.0, + "loss": 0.4106, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6875, + "rewards/rejected": -9.0, + "step": 14810 + }, + { + "epoch": 0.5516368576799241, + "grad_norm": 6.708087708544129, + "learning_rate": 2.4857071176562026e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.4013, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.375, + "rewards/rejected": -8.625, + "step": 14820 + }, + { + "epoch": 0.5520090822802479, + "grad_norm": 6.73490907132692, + "learning_rate": 2.482458783677481e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.59375, + "logps/chosen": -892.0, + "logps/rejected": -1064.0, + "loss": 0.3863, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.0625, + "rewards/margins": 1.796875, + "rewards/rejected": -8.875, + "step": 14830 + }, + { + "epoch": 0.5523813068805717, + "grad_norm": 6.459128869478243, + "learning_rate": 2.47921047931423e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -884.0, + "logps/rejected": -1024.0, + "loss": 0.3754, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.0, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.625, + "step": 14840 + }, + { + "epoch": 0.5527535314808956, + "grad_norm": 7.387064869057433, + "learning_rate": 2.47596221005068e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.578125, + "logps/chosen": -896.0, + "logps/rejected": -1032.0, + "loss": 0.3975, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.1875, + "rewards/margins": 1.46875, + "rewards/rejected": -8.625, + "step": 14850 + }, + { + "epoch": 0.5531257560812194, + "grad_norm": 6.613897630878896, + "learning_rate": 2.472713981371002e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.53125, + "logps/chosen": -924.0, + "logps/rejected": -1088.0, + "loss": 0.3871, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.1875, + "step": 14860 + }, + { + "epoch": 0.5534979806815432, + "grad_norm": 6.168672428973416, + "learning_rate": 2.4694657987592964e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -984.0, + "logps/rejected": -1144.0, + "loss": 0.3735, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.9375, + "rewards/margins": 1.734375, + "rewards/rejected": -9.6875, + "step": 14870 + }, + { + "epoch": 0.553870205281867, + "grad_norm": 7.128443596752006, + "learning_rate": 2.4662176676995895e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.46875, + "logps/chosen": -924.0, + "logps/rejected": -1096.0, + "loss": 0.3861, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.75, + "rewards/rejected": -9.25, + "step": 14880 + }, + { + "epoch": 0.554242429882191, + "grad_norm": 6.234975280250282, + "learning_rate": 2.4629695936758176e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.71875, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.386, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.1875, + "step": 14890 + }, + { + "epoch": 0.5546146544825148, + "grad_norm": 8.727733919256348, + "learning_rate": 2.459721582171822e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -916.0, + "logps/rejected": -1032.0, + "loss": 0.444, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.3984375, + "rewards/rejected": -8.6875, + "step": 14900 + }, + { + "epoch": 0.5549868790828386, + "grad_norm": 6.718372906640212, + "learning_rate": 2.4564736386713383e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.65625, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.3935, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.15625, + "rewards/margins": 1.75, + "rewards/rejected": -8.9375, + "step": 14910 + }, + { + "epoch": 0.5553591036831624, + "grad_norm": 6.697925179882034, + "learning_rate": 2.453225768657987e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.453125, + "logps/chosen": -880.0, + "logps/rejected": -1024.0, + "loss": 0.3999, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.71875, + "rewards/rejected": -8.8125, + "step": 14920 + }, + { + "epoch": 0.5557313282834863, + "grad_norm": 6.905346423237574, + "learning_rate": 2.4499779776152644e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.6875, + "logps/chosen": -924.0, + "logps/rejected": -1056.0, + "loss": 0.4241, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.40625, + "rewards/margins": 1.3203125, + "rewards/rejected": -8.75, + "step": 14930 + }, + { + "epoch": 0.5561035528838101, + "grad_norm": 6.785509789461729, + "learning_rate": 2.446730271026534e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.75, + "logps/chosen": -936.0, + "logps/rejected": -1048.0, + "loss": 0.3955, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.34375, + "rewards/margins": 1.4375, + "rewards/rejected": -8.75, + "step": 14940 + }, + { + "epoch": 0.5564757774841339, + "grad_norm": 6.774184709690954, + "learning_rate": 2.443482654375017e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.5625, + "logps/chosen": -880.0, + "logps/rejected": -1032.0, + "loss": 0.3994, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.578125, + "rewards/rejected": -8.75, + "step": 14950 + }, + { + "epoch": 0.5568480020844577, + "grad_norm": 5.73699971816976, + "learning_rate": 2.440235133143781e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.65625, + "logps/chosen": -908.0, + "logps/rejected": -1064.0, + "loss": 0.378, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.28125, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.9375, + "step": 14960 + }, + { + "epoch": 0.5572202266847815, + "grad_norm": 6.863429176112081, + "learning_rate": 2.4369877128157353e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.65625, + "logps/chosen": -960.0, + "logps/rejected": -1080.0, + "loss": 0.3901, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.3203125, + "rewards/rejected": -8.875, + "step": 14970 + }, + { + "epoch": 0.5575924512851055, + "grad_norm": 5.948404549621852, + "learning_rate": 2.433740398873616e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.484375, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.3979, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.28125, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.9375, + "step": 14980 + }, + { + "epoch": 0.5579646758854293, + "grad_norm": 9.914428116382458, + "learning_rate": 2.4304931967999817e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -916.0, + "logps/rejected": -1056.0, + "loss": 0.3905, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.875, + "step": 14990 + }, + { + "epoch": 0.5583369004857531, + "grad_norm": 6.87679023232461, + "learning_rate": 2.4272461120772e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.6875, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.3867, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.78125, + "rewards/rejected": -9.25, + "step": 15000 + }, + { + "epoch": 0.5583369004857531, + "eval_logits/chosen": -3.796875, + "eval_logits/rejected": -3.59375, + "eval_logps/chosen": -992.0, + "eval_logps/rejected": -1112.0, + "eval_loss": 0.46097543835639954, + "eval_rewards/accuracies": 0.7531396746635437, + "eval_rewards/chosen": -7.9375, + "eval_rewards/margins": 1.4453125, + "eval_rewards/rejected": -9.375, + "eval_runtime": 6273.9008, + "eval_samples_per_second": 30.453, + "eval_steps_per_second": 0.476, + "step": 15000 + }, + { + "epoch": 0.558709125086077, + "grad_norm": 6.304434593226907, + "learning_rate": 2.4239991501874437e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.578125, + "logps/chosen": -948.0, + "logps/rejected": -1072.0, + "loss": 0.4169, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.4921875, + "rewards/rejected": -9.0625, + "step": 15010 + }, + { + "epoch": 0.5590813496864008, + "grad_norm": 8.114223374797405, + "learning_rate": 2.4207523166126737e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.375, + "logps/chosen": -920.0, + "logps/rejected": -1080.0, + "loss": 0.3996, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.65625, + "rewards/rejected": -9.0625, + "step": 15020 + }, + { + "epoch": 0.5594535742867246, + "grad_norm": 6.985558918614317, + "learning_rate": 2.417505616834638e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.53125, + "logps/chosen": -916.0, + "logps/rejected": -1056.0, + "loss": 0.3903, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.0, + "step": 15030 + }, + { + "epoch": 0.5598257988870484, + "grad_norm": 7.613927888065651, + "learning_rate": 2.4142590563348586e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.765625, + "logps/chosen": -920.0, + "logps/rejected": -1040.0, + "loss": 0.4094, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.375, + "rewards/rejected": -8.875, + "step": 15040 + }, + { + "epoch": 0.5601980234873722, + "grad_norm": 7.5723174479152675, + "learning_rate": 2.411012640594619e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.3785, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.453125, + "rewards/rejected": -9.1875, + "step": 15050 + }, + { + "epoch": 0.5605702480876961, + "grad_norm": 7.684399684732663, + "learning_rate": 2.4077663750949624e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.381, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.640625, + "rewards/rejected": -8.875, + "step": 15060 + }, + { + "epoch": 0.56094247268802, + "grad_norm": 7.778253805648127, + "learning_rate": 2.404520265316675e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.859375, + "logps/chosen": -936.0, + "logps/rejected": -1072.0, + "loss": 0.3986, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.5703125, + "rewards/rejected": -8.8125, + "step": 15070 + }, + { + "epoch": 0.5613146972883438, + "grad_norm": 7.404450523178779, + "learning_rate": 2.4012743167402823e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.5625, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.4078, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.21875, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.75, + "step": 15080 + }, + { + "epoch": 0.5616869218886676, + "grad_norm": 7.833740957912255, + "learning_rate": 2.3980285348460363e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.828125, + "logps/chosen": -900.0, + "logps/rejected": -1056.0, + "loss": 0.3905, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.734375, + "rewards/rejected": -8.9375, + "step": 15090 + }, + { + "epoch": 0.5620591464889915, + "grad_norm": 7.62171966614336, + "learning_rate": 2.3947829251139076e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.515625, + "logps/chosen": -888.0, + "logps/rejected": -1008.0, + "loss": 0.3873, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.03125, + "rewards/margins": 1.46875, + "rewards/rejected": -8.5, + "step": 15100 + }, + { + "epoch": 0.5624313710893153, + "grad_norm": 6.759568359187905, + "learning_rate": 2.391537493023579e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -896.0, + "logps/rejected": -1056.0, + "loss": 0.3894, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.1875, + "rewards/margins": 1.890625, + "rewards/rejected": -9.0625, + "step": 15110 + }, + { + "epoch": 0.5628035956896391, + "grad_norm": 8.005931150789195, + "learning_rate": 2.388292244054429e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.5, + "logps/chosen": -872.0, + "logps/rejected": -1012.0, + "loss": 0.4175, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.0625, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.6875, + "step": 15120 + }, + { + "epoch": 0.5631758202899629, + "grad_norm": 7.315250084747323, + "learning_rate": 2.3850471836855297e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.546875, + "logps/chosen": -904.0, + "logps/rejected": -1032.0, + "loss": 0.396, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.4375, + "rewards/rejected": -8.6875, + "step": 15130 + }, + { + "epoch": 0.5635480448902868, + "grad_norm": 7.554577291894118, + "learning_rate": 2.3818023173956334e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -924.0, + "logps/rejected": -1056.0, + "loss": 0.4024, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.25, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.75, + "step": 15140 + }, + { + "epoch": 0.5639202694906106, + "grad_norm": 7.715322510769299, + "learning_rate": 2.3785576506631665e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.421875, + "logps/chosen": -860.0, + "logps/rejected": -1056.0, + "loss": 0.3807, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -6.9375, + "rewards/margins": 2.015625, + "rewards/rejected": -8.9375, + "step": 15150 + }, + { + "epoch": 0.5642924940909345, + "grad_norm": 8.800579622122374, + "learning_rate": 2.3753131889662162e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.5625, + "logps/chosen": -912.0, + "logps/rejected": -1032.0, + "loss": 0.4111, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.28125, + "rewards/margins": 1.359375, + "rewards/rejected": -8.625, + "step": 15160 + }, + { + "epoch": 0.5646647186912583, + "grad_norm": 6.216610213046552, + "learning_rate": 2.372068937782526e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.515625, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3882, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.6171875, + "rewards/rejected": -8.8125, + "step": 15170 + }, + { + "epoch": 0.5650369432915822, + "grad_norm": 6.3611903303471875, + "learning_rate": 2.368824902589481e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -916.0, + "logps/rejected": -1032.0, + "loss": 0.4007, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.28125, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.75, + "step": 15180 + }, + { + "epoch": 0.565409167891906, + "grad_norm": 6.423728815759188, + "learning_rate": 2.3655810888641044e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.3698, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.625, + "rewards/rejected": -8.75, + "step": 15190 + }, + { + "epoch": 0.5657813924922298, + "grad_norm": 6.651807248619183, + "learning_rate": 2.362337502083045e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.75, + "logps/chosen": -912.0, + "logps/rejected": -1048.0, + "loss": 0.411, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.8125, + "step": 15200 + }, + { + "epoch": 0.5661536170925536, + "grad_norm": 6.479238998244672, + "learning_rate": 2.3590941477225666e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -884.0, + "logps/rejected": -1056.0, + "loss": 0.4034, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.03125, + "rewards/margins": 1.9140625, + "rewards/rejected": -8.9375, + "step": 15210 + }, + { + "epoch": 0.5665258416928775, + "grad_norm": 7.359793755614737, + "learning_rate": 2.3558510312585425e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.578125, + "logps/chosen": -948.0, + "logps/rejected": -1056.0, + "loss": 0.4127, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.25, + "rewards/rejected": -8.75, + "step": 15220 + }, + { + "epoch": 0.5668980662932013, + "grad_norm": 7.569067529304266, + "learning_rate": 2.3526081581664434e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -892.0, + "logps/rejected": -1024.0, + "loss": 0.4041, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.125, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.5625, + "step": 15230 + }, + { + "epoch": 0.5672702908935251, + "grad_norm": 6.719544611702365, + "learning_rate": 2.3493655339213303e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.4079, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.1875, + "rewards/margins": 1.578125, + "rewards/rejected": -8.75, + "step": 15240 + }, + { + "epoch": 0.567642515493849, + "grad_norm": 7.714438793167596, + "learning_rate": 2.346123163997841e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.75, + "logps/chosen": -916.0, + "logps/rejected": -1080.0, + "loss": 0.3959, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.6171875, + "rewards/rejected": -8.8125, + "step": 15250 + }, + { + "epoch": 0.5680147400941729, + "grad_norm": 7.334707418739626, + "learning_rate": 2.3428810538701893e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -888.0, + "logps/rejected": -1048.0, + "loss": 0.3675, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.15625, + "rewards/margins": 1.734375, + "rewards/rejected": -8.875, + "step": 15260 + }, + { + "epoch": 0.5683869646944967, + "grad_norm": 8.375917357172026, + "learning_rate": 2.3396392090121435e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.796875, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.3972, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.875, + "step": 15270 + }, + { + "epoch": 0.5687591892948205, + "grad_norm": 7.10601718160401, + "learning_rate": 2.3363976348970303e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -932.0, + "logps/rejected": -1112.0, + "loss": 0.4098, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.375, + "rewards/margins": 1.78125, + "rewards/rejected": -9.125, + "step": 15280 + }, + { + "epoch": 0.5691314138951443, + "grad_norm": 7.47573956820412, + "learning_rate": 2.3331563369977163e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.84375, + "logps/chosen": -964.0, + "logps/rejected": -1064.0, + "loss": 0.4044, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.2734375, + "rewards/rejected": -8.8125, + "step": 15290 + }, + { + "epoch": 0.5695036384954681, + "grad_norm": 7.296147967523193, + "learning_rate": 2.3299153207866013e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3826, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.25, + "step": 15300 + }, + { + "epoch": 0.569875863095792, + "grad_norm": 7.27846362968299, + "learning_rate": 2.326674591735612e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.578125, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3986, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.4921875, + "rewards/rejected": -9.0625, + "step": 15310 + }, + { + "epoch": 0.5702480876961158, + "grad_norm": 6.49552098774796, + "learning_rate": 2.3234341553161858e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.484375, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.391, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8125, + "rewards/rejected": -9.375, + "step": 15320 + }, + { + "epoch": 0.5706203122964397, + "grad_norm": 7.021461532700091, + "learning_rate": 2.3201940169992723e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.71875, + "logps/chosen": -956.0, + "logps/rejected": -1080.0, + "loss": 0.3911, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.4765625, + "rewards/rejected": -9.125, + "step": 15330 + }, + { + "epoch": 0.5709925368967635, + "grad_norm": 7.337526254324888, + "learning_rate": 2.316954182255311e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.578125, + "logps/chosen": -928.0, + "logps/rejected": -1096.0, + "loss": 0.4012, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.78125, + "rewards/rejected": -9.25, + "step": 15340 + }, + { + "epoch": 0.5713647614970874, + "grad_norm": 7.281747289233091, + "learning_rate": 2.3137146565542343e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.609375, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.4084, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.0625, + "step": 15350 + }, + { + "epoch": 0.5717369860974112, + "grad_norm": 7.412934833175832, + "learning_rate": 2.3104754453654514e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.734375, + "logps/chosen": -928.0, + "logps/rejected": -1040.0, + "loss": 0.4101, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.59375, + "rewards/margins": 1.3828125, + "rewards/rejected": -9.0, + "step": 15360 + }, + { + "epoch": 0.572109210697735, + "grad_norm": 8.066563897159936, + "learning_rate": 2.307236554157838e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.671875, + "logps/chosen": -916.0, + "logps/rejected": -1048.0, + "loss": 0.3908, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.8125, + "step": 15370 + }, + { + "epoch": 0.5724814352980588, + "grad_norm": 6.610646057920627, + "learning_rate": 2.3039979883997333e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3784, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.53125, + "rewards/rejected": -9.25, + "step": 15380 + }, + { + "epoch": 0.5728536598983827, + "grad_norm": 7.410150183253641, + "learning_rate": 2.3007597535589224e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.78125, + "logps/chosen": -948.0, + "logps/rejected": -1080.0, + "loss": 0.4047, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.3125, + "step": 15390 + }, + { + "epoch": 0.5732258844987065, + "grad_norm": 6.993977557124211, + "learning_rate": 2.297521855102638e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -912.0, + "logps/rejected": -1104.0, + "loss": 0.3926, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.890625, + "rewards/rejected": -9.4375, + "step": 15400 + }, + { + "epoch": 0.5735981090990303, + "grad_norm": 6.186432894968066, + "learning_rate": 2.2942842984975383e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -912.0, + "logps/rejected": -1080.0, + "loss": 0.3801, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.25, + "rewards/margins": 1.90625, + "rewards/rejected": -9.125, + "step": 15410 + }, + { + "epoch": 0.5739703336993542, + "grad_norm": 8.939193062960232, + "learning_rate": 2.2910470892097102e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.6875, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3954, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.875, + "rewards/rejected": -9.5, + "step": 15420 + }, + { + "epoch": 0.5743425582996781, + "grad_norm": 7.345151732320506, + "learning_rate": 2.287810232704649e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.4065, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.25, + "step": 15430 + }, + { + "epoch": 0.5747147829000019, + "grad_norm": 7.629776597420945, + "learning_rate": 2.2845737344472564e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.6875, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.4003, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.625, + "rewards/margins": 1.640625, + "rewards/rejected": -9.25, + "step": 15440 + }, + { + "epoch": 0.5750870075003257, + "grad_norm": 6.826720425615687, + "learning_rate": 2.2813375999018334e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3761, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.765625, + "rewards/rejected": -9.125, + "step": 15450 + }, + { + "epoch": 0.5754592321006495, + "grad_norm": 8.029971238883949, + "learning_rate": 2.2781018345320585e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -916.0, + "logps/rejected": -1088.0, + "loss": 0.3907, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.34375, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.1875, + "step": 15460 + }, + { + "epoch": 0.5758314567009734, + "grad_norm": 8.876150087152947, + "learning_rate": 2.2748664438009953e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.609375, + "logps/chosen": -924.0, + "logps/rejected": -1136.0, + "loss": 0.3857, + "rewards/accuracies": 0.8812500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 2.1875, + "rewards/rejected": -9.6875, + "step": 15470 + }, + { + "epoch": 0.5762036813012972, + "grad_norm": 7.987671003576862, + "learning_rate": 2.2716314331710684e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.625, + "logps/chosen": -960.0, + "logps/rejected": -1088.0, + "loss": 0.3832, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.65625, + "rewards/rejected": -9.1875, + "step": 15480 + }, + { + "epoch": 0.576575905901621, + "grad_norm": 8.476345742779369, + "learning_rate": 2.268396808104066e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.734375, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3735, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.25, + "step": 15490 + }, + { + "epoch": 0.5769481305019448, + "grad_norm": 6.5138578687250215, + "learning_rate": 2.2651625740611206e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.5625, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.3882, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.75, + "rewards/rejected": -9.5625, + "step": 15500 + }, + { + "epoch": 0.5773203551022688, + "grad_norm": 6.283540927927959, + "learning_rate": 2.2619287365027075e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.78125, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.3904, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.46875, + "rewards/rejected": -9.3125, + "step": 15510 + }, + { + "epoch": 0.5776925797025926, + "grad_norm": 7.342770639740905, + "learning_rate": 2.2586953008886314e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3835, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.375, + "step": 15520 + }, + { + "epoch": 0.5780648043029164, + "grad_norm": 6.138873183384365, + "learning_rate": 2.2554622726780186e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.5625, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3695, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.625, + "rewards/rejected": -9.25, + "step": 15530 + }, + { + "epoch": 0.5784370289032402, + "grad_norm": 7.352452552277564, + "learning_rate": 2.25222965732931e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.4159, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.609375, + "rewards/rejected": -9.1875, + "step": 15540 + }, + { + "epoch": 0.578809253503564, + "grad_norm": 6.748433771543007, + "learning_rate": 2.2489974603002437e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.4264, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.59375, + "rewards/rejected": -9.0625, + "step": 15550 + }, + { + "epoch": 0.5791814781038879, + "grad_norm": 6.486490955839246, + "learning_rate": 2.2457656870478587e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3928, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.34375, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.0625, + "step": 15560 + }, + { + "epoch": 0.5795537027042117, + "grad_norm": 6.841328241564237, + "learning_rate": 2.2425343430284716e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.640625, + "logps/chosen": -928.0, + "logps/rejected": -1064.0, + "loss": 0.3931, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.28125, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.8125, + "step": 15570 + }, + { + "epoch": 0.5799259273045355, + "grad_norm": 7.0731166379454935, + "learning_rate": 2.239303433697679e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.578125, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.3941, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.25, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.9375, + "step": 15580 + }, + { + "epoch": 0.5802981519048593, + "grad_norm": 8.69384109328274, + "learning_rate": 2.2360729645103418e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.765625, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.3949, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.9375, + "step": 15590 + }, + { + "epoch": 0.5806703765051833, + "grad_norm": 7.818460832254398, + "learning_rate": 2.232842940920579e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.625, + "logps/chosen": -976.0, + "logps/rejected": -1120.0, + "loss": 0.3928, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -8.0, + "rewards/margins": 1.453125, + "rewards/rejected": -9.4375, + "step": 15600 + }, + { + "epoch": 0.5810426011055071, + "grad_norm": 8.177532589626665, + "learning_rate": 2.229613368381755e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.546875, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3986, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.25, + "step": 15610 + }, + { + "epoch": 0.5814148257058309, + "grad_norm": 8.522944478988173, + "learning_rate": 2.2263842523464744e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.53125, + "logps/chosen": -984.0, + "logps/rejected": -1136.0, + "loss": 0.386, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.71875, + "rewards/rejected": -9.5625, + "step": 15620 + }, + { + "epoch": 0.5817870503061547, + "grad_norm": 7.660836572396954, + "learning_rate": 2.2231555982665728e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.78125, + "logps/chosen": -976.0, + "logps/rejected": -1096.0, + "loss": 0.3975, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.625, + "rewards/rejected": -9.375, + "step": 15630 + }, + { + "epoch": 0.5821592749064786, + "grad_norm": 9.5113032927714, + "learning_rate": 2.2199274115931012e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.71875, + "logps/chosen": -952.0, + "logps/rejected": -1080.0, + "loss": 0.3849, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.546875, + "rewards/rejected": -9.1875, + "step": 15640 + }, + { + "epoch": 0.5825314995068024, + "grad_norm": 7.211526747983167, + "learning_rate": 2.216699697776326e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1120.0, + "loss": 0.3764, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.34375, + "rewards/margins": 1.953125, + "rewards/rejected": -9.3125, + "step": 15650 + }, + { + "epoch": 0.5829037241071262, + "grad_norm": 6.347640605160803, + "learning_rate": 2.2134724622657114e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.640625, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.4, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.5, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.3125, + "step": 15660 + }, + { + "epoch": 0.58327594870745, + "grad_norm": 7.950090556246327, + "learning_rate": 2.2102457105099177e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.3935, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.1875, + "step": 15670 + }, + { + "epoch": 0.583648173307774, + "grad_norm": 7.907176444113626, + "learning_rate": 2.2070194479567858e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.6875, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.4042, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.3125, + "step": 15680 + }, + { + "epoch": 0.5840203979080978, + "grad_norm": 8.830446089524017, + "learning_rate": 2.2037936800533319e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.578125, + "logps/chosen": -920.0, + "logps/rejected": -1040.0, + "loss": 0.3817, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.9375, + "step": 15690 + }, + { + "epoch": 0.5843926225084216, + "grad_norm": 8.06568542508863, + "learning_rate": 2.2005684122457374e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.828125, + "logps/chosen": -932.0, + "logps/rejected": -1112.0, + "loss": 0.3881, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.375, + "step": 15700 + }, + { + "epoch": 0.5847648471087454, + "grad_norm": 6.987683340986026, + "learning_rate": 2.1973436499793377e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.640625, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.3917, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.1875, + "step": 15710 + }, + { + "epoch": 0.5851370717090693, + "grad_norm": 7.443410309610095, + "learning_rate": 2.194119398698617e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.59375, + "logps/chosen": -932.0, + "logps/rejected": -1080.0, + "loss": 0.3971, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.3125, + "step": 15720 + }, + { + "epoch": 0.5855092963093931, + "grad_norm": 7.211854957463693, + "learning_rate": 2.190895663847194e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.734375, + "logps/chosen": -916.0, + "logps/rejected": -1080.0, + "loss": 0.3793, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.3125, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.1875, + "step": 15730 + }, + { + "epoch": 0.5858815209097169, + "grad_norm": 6.285128132126638, + "learning_rate": 2.1876724508678184e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.546875, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.3835, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.125, + "rewards/margins": 1.859375, + "rewards/rejected": -9.0, + "step": 15740 + }, + { + "epoch": 0.5862537455100407, + "grad_norm": 6.7100955909606705, + "learning_rate": 2.1844497652023563e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.609375, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3935, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.765625, + "rewards/rejected": -9.125, + "step": 15750 + }, + { + "epoch": 0.5866259701103645, + "grad_norm": 5.7565762201527075, + "learning_rate": 2.181227612291786e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.671875, + "logps/chosen": -920.0, + "logps/rejected": -1080.0, + "loss": 0.3756, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.125, + "step": 15760 + }, + { + "epoch": 0.5869981947106885, + "grad_norm": 6.610554519765395, + "learning_rate": 2.1780059975761833e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.515625, + "logps/chosen": -904.0, + "logps/rejected": -1080.0, + "loss": 0.4025, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 2.015625, + "rewards/rejected": -9.3125, + "step": 15770 + }, + { + "epoch": 0.5873704193110123, + "grad_norm": 6.38759048756963, + "learning_rate": 2.1747849264947177e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.6875, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.3763, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.0, + "rewards/margins": 1.84375, + "rewards/rejected": -8.875, + "step": 15780 + }, + { + "epoch": 0.5877426439113361, + "grad_norm": 6.563105373864839, + "learning_rate": 2.1715644044856413e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.3909, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.9375, + "step": 15790 + }, + { + "epoch": 0.58811486851166, + "grad_norm": 8.162039192517167, + "learning_rate": 2.1683444369862763e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.484375, + "logps/chosen": -924.0, + "logps/rejected": -1048.0, + "loss": 0.4094, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.875, + "step": 15800 + }, + { + "epoch": 0.5884870931119838, + "grad_norm": 7.6421627781876875, + "learning_rate": 2.165125029433012e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.4375, + "logps/chosen": -892.0, + "logps/rejected": -1048.0, + "loss": 0.3926, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.5625, + "rewards/rejected": -8.8125, + "step": 15810 + }, + { + "epoch": 0.5888593177123076, + "grad_norm": 7.16200998882505, + "learning_rate": 2.1619061872612892e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -968.0, + "logps/rejected": -1072.0, + "loss": 0.4116, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.140625, + "rewards/rejected": -8.8125, + "step": 15820 + }, + { + "epoch": 0.5892315423126314, + "grad_norm": 6.682682170075334, + "learning_rate": 2.158687915905597e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.8125, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3794, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.1875, + "step": 15830 + }, + { + "epoch": 0.5896037669129552, + "grad_norm": 6.103265004810518, + "learning_rate": 2.155470220799459e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3948, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.796875, + "rewards/rejected": -9.3125, + "step": 15840 + }, + { + "epoch": 0.5899759915132791, + "grad_norm": 6.787959679810598, + "learning_rate": 2.152253107375427e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.392, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.1875, + "step": 15850 + }, + { + "epoch": 0.590348216113603, + "grad_norm": 7.662170829705447, + "learning_rate": 2.1490365810650686e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -988.0, + "logps/rejected": -1144.0, + "loss": 0.4011, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.5625, + "step": 15860 + }, + { + "epoch": 0.5907204407139268, + "grad_norm": 8.643648774693663, + "learning_rate": 2.1458206472989626e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.8125, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3715, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.125, + "step": 15870 + }, + { + "epoch": 0.5910926653142506, + "grad_norm": 7.684880758132232, + "learning_rate": 2.1426053115066875e-07, + "logits/chosen": -3.59375, + "logits/rejected": -3.453125, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.3974, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.0625, + "step": 15880 + }, + { + "epoch": 0.5914648899145745, + "grad_norm": 6.311889668620401, + "learning_rate": 2.1393905791168093e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.515625, + "logps/chosen": -872.0, + "logps/rejected": -1040.0, + "loss": 0.3725, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.09375, + "rewards/margins": 1.8046875, + "rewards/rejected": -8.875, + "step": 15890 + }, + { + "epoch": 0.5918371145148983, + "grad_norm": 8.174318519439355, + "learning_rate": 2.136176455556879e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.8125, + "logps/chosen": -912.0, + "logps/rejected": -1072.0, + "loss": 0.3781, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.9375, + "step": 15900 + }, + { + "epoch": 0.5922093391152221, + "grad_norm": 6.92945233582831, + "learning_rate": 2.132962946253416e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.546875, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3794, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 1.609375, + "rewards/rejected": -8.9375, + "step": 15910 + }, + { + "epoch": 0.5925815637155459, + "grad_norm": 7.956568704007788, + "learning_rate": 2.129750056631906e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -968.0, + "logps/rejected": -1104.0, + "loss": 0.4064, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.25, + "step": 15920 + }, + { + "epoch": 0.5929537883158698, + "grad_norm": 8.700208878841817, + "learning_rate": 2.1265377921167855e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -904.0, + "logps/rejected": -1048.0, + "loss": 0.3848, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.25, + "rewards/margins": 1.6015625, + "rewards/rejected": -8.875, + "step": 15930 + }, + { + "epoch": 0.5933260129161936, + "grad_norm": 8.978247581311013, + "learning_rate": 2.1233261581314385e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3872, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.125, + "step": 15940 + }, + { + "epoch": 0.5936982375165175, + "grad_norm": 7.797462512248357, + "learning_rate": 2.1201151600981814e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.5625, + "logps/chosen": -904.0, + "logps/rejected": -1104.0, + "loss": 0.4014, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.3125, + "rewards/margins": 2.0, + "rewards/rejected": -9.3125, + "step": 15950 + }, + { + "epoch": 0.5940704621168413, + "grad_norm": 7.34329261558189, + "learning_rate": 2.1169048034382598e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.8125, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3869, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.4921875, + "rewards/rejected": -9.0625, + "step": 15960 + }, + { + "epoch": 0.5944426867171652, + "grad_norm": 6.38463139428593, + "learning_rate": 2.1136950935718348e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.515625, + "logps/chosen": -952.0, + "logps/rejected": -1080.0, + "loss": 0.4208, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.59375, + "rewards/margins": 1.4375, + "rewards/rejected": -9.0, + "step": 15970 + }, + { + "epoch": 0.594814911317489, + "grad_norm": 7.840263810341536, + "learning_rate": 2.1104860359179756e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.484375, + "logps/chosen": -920.0, + "logps/rejected": -1112.0, + "loss": 0.3789, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.5, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.3125, + "step": 15980 + }, + { + "epoch": 0.5951871359178128, + "grad_norm": 8.705456464119012, + "learning_rate": 2.1072776358946507e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3559, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.4375, + "rewards/margins": 1.796875, + "rewards/rejected": -9.25, + "step": 15990 + }, + { + "epoch": 0.5955593605181366, + "grad_norm": 8.859386379883384, + "learning_rate": 2.1040698989187175e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.3624, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.796875, + "rewards/rejected": -9.4375, + "step": 16000 + }, + { + "epoch": 0.5959315851184604, + "grad_norm": 7.777288166956703, + "learning_rate": 2.1008628304059155e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -912.0, + "logps/rejected": -1072.0, + "loss": 0.3887, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.0, + "step": 16010 + }, + { + "epoch": 0.5963038097187843, + "grad_norm": 8.152633141943644, + "learning_rate": 2.0976564357708538e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3965, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.9765625, + "rewards/rejected": -9.625, + "step": 16020 + }, + { + "epoch": 0.5966760343191081, + "grad_norm": 6.468339881267823, + "learning_rate": 2.0944507204270044e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -928.0, + "logps/rejected": -1096.0, + "loss": 0.3752, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.84375, + "rewards/rejected": -9.3125, + "step": 16030 + }, + { + "epoch": 0.597048258919432, + "grad_norm": 6.389721872724469, + "learning_rate": 2.0912456897866942e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.609375, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.4078, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.53125, + "rewards/rejected": -8.9375, + "step": 16040 + }, + { + "epoch": 0.5974204835197559, + "grad_norm": 6.554518358563945, + "learning_rate": 2.0880413492610904e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.546875, + "logps/chosen": -888.0, + "logps/rejected": -1056.0, + "loss": 0.4, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.03125, + "rewards/margins": 1.7578125, + "rewards/rejected": -8.8125, + "step": 16050 + }, + { + "epoch": 0.5977927081200797, + "grad_norm": 7.334320750511469, + "learning_rate": 2.0848377042601992e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.5625, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.404, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.34375, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.25, + "step": 16060 + }, + { + "epoch": 0.5981649327204035, + "grad_norm": 6.809948281349834, + "learning_rate": 2.081634760192849e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.4134, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.0625, + "step": 16070 + }, + { + "epoch": 0.5985371573207273, + "grad_norm": 7.651604450945221, + "learning_rate": 2.078432522466687e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -964.0, + "logps/rejected": -1088.0, + "loss": 0.3862, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.4453125, + "rewards/rejected": -9.125, + "step": 16080 + }, + { + "epoch": 0.5989093819210511, + "grad_norm": 8.115473304646807, + "learning_rate": 2.0752309964881664e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.4097, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.40625, + "rewards/margins": 1.703125, + "rewards/rejected": -9.125, + "step": 16090 + }, + { + "epoch": 0.599281606521375, + "grad_norm": 7.373492099339753, + "learning_rate": 2.0720301876625416e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -932.0, + "logps/rejected": -1056.0, + "loss": 0.4099, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5, + "rewards/margins": 1.625, + "rewards/rejected": -9.125, + "step": 16100 + }, + { + "epoch": 0.5996538311216988, + "grad_norm": 7.847577344929947, + "learning_rate": 2.0688301013938504e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.3835, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.59375, + "rewards/rejected": -9.375, + "step": 16110 + }, + { + "epoch": 0.6000260557220227, + "grad_norm": 6.3562299864089296, + "learning_rate": 2.065630743084917e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.4026, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.15625, + "rewards/margins": 1.7734375, + "rewards/rejected": -8.9375, + "step": 16120 + }, + { + "epoch": 0.6003982803223465, + "grad_norm": 7.527581839044944, + "learning_rate": 2.062432118137334e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -908.0, + "logps/rejected": -1056.0, + "loss": 0.3901, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.5625, + "rewards/rejected": -8.8125, + "step": 16130 + }, + { + "epoch": 0.6007705049226704, + "grad_norm": 6.897446926296911, + "learning_rate": 2.0592342319514547e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.3846, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.21875, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.9375, + "step": 16140 + }, + { + "epoch": 0.6011427295229942, + "grad_norm": 7.600174905122629, + "learning_rate": 2.0560370899263867e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -932.0, + "logps/rejected": -1080.0, + "loss": 0.3922, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.0, + "step": 16150 + }, + { + "epoch": 0.601514954123318, + "grad_norm": 6.95946998251373, + "learning_rate": 2.0528406974599808e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.796875, + "logps/chosen": -952.0, + "logps/rejected": -1072.0, + "loss": 0.4013, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.515625, + "rewards/rejected": -9.0, + "step": 16160 + }, + { + "epoch": 0.6018871787236418, + "grad_norm": 7.364649281275915, + "learning_rate": 2.0496450599488224e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.71875, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3792, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.640625, + "rewards/rejected": -9.375, + "step": 16170 + }, + { + "epoch": 0.6022594033239657, + "grad_norm": 8.766916912792944, + "learning_rate": 2.0464501827882202e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.640625, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3934, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.34375, + "rewards/rejected": -8.875, + "step": 16180 + }, + { + "epoch": 0.6026316279242895, + "grad_norm": 7.300740515082562, + "learning_rate": 2.0432560713722043e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.4027, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.25, + "step": 16190 + }, + { + "epoch": 0.6030038525246133, + "grad_norm": 7.443948679078861, + "learning_rate": 2.040062731093505e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -944.0, + "logps/rejected": -1072.0, + "loss": 0.3913, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.4375, + "rewards/rejected": -8.9375, + "step": 16200 + }, + { + "epoch": 0.6033760771249372, + "grad_norm": 8.699199509356124, + "learning_rate": 2.0368701673435567e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.5625, + "logps/chosen": -900.0, + "logps/rejected": -1056.0, + "loss": 0.3694, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.5625, + "rewards/rejected": -8.6875, + "step": 16210 + }, + { + "epoch": 0.6037483017252611, + "grad_norm": 6.645957156117027, + "learning_rate": 2.0336783855124806e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.703125, + "logps/chosen": -920.0, + "logps/rejected": -1064.0, + "loss": 0.3836, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.5625, + "rewards/rejected": -8.9375, + "step": 16220 + }, + { + "epoch": 0.6041205263255849, + "grad_norm": 8.433118470831792, + "learning_rate": 2.0304873909890763e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -928.0, + "logps/rejected": -1056.0, + "loss": 0.3947, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.9375, + "step": 16230 + }, + { + "epoch": 0.6044927509259087, + "grad_norm": 7.555559984656153, + "learning_rate": 2.027297189160817e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -920.0, + "logps/rejected": -1104.0, + "loss": 0.3925, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.1875, + "step": 16240 + }, + { + "epoch": 0.6048649755262325, + "grad_norm": 6.095879613409558, + "learning_rate": 2.0241077854138337e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.46875, + "logps/chosen": -932.0, + "logps/rejected": -1112.0, + "loss": 0.3806, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.375, + "step": 16250 + }, + { + "epoch": 0.6052372001265564, + "grad_norm": 7.878540103921838, + "learning_rate": 2.0209191851329149e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -908.0, + "logps/rejected": -1080.0, + "loss": 0.396, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.25, + "step": 16260 + }, + { + "epoch": 0.6056094247268802, + "grad_norm": 5.798139759595799, + "learning_rate": 2.0177313937014873e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.546875, + "logps/chosen": -928.0, + "logps/rejected": -1064.0, + "loss": 0.3849, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.640625, + "rewards/rejected": -9.125, + "step": 16270 + }, + { + "epoch": 0.605981649327204, + "grad_norm": 7.411121657220518, + "learning_rate": 2.0145444165016164e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.765625, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.3992, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.3125, + "step": 16280 + }, + { + "epoch": 0.6063538739275278, + "grad_norm": 5.714861430463715, + "learning_rate": 2.0113582589139917e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.703125, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3886, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.21875, + "rewards/margins": 1.8125, + "rewards/rejected": -9.0, + "step": 16290 + }, + { + "epoch": 0.6067260985278518, + "grad_norm": 8.087727372755937, + "learning_rate": 2.0081729263179165e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.515625, + "logps/chosen": -880.0, + "logps/rejected": -1040.0, + "loss": 0.37, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.09375, + "rewards/margins": 1.6953125, + "rewards/rejected": -8.75, + "step": 16300 + }, + { + "epoch": 0.6070983231281756, + "grad_norm": 7.717400431321285, + "learning_rate": 2.0049884240913056e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.578125, + "logps/chosen": -928.0, + "logps/rejected": -1048.0, + "loss": 0.3928, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.46875, + "rewards/margins": 1.5, + "rewards/rejected": -8.9375, + "step": 16310 + }, + { + "epoch": 0.6074705477284994, + "grad_norm": 6.753239562175732, + "learning_rate": 2.0018047576106666e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.890625, + "logps/chosen": -920.0, + "logps/rejected": -1064.0, + "loss": 0.3794, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.609375, + "rewards/rejected": -8.9375, + "step": 16320 + }, + { + "epoch": 0.6078427723288232, + "grad_norm": 8.86975180417233, + "learning_rate": 1.998621932251102e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -956.0, + "logps/rejected": -1080.0, + "loss": 0.3727, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.1875, + "step": 16330 + }, + { + "epoch": 0.608214996929147, + "grad_norm": 6.830905036985514, + "learning_rate": 1.9954399533862883e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -904.0, + "logps/rejected": -1072.0, + "loss": 0.4058, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.65625, + "rewards/rejected": -9.0, + "step": 16340 + }, + { + "epoch": 0.6085872215294709, + "grad_norm": 7.999803025256423, + "learning_rate": 1.9922588263884785e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.640625, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3872, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.515625, + "rewards/rejected": -9.0625, + "step": 16350 + }, + { + "epoch": 0.6089594461297947, + "grad_norm": 6.672693148582262, + "learning_rate": 1.9890785566284817e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3704, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.125, + "step": 16360 + }, + { + "epoch": 0.6093316707301185, + "grad_norm": 9.747693435308475, + "learning_rate": 1.9858991494756635e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.671875, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.4002, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.25, + "step": 16370 + }, + { + "epoch": 0.6097038953304423, + "grad_norm": 7.450654375216106, + "learning_rate": 1.9827206102979343e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.65625, + "logps/chosen": -980.0, + "logps/rejected": -1120.0, + "loss": 0.4026, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.90625, + "rewards/margins": 1.453125, + "rewards/rejected": -9.375, + "step": 16380 + }, + { + "epoch": 0.6100761199307663, + "grad_norm": 6.707662206668727, + "learning_rate": 1.9795429444617334e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.6875, + "logps/chosen": -936.0, + "logps/rejected": -1056.0, + "loss": 0.4181, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.46875, + "rewards/rejected": -8.875, + "step": 16390 + }, + { + "epoch": 0.6104483445310901, + "grad_norm": 6.849090535667424, + "learning_rate": 1.9763661573320322e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.4056, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.21875, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.9375, + "step": 16400 + }, + { + "epoch": 0.6108205691314139, + "grad_norm": 7.097289410037448, + "learning_rate": 1.9731902542723128e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -912.0, + "logps/rejected": -1040.0, + "loss": 0.425, + "rewards/accuracies": 0.6875, + "rewards/chosen": -7.375, + "rewards/margins": 1.2890625, + "rewards/rejected": -8.625, + "step": 16410 + }, + { + "epoch": 0.6111927937317377, + "grad_norm": 7.164980921628045, + "learning_rate": 1.9700152406445704e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.765625, + "logps/chosen": -908.0, + "logps/rejected": -1064.0, + "loss": 0.3785, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.0625, + "rewards/margins": 1.890625, + "rewards/rejected": -9.0, + "step": 16420 + }, + { + "epoch": 0.6115650183320616, + "grad_norm": 10.607248417429686, + "learning_rate": 1.9668411218092928e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.75, + "logps/chosen": -912.0, + "logps/rejected": -1040.0, + "loss": 0.3879, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.34375, + "rewards/margins": 1.4296875, + "rewards/rejected": -8.75, + "step": 16430 + }, + { + "epoch": 0.6119372429323854, + "grad_norm": 7.058264735219548, + "learning_rate": 1.963667903125461e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.484375, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.3946, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.7109375, + "rewards/rejected": -8.9375, + "step": 16440 + }, + { + "epoch": 0.6123094675327092, + "grad_norm": 7.606249554793642, + "learning_rate": 1.9604955899505346e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.546875, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.3912, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.25, + "rewards/margins": 1.59375, + "rewards/rejected": -8.8125, + "step": 16450 + }, + { + "epoch": 0.612681692133033, + "grad_norm": 6.488798563264654, + "learning_rate": 1.9573241876404445e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.59375, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3871, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.125, + "step": 16460 + }, + { + "epoch": 0.613053916733357, + "grad_norm": 6.921098132922328, + "learning_rate": 1.9541537015495864e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -896.0, + "logps/rejected": -1056.0, + "loss": 0.3809, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.0625, + "rewards/margins": 1.875, + "rewards/rejected": -8.9375, + "step": 16470 + }, + { + "epoch": 0.6134261413336808, + "grad_norm": 7.016973913971312, + "learning_rate": 1.9509841370308034e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.4053, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.25, + "rewards/margins": 1.71875, + "rewards/rejected": -8.9375, + "step": 16480 + }, + { + "epoch": 0.6137983659340046, + "grad_norm": 7.474945753351283, + "learning_rate": 1.9478154994353897e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3861, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.9375, + "step": 16490 + }, + { + "epoch": 0.6141705905343284, + "grad_norm": 9.08077530097975, + "learning_rate": 1.9446477941130677e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -908.0, + "logps/rejected": -1040.0, + "loss": 0.4091, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.125, + "rewards/margins": 1.4375, + "rewards/rejected": -8.5625, + "step": 16500 + }, + { + "epoch": 0.6145428151346523, + "grad_norm": 8.471951951496047, + "learning_rate": 1.9414810264119907e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.328125, + "logps/chosen": -912.0, + "logps/rejected": -1096.0, + "loss": 0.3945, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.859375, + "rewards/rejected": -9.25, + "step": 16510 + }, + { + "epoch": 0.6149150397349761, + "grad_norm": 7.57224979136791, + "learning_rate": 1.9383152016787266e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -908.0, + "logps/rejected": -1064.0, + "loss": 0.3817, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.9375, + "step": 16520 + }, + { + "epoch": 0.6152872643352999, + "grad_norm": 7.780286315551446, + "learning_rate": 1.935150325258253e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.703125, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.3791, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.0, + "step": 16530 + }, + { + "epoch": 0.6156594889356237, + "grad_norm": 7.555788581404402, + "learning_rate": 1.931986402493944e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -936.0, + "logps/rejected": -1080.0, + "loss": 0.3911, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.65625, + "rewards/rejected": -9.125, + "step": 16540 + }, + { + "epoch": 0.6160317135359475, + "grad_norm": 7.072823055415816, + "learning_rate": 1.9288234387275656e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.59375, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3923, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.125, + "step": 16550 + }, + { + "epoch": 0.6164039381362715, + "grad_norm": 7.912582250216763, + "learning_rate": 1.9256614392992647e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -880.0, + "logps/rejected": -1040.0, + "loss": 0.3859, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.796875, + "rewards/rejected": -8.875, + "step": 16560 + }, + { + "epoch": 0.6167761627365953, + "grad_norm": 6.80910213253247, + "learning_rate": 1.9225004095475587e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -908.0, + "logps/rejected": -1040.0, + "loss": 0.3948, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.28125, + "rewards/margins": 1.46875, + "rewards/rejected": -8.75, + "step": 16570 + }, + { + "epoch": 0.6171483873369191, + "grad_norm": 7.197189641819027, + "learning_rate": 1.9193403548093294e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.640625, + "logps/chosen": -916.0, + "logps/rejected": -1032.0, + "loss": 0.4108, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.625, + "step": 16580 + }, + { + "epoch": 0.617520611937243, + "grad_norm": 6.6152631148982275, + "learning_rate": 1.9161812804198107e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.5625, + "logps/chosen": -884.0, + "logps/rejected": -1040.0, + "loss": 0.3784, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -6.9375, + "rewards/margins": 1.8671875, + "rewards/rejected": -8.8125, + "step": 16590 + }, + { + "epoch": 0.6178928365375668, + "grad_norm": 8.37990925342298, + "learning_rate": 1.9130231917125833e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.578125, + "logps/chosen": -896.0, + "logps/rejected": -1048.0, + "loss": 0.3999, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -6.96875, + "rewards/margins": 1.78125, + "rewards/rejected": -8.75, + "step": 16600 + }, + { + "epoch": 0.6182650611378906, + "grad_norm": 8.423270588922644, + "learning_rate": 1.9098660940195618e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.578125, + "logps/chosen": -916.0, + "logps/rejected": -1048.0, + "loss": 0.3937, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.25, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.75, + "step": 16610 + }, + { + "epoch": 0.6186372857382144, + "grad_norm": 7.578165995037437, + "learning_rate": 1.906709992670989e-07, + "logits/chosen": -3.640625, + "logits/rejected": -3.40625, + "logps/chosen": -888.0, + "logps/rejected": -1048.0, + "loss": 0.4183, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.1875, + "rewards/margins": 1.6875, + "rewards/rejected": -8.875, + "step": 16620 + }, + { + "epoch": 0.6190095103385382, + "grad_norm": 7.534058017228509, + "learning_rate": 1.9035548929954257e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -936.0, + "logps/rejected": -1080.0, + "loss": 0.3881, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.609375, + "rewards/rejected": -9.0625, + "step": 16630 + }, + { + "epoch": 0.6193817349388621, + "grad_norm": 8.067499077365724, + "learning_rate": 1.9004008003197398e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.53125, + "logps/chosen": -924.0, + "logps/rejected": -1056.0, + "loss": 0.3962, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.515625, + "rewards/rejected": -8.9375, + "step": 16640 + }, + { + "epoch": 0.619753959539186, + "grad_norm": 5.6949080983987415, + "learning_rate": 1.8972477199691014e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -860.0, + "logps/rejected": -1008.0, + "loss": 0.3737, + "rewards/accuracies": 0.84375, + "rewards/chosen": -6.78125, + "rewards/margins": 1.640625, + "rewards/rejected": -8.4375, + "step": 16650 + }, + { + "epoch": 0.6201261841395098, + "grad_norm": 6.790203332343799, + "learning_rate": 1.8940956572669692e-07, + "logits/chosen": -3.5625, + "logits/rejected": -3.28125, + "logps/chosen": -904.0, + "logps/rejected": -1032.0, + "loss": 0.4069, + "rewards/accuracies": 0.71875, + "rewards/chosen": -7.40625, + "rewards/margins": 1.40625, + "rewards/rejected": -8.8125, + "step": 16660 + }, + { + "epoch": 0.6204984087398336, + "grad_norm": 6.266235398680496, + "learning_rate": 1.8909446175350856e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.71875, + "logps/chosen": -920.0, + "logps/rejected": -1040.0, + "loss": 0.3802, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.125, + "rewards/margins": 1.484375, + "rewards/rejected": -8.625, + "step": 16670 + }, + { + "epoch": 0.6208706333401575, + "grad_norm": 7.586969004582857, + "learning_rate": 1.887794606093465e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -920.0, + "logps/rejected": -1104.0, + "loss": 0.3792, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.765625, + "rewards/rejected": -9.1875, + "step": 16680 + }, + { + "epoch": 0.6212428579404813, + "grad_norm": 7.5379060512758285, + "learning_rate": 1.8846456282603856e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -916.0, + "logps/rejected": -1080.0, + "loss": 0.3848, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.0625, + "step": 16690 + }, + { + "epoch": 0.6216150825408051, + "grad_norm": 6.967033810745793, + "learning_rate": 1.8814976893523804e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.5625, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.3979, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.1875, + "step": 16700 + }, + { + "epoch": 0.6219873071411289, + "grad_norm": 7.8333742329763645, + "learning_rate": 1.8783507946842291e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.3843, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.28125, + "rewards/margins": 1.734375, + "rewards/rejected": -9.0625, + "step": 16710 + }, + { + "epoch": 0.6223595317414528, + "grad_norm": 7.59450552809616, + "learning_rate": 1.8752049495689483e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.671875, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.4091, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.703125, + "rewards/rejected": -9.25, + "step": 16720 + }, + { + "epoch": 0.6227317563417766, + "grad_norm": 6.961657268445571, + "learning_rate": 1.872060159317782e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.484375, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3599, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.125, + "step": 16730 + }, + { + "epoch": 0.6231039809421005, + "grad_norm": 7.193756831220989, + "learning_rate": 1.8689164292401932e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.396, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.3125, + "step": 16740 + }, + { + "epoch": 0.6234762055424243, + "grad_norm": 9.481045375771625, + "learning_rate": 1.865773764643855e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -972.0, + "logps/rejected": -1096.0, + "loss": 0.4122, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.40625, + "rewards/rejected": -9.125, + "step": 16750 + }, + { + "epoch": 0.6238484301427482, + "grad_norm": 6.718897354921702, + "learning_rate": 1.8626321708346432e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.546875, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.3783, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.1875, + "step": 16760 + }, + { + "epoch": 0.624220654743072, + "grad_norm": 7.191869417400532, + "learning_rate": 1.8594916531166226e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.71875, + "logps/chosen": -968.0, + "logps/rejected": -1088.0, + "loss": 0.406, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.4921875, + "rewards/rejected": -9.1875, + "step": 16770 + }, + { + "epoch": 0.6245928793433958, + "grad_norm": 8.555159523485905, + "learning_rate": 1.8563522167920445e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.640625, + "logps/chosen": -904.0, + "logps/rejected": -1088.0, + "loss": 0.3751, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.3125, + "rewards/margins": 2.046875, + "rewards/rejected": -9.3125, + "step": 16780 + }, + { + "epoch": 0.6249651039437196, + "grad_norm": 8.38897969973936, + "learning_rate": 1.853213867161332e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3832, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.625, + "step": 16790 + }, + { + "epoch": 0.6253373285440434, + "grad_norm": 7.544195224554637, + "learning_rate": 1.8500766095230746e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.703125, + "logps/chosen": -888.0, + "logps/rejected": -1072.0, + "loss": 0.3875, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.09375, + "rewards/margins": 1.859375, + "rewards/rejected": -8.9375, + "step": 16800 + }, + { + "epoch": 0.6257095531443673, + "grad_norm": 6.844031086278621, + "learning_rate": 1.8469404491740193e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -920.0, + "logps/rejected": -1056.0, + "loss": 0.3935, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 1.5078125, + "rewards/rejected": -9.0, + "step": 16810 + }, + { + "epoch": 0.6260817777446911, + "grad_norm": 5.922638075299952, + "learning_rate": 1.8438053914090574e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.578125, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3943, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.125, + "step": 16820 + }, + { + "epoch": 0.626454002345015, + "grad_norm": 7.297419400103341, + "learning_rate": 1.8406714415212216e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -924.0, + "logps/rejected": -1056.0, + "loss": 0.3939, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.5546875, + "rewards/rejected": -8.9375, + "step": 16830 + }, + { + "epoch": 0.6268262269453388, + "grad_norm": 7.219009747734024, + "learning_rate": 1.8375386048016722e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -920.0, + "logps/rejected": -1056.0, + "loss": 0.3795, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.0625, + "step": 16840 + }, + { + "epoch": 0.6271984515456627, + "grad_norm": 6.447556405237432, + "learning_rate": 1.8344068865396922e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3657, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.1875, + "step": 16850 + }, + { + "epoch": 0.6275706761459865, + "grad_norm": 7.309133018586995, + "learning_rate": 1.8312762920226731e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.578125, + "logps/chosen": -928.0, + "logps/rejected": -1056.0, + "loss": 0.3914, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.578125, + "rewards/rejected": -9.0625, + "step": 16860 + }, + { + "epoch": 0.6279429007463103, + "grad_norm": 7.683641854183945, + "learning_rate": 1.8281468265361125e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.4082, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.703125, + "rewards/rejected": -9.25, + "step": 16870 + }, + { + "epoch": 0.6283151253466341, + "grad_norm": 8.467173980039464, + "learning_rate": 1.8250184953636e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -924.0, + "logps/rejected": -1088.0, + "loss": 0.4156, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.0625, + "step": 16880 + }, + { + "epoch": 0.628687349946958, + "grad_norm": 7.475191852154221, + "learning_rate": 1.8218913037868102e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.3771, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.1875, + "step": 16890 + }, + { + "epoch": 0.6290595745472818, + "grad_norm": 8.476717398121197, + "learning_rate": 1.8187652570854945e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3827, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.0, + "step": 16900 + }, + { + "epoch": 0.6294317991476057, + "grad_norm": 6.682119699895684, + "learning_rate": 1.81564036053747e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.375, + "logps/chosen": -892.0, + "logps/rejected": -1056.0, + "loss": 0.4016, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.0625, + "rewards/margins": 1.8828125, + "rewards/rejected": -8.9375, + "step": 16910 + }, + { + "epoch": 0.6298040237479295, + "grad_norm": 11.239610674818202, + "learning_rate": 1.812516619418613e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.609375, + "logps/chosen": -896.0, + "logps/rejected": -1024.0, + "loss": 0.3986, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.21875, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.6875, + "step": 16920 + }, + { + "epoch": 0.6301762483482534, + "grad_norm": 6.773760322516131, + "learning_rate": 1.8093940390028483e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3974, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.3125, + "rewards/margins": 1.6328125, + "rewards/rejected": -8.9375, + "step": 16930 + }, + { + "epoch": 0.6305484729485772, + "grad_norm": 6.599877635887675, + "learning_rate": 1.806272624562143e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.703125, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.382, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.609375, + "rewards/rejected": -9.125, + "step": 16940 + }, + { + "epoch": 0.630920697548901, + "grad_norm": 6.769584656269559, + "learning_rate": 1.8031523813664923e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -944.0, + "logps/rejected": -1080.0, + "loss": 0.3681, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.59375, + "rewards/margins": 1.671875, + "rewards/rejected": -9.25, + "step": 16950 + }, + { + "epoch": 0.6312929221492248, + "grad_norm": 7.4382151068844715, + "learning_rate": 1.800033314683917e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -984.0, + "logps/rejected": -1136.0, + "loss": 0.4043, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.6875, + "rewards/rejected": -9.4375, + "step": 16960 + }, + { + "epoch": 0.6316651467495487, + "grad_norm": 8.812071855086787, + "learning_rate": 1.7969154297804507e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.59375, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.4049, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.4375, + "step": 16970 + }, + { + "epoch": 0.6320373713498725, + "grad_norm": 8.430906129049367, + "learning_rate": 1.7937987319201297e-07, + "logits/chosen": -3.640625, + "logits/rejected": -3.5, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3797, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.1875, + "step": 16980 + }, + { + "epoch": 0.6324095959501963, + "grad_norm": 6.922624378984371, + "learning_rate": 1.79068322636499e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.53125, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3972, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.34375, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.1875, + "step": 16990 + }, + { + "epoch": 0.6327818205505202, + "grad_norm": 7.315176404869083, + "learning_rate": 1.7875689183750504e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -908.0, + "logps/rejected": -1040.0, + "loss": 0.3923, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.5234375, + "rewards/rejected": -8.75, + "step": 17000 + }, + { + "epoch": 0.6331540451508441, + "grad_norm": 7.831448422759494, + "learning_rate": 1.7844558132083117e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -872.0, + "logps/rejected": -1004.0, + "loss": 0.3979, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -6.96875, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.5, + "step": 17010 + }, + { + "epoch": 0.6335262697511679, + "grad_norm": 7.276248494068267, + "learning_rate": 1.7813439161207412e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.515625, + "logps/chosen": -888.0, + "logps/rejected": -1040.0, + "loss": 0.3865, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.0625, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.75, + "step": 17020 + }, + { + "epoch": 0.6338984943514917, + "grad_norm": 6.901648329104485, + "learning_rate": 1.778233232366268e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -900.0, + "logps/rejected": -1032.0, + "loss": 0.3805, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.25, + "rewards/margins": 1.515625, + "rewards/rejected": -8.75, + "step": 17030 + }, + { + "epoch": 0.6342707189518155, + "grad_norm": 6.689179476129809, + "learning_rate": 1.7751237671967707e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.5, + "logps/chosen": -888.0, + "logps/rejected": -1048.0, + "loss": 0.3791, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.0625, + "rewards/margins": 1.875, + "rewards/rejected": -8.9375, + "step": 17040 + }, + { + "epoch": 0.6346429435521393, + "grad_norm": 7.776488407338435, + "learning_rate": 1.772015525862073e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.59375, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.3902, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.5, + "rewards/rejected": -8.75, + "step": 17050 + }, + { + "epoch": 0.6350151681524632, + "grad_norm": 8.180322086778977, + "learning_rate": 1.7689085136099325e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.578125, + "logps/chosen": -896.0, + "logps/rejected": -1072.0, + "loss": 0.3603, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.71875, + "rewards/rejected": -9.0625, + "step": 17060 + }, + { + "epoch": 0.635387392752787, + "grad_norm": 7.529364605071619, + "learning_rate": 1.7658027356860284e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3878, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8125, + "rewards/rejected": -9.25, + "step": 17070 + }, + { + "epoch": 0.6357596173531108, + "grad_norm": 9.806825166930818, + "learning_rate": 1.7626981973339597e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.71875, + "logps/chosen": -912.0, + "logps/rejected": -1040.0, + "loss": 0.4092, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.34375, + "rewards/margins": 1.59375, + "rewards/rejected": -8.9375, + "step": 17080 + }, + { + "epoch": 0.6361318419534348, + "grad_norm": 6.888230127652128, + "learning_rate": 1.7595949037952298e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.734375, + "logps/chosen": -920.0, + "logps/rejected": -1080.0, + "loss": 0.382, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.1875, + "step": 17090 + }, + { + "epoch": 0.6365040665537586, + "grad_norm": 7.819578502928127, + "learning_rate": 1.7564928603092432e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.640625, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3926, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.125, + "step": 17100 + }, + { + "epoch": 0.6368762911540824, + "grad_norm": 7.094530049310864, + "learning_rate": 1.7533920721132894e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -904.0, + "logps/rejected": -1096.0, + "loss": 0.3704, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.34375, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.25, + "step": 17110 + }, + { + "epoch": 0.6372485157544062, + "grad_norm": 7.453399575901283, + "learning_rate": 1.7502925444425448e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.546875, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.3953, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 1.578125, + "rewards/rejected": -9.0625, + "step": 17120 + }, + { + "epoch": 0.63762074035473, + "grad_norm": 8.111920833743985, + "learning_rate": 1.7471942825300512e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.546875, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.3903, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.3125, + "step": 17130 + }, + { + "epoch": 0.6379929649550539, + "grad_norm": 7.875967563280191, + "learning_rate": 1.744097291606718e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.3624, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.15625, + "rewards/margins": 1.7578125, + "rewards/rejected": -8.9375, + "step": 17140 + }, + { + "epoch": 0.6383651895553777, + "grad_norm": 8.12658999845993, + "learning_rate": 1.741001576901308e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.348, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.3125, + "step": 17150 + }, + { + "epoch": 0.6387374141557015, + "grad_norm": 7.253558899944683, + "learning_rate": 1.7379071436404268e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.5625, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3765, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.4375, + "step": 17160 + }, + { + "epoch": 0.6391096387560253, + "grad_norm": 10.57276392005003, + "learning_rate": 1.73481399704852e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.796875, + "logps/chosen": -936.0, + "logps/rejected": -1120.0, + "loss": 0.4108, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.59375, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.4375, + "step": 17170 + }, + { + "epoch": 0.6394818633563493, + "grad_norm": 7.785937303751153, + "learning_rate": 1.7317221423478556e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3977, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.125, + "step": 17180 + }, + { + "epoch": 0.6398540879566731, + "grad_norm": 8.93550874607475, + "learning_rate": 1.728631584758528e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.53125, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.3935, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.75, + "rewards/rejected": -9.4375, + "step": 17190 + }, + { + "epoch": 0.6402263125569969, + "grad_norm": 8.802223218889527, + "learning_rate": 1.7255423294984342e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -944.0, + "logps/rejected": -1072.0, + "loss": 0.3854, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.125, + "step": 17200 + }, + { + "epoch": 0.6405985371573207, + "grad_norm": 6.611364438479658, + "learning_rate": 1.7224543817832777e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3945, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.84375, + "rewards/rejected": -9.375, + "step": 17210 + }, + { + "epoch": 0.6409707617576446, + "grad_norm": 7.930572194678817, + "learning_rate": 1.719367746826553e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.640625, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3788, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.640625, + "rewards/rejected": -9.1875, + "step": 17220 + }, + { + "epoch": 0.6413429863579684, + "grad_norm": 7.249459984033662, + "learning_rate": 1.716282429839535e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.359375, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3953, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.3125, + "step": 17230 + }, + { + "epoch": 0.6417152109582922, + "grad_norm": 6.8023943374575415, + "learning_rate": 1.7131984360312795e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.640625, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3716, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.34375, + "rewards/margins": 1.546875, + "rewards/rejected": -8.875, + "step": 17240 + }, + { + "epoch": 0.642087435558616, + "grad_norm": 6.790902517611173, + "learning_rate": 1.7101157706086016e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.5625, + "logps/chosen": -908.0, + "logps/rejected": -1072.0, + "loss": 0.3742, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.375, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.25, + "step": 17250 + }, + { + "epoch": 0.6424596601589398, + "grad_norm": 7.210927167164257, + "learning_rate": 1.70703443877608e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.671875, + "logps/chosen": -896.0, + "logps/rejected": -1056.0, + "loss": 0.4179, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.1875, + "rewards/margins": 1.71875, + "rewards/rejected": -8.9375, + "step": 17260 + }, + { + "epoch": 0.6428318847592638, + "grad_norm": 6.577817095219949, + "learning_rate": 1.703954445736036e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.59375, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.383, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.125, + "step": 17270 + }, + { + "epoch": 0.6432041093595876, + "grad_norm": 7.623599785087364, + "learning_rate": 1.7008757966885368e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -928.0, + "logps/rejected": -1112.0, + "loss": 0.3864, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.3125, + "rewards/margins": 2.015625, + "rewards/rejected": -9.375, + "step": 17280 + }, + { + "epoch": 0.6435763339599114, + "grad_norm": 7.739876539936512, + "learning_rate": 1.6977984968313735e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -924.0, + "logps/rejected": -1112.0, + "loss": 0.3624, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.375, + "step": 17290 + }, + { + "epoch": 0.6439485585602353, + "grad_norm": 7.545119025178648, + "learning_rate": 1.6947225513600646e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.484375, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.387, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.25, + "step": 17300 + }, + { + "epoch": 0.6443207831605591, + "grad_norm": 15.76490575993181, + "learning_rate": 1.6916479654678417e-07, + "logits/chosen": -4.03125, + "logits/rejected": -3.65625, + "logps/chosen": -916.0, + "logps/rejected": -1088.0, + "loss": 0.378, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.796875, + "rewards/rejected": -9.1875, + "step": 17310 + }, + { + "epoch": 0.6446930077608829, + "grad_norm": 5.737841525428915, + "learning_rate": 1.6885747443456362e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.5, + "logps/chosen": -920.0, + "logps/rejected": -1064.0, + "loss": 0.3694, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.28125, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.0, + "step": 17320 + }, + { + "epoch": 0.6450652323612067, + "grad_norm": 7.138613269156902, + "learning_rate": 1.6855028931820826e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -936.0, + "logps/rejected": -1112.0, + "loss": 0.3506, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.9375, + "rewards/rejected": -9.375, + "step": 17330 + }, + { + "epoch": 0.6454374569615305, + "grad_norm": 7.042094122105951, + "learning_rate": 1.6824324171634946e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.5, + "logps/chosen": -948.0, + "logps/rejected": -1136.0, + "loss": 0.3797, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 2.015625, + "rewards/rejected": -9.5625, + "step": 17340 + }, + { + "epoch": 0.6458096815618545, + "grad_norm": 6.778785421852726, + "learning_rate": 1.679363321473871e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -944.0, + "logps/rejected": -1136.0, + "loss": 0.3949, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.859375, + "rewards/rejected": -9.4375, + "step": 17350 + }, + { + "epoch": 0.6461819061621783, + "grad_norm": 9.533871060843625, + "learning_rate": 1.6762956112948756e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -952.0, + "logps/rejected": -1088.0, + "loss": 0.4092, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.734375, + "rewards/rejected": -9.4375, + "step": 17360 + }, + { + "epoch": 0.6465541307625021, + "grad_norm": 6.985718230366509, + "learning_rate": 1.6732292918058356e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.546875, + "logps/chosen": -936.0, + "logps/rejected": -1112.0, + "loss": 0.3866, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.4375, + "step": 17370 + }, + { + "epoch": 0.6469263553628259, + "grad_norm": 7.270240359276295, + "learning_rate": 1.670164368183728e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.671875, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3665, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.375, + "step": 17380 + }, + { + "epoch": 0.6472985799631498, + "grad_norm": 5.791812381802103, + "learning_rate": 1.6671008456031746e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.484375, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3793, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.25, + "step": 17390 + }, + { + "epoch": 0.6476708045634736, + "grad_norm": 6.409672710425608, + "learning_rate": 1.6640387292364337e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.625, + "logps/chosen": -936.0, + "logps/rejected": -1056.0, + "loss": 0.4021, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5, + "rewards/margins": 1.484375, + "rewards/rejected": -9.0, + "step": 17400 + }, + { + "epoch": 0.6480430291637974, + "grad_norm": 7.101222239341493, + "learning_rate": 1.6609780242533845e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.5625, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.3612, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.859375, + "rewards/rejected": -9.25, + "step": 17410 + }, + { + "epoch": 0.6484152537641212, + "grad_norm": 7.233978746984645, + "learning_rate": 1.657918735821528e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3871, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.3125, + "step": 17420 + }, + { + "epoch": 0.6487874783644451, + "grad_norm": 6.618369731241595, + "learning_rate": 1.6548608691059702e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.65625, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.4114, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.71875, + "rewards/margins": 1.8125, + "rewards/rejected": -9.5625, + "step": 17430 + }, + { + "epoch": 0.649159702964769, + "grad_norm": 7.384625456220775, + "learning_rate": 1.6518044292694192e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.75, + "logps/chosen": -972.0, + "logps/rejected": -1112.0, + "loss": 0.3811, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.90625, + "rewards/margins": 1.421875, + "rewards/rejected": -9.3125, + "step": 17440 + }, + { + "epoch": 0.6495319275650928, + "grad_norm": 7.460711541105908, + "learning_rate": 1.6487494214721726e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.6875, + "logps/chosen": -956.0, + "logps/rejected": -1136.0, + "loss": 0.3998, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.625, + "step": 17450 + }, + { + "epoch": 0.6499041521654166, + "grad_norm": 7.352805287405187, + "learning_rate": 1.6456958508721102e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.546875, + "logps/chosen": -928.0, + "logps/rejected": -1112.0, + "loss": 0.3722, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.4375, + "rewards/margins": 2.03125, + "rewards/rejected": -9.5, + "step": 17460 + }, + { + "epoch": 0.6502763767657405, + "grad_norm": 8.45893085829002, + "learning_rate": 1.6426437226246885e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.65625, + "logps/chosen": -928.0, + "logps/rejected": -1128.0, + "loss": 0.395, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 2.125, + "rewards/rejected": -9.5625, + "step": 17470 + }, + { + "epoch": 0.6506486013660643, + "grad_norm": 9.353184086507241, + "learning_rate": 1.6395930418829228e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.546875, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3878, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.75, + "rewards/rejected": -9.375, + "step": 17480 + }, + { + "epoch": 0.6510208259663881, + "grad_norm": 7.877546649224869, + "learning_rate": 1.63654381379739e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.65625, + "logps/chosen": -928.0, + "logps/rejected": -1096.0, + "loss": 0.3856, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.3125, + "step": 17490 + }, + { + "epoch": 0.6513930505667119, + "grad_norm": 7.711441193139582, + "learning_rate": 1.6334960435162112e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.71875, + "logps/chosen": -932.0, + "logps/rejected": -1104.0, + "loss": 0.3758, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.375, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.3125, + "step": 17500 + }, + { + "epoch": 0.6517652751670358, + "grad_norm": 7.451389704977642, + "learning_rate": 1.6304497361850483e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.46875, + "logps/chosen": -916.0, + "logps/rejected": -1104.0, + "loss": 0.3676, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 2.078125, + "rewards/rejected": -9.5, + "step": 17510 + }, + { + "epoch": 0.6521374997673596, + "grad_norm": 8.4681784783912, + "learning_rate": 1.6274048969470912e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -908.0, + "logps/rejected": -1080.0, + "loss": 0.3721, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.28125, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.25, + "step": 17520 + }, + { + "epoch": 0.6525097243676835, + "grad_norm": 7.6496524926552025, + "learning_rate": 1.6243615309430535e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.5625, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.386, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.375, + "rewards/margins": 1.859375, + "rewards/rejected": -9.25, + "step": 17530 + }, + { + "epoch": 0.6528819489680073, + "grad_norm": 7.795735270367461, + "learning_rate": 1.621319643311159e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.703125, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.3885, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.90625, + "rewards/margins": 1.59375, + "rewards/rejected": -9.5, + "step": 17540 + }, + { + "epoch": 0.6532541735683312, + "grad_norm": 7.278415624883429, + "learning_rate": 1.618279239187138e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -956.0, + "logps/rejected": -1080.0, + "loss": 0.3956, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.625, + "rewards/rejected": -9.125, + "step": 17550 + }, + { + "epoch": 0.653626398168655, + "grad_norm": 6.796088150519844, + "learning_rate": 1.6152403237042145e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.296875, + "logps/chosen": -888.0, + "logps/rejected": -1040.0, + "loss": 0.403, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.8125, + "step": 17560 + }, + { + "epoch": 0.6539986227689788, + "grad_norm": 7.715408966225244, + "learning_rate": 1.6122029019930987e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.578125, + "logps/chosen": -908.0, + "logps/rejected": -1088.0, + "loss": 0.3736, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.3125, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.25, + "step": 17570 + }, + { + "epoch": 0.6543708473693026, + "grad_norm": 7.143515343647237, + "learning_rate": 1.609166979181981e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.796875, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.3942, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.1875, + "step": 17580 + }, + { + "epoch": 0.6547430719696264, + "grad_norm": 8.416179909096329, + "learning_rate": 1.6061325603965193e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.75, + "logps/chosen": -952.0, + "logps/rejected": -1088.0, + "loss": 0.3759, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.28125, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.0, + "step": 17590 + }, + { + "epoch": 0.6551152965699503, + "grad_norm": 6.9707672038639314, + "learning_rate": 1.6030996507598327e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.5625, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3784, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.9375, + "step": 17600 + }, + { + "epoch": 0.6554875211702741, + "grad_norm": 8.611599387947996, + "learning_rate": 1.6000682553924922e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.703125, + "logps/chosen": -932.0, + "logps/rejected": -1048.0, + "loss": 0.3939, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.421875, + "rewards/rejected": -8.9375, + "step": 17610 + }, + { + "epoch": 0.655859745770598, + "grad_norm": 8.46781737314284, + "learning_rate": 1.5970383794125128e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3865, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.3125, + "step": 17620 + }, + { + "epoch": 0.6562319703709218, + "grad_norm": 6.357379130731856, + "learning_rate": 1.5940100279353434e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.546875, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.369, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.59375, + "rewards/rejected": -9.25, + "step": 17630 + }, + { + "epoch": 0.6566041949712457, + "grad_norm": 7.81546262031526, + "learning_rate": 1.5909832060738592e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.75, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.4057, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.609375, + "rewards/rejected": -9.125, + "step": 17640 + }, + { + "epoch": 0.6569764195715695, + "grad_norm": 7.9725094738272695, + "learning_rate": 1.5879579189383549e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3596, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.9765625, + "rewards/rejected": -9.375, + "step": 17650 + }, + { + "epoch": 0.6573486441718933, + "grad_norm": 6.58370021018874, + "learning_rate": 1.5849341716365306e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.578125, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3845, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.75, + "rewards/rejected": -9.375, + "step": 17660 + }, + { + "epoch": 0.6577208687722171, + "grad_norm": 8.32289943348736, + "learning_rate": 1.5819119692734892e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -912.0, + "logps/rejected": -1072.0, + "loss": 0.3826, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.3125, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.125, + "step": 17670 + }, + { + "epoch": 0.658093093372541, + "grad_norm": 8.438492402459849, + "learning_rate": 1.5788913169517237e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.75, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3759, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.765625, + "rewards/rejected": -9.125, + "step": 17680 + }, + { + "epoch": 0.6584653179728648, + "grad_norm": 7.786568589824084, + "learning_rate": 1.5758722197711122e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.75, + "logps/chosen": -924.0, + "logps/rejected": -1112.0, + "loss": 0.3869, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.3125, + "rewards/margins": 2.203125, + "rewards/rejected": -9.5, + "step": 17690 + }, + { + "epoch": 0.6588375425731887, + "grad_norm": 6.340120099963788, + "learning_rate": 1.5728546828289042e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.625, + "logps/chosen": -912.0, + "logps/rejected": -1088.0, + "loss": 0.3792, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.3125, + "step": 17700 + }, + { + "epoch": 0.6592097671735125, + "grad_norm": 6.480794637414619, + "learning_rate": 1.5698387112197177e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.515625, + "logps/chosen": -912.0, + "logps/rejected": -1120.0, + "loss": 0.3767, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.375, + "rewards/margins": 2.25, + "rewards/rejected": -9.625, + "step": 17710 + }, + { + "epoch": 0.6595819917738364, + "grad_norm": 7.691378824651244, + "learning_rate": 1.5668243100355262e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.3818, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.765625, + "rewards/rejected": -9.1875, + "step": 17720 + }, + { + "epoch": 0.6599542163741602, + "grad_norm": 8.770212993871144, + "learning_rate": 1.5638114843656524e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.859375, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3615, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.0625, + "step": 17730 + }, + { + "epoch": 0.660326440974484, + "grad_norm": 6.9755361853610465, + "learning_rate": 1.5608002392967603e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.84375, + "logps/chosen": -960.0, + "logps/rejected": -1128.0, + "loss": 0.3694, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.5625, + "step": 17740 + }, + { + "epoch": 0.6606986655748078, + "grad_norm": 7.988625982378954, + "learning_rate": 1.5577905799128422e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -916.0, + "logps/rejected": -1088.0, + "loss": 0.3827, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.828125, + "rewards/rejected": -9.375, + "step": 17750 + }, + { + "epoch": 0.6610708901751317, + "grad_norm": 7.991723252338846, + "learning_rate": 1.5547825112952166e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.734375, + "logps/chosen": -920.0, + "logps/rejected": -1048.0, + "loss": 0.4052, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.5, + "rewards/rejected": -8.9375, + "step": 17760 + }, + { + "epoch": 0.6614431147754555, + "grad_norm": 7.997154343806163, + "learning_rate": 1.551776038522513e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.8125, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3999, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.4375, + "step": 17770 + }, + { + "epoch": 0.6618153393757793, + "grad_norm": 6.956609761808537, + "learning_rate": 1.54877116667067e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.546875, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.4062, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.703125, + "rewards/rejected": -9.125, + "step": 17780 + }, + { + "epoch": 0.6621875639761032, + "grad_norm": 6.057690662030335, + "learning_rate": 1.5457679008129203e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.59375, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3927, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.125, + "step": 17790 + }, + { + "epoch": 0.6625597885764271, + "grad_norm": 7.5949255006277605, + "learning_rate": 1.542766246019787e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.53125, + "logps/chosen": -896.0, + "logps/rejected": -1064.0, + "loss": 0.3987, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.609375, + "rewards/rejected": -9.0, + "step": 17800 + }, + { + "epoch": 0.6629320131767509, + "grad_norm": 7.683763890522869, + "learning_rate": 1.539766207359073e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.703125, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3839, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.0, + "step": 17810 + }, + { + "epoch": 0.6633042377770747, + "grad_norm": 6.532733183884192, + "learning_rate": 1.5367677898958515e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -952.0, + "logps/rejected": -1104.0, + "loss": 0.3905, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.125, + "step": 17820 + }, + { + "epoch": 0.6636764623773985, + "grad_norm": 7.871885734956697, + "learning_rate": 1.53377099869246e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3957, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.59375, + "rewards/rejected": -9.0625, + "step": 17830 + }, + { + "epoch": 0.6640486869777223, + "grad_norm": 6.808802768073819, + "learning_rate": 1.5307758388084884e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3843, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.96875, + "rewards/rejected": -9.3125, + "step": 17840 + }, + { + "epoch": 0.6644209115780462, + "grad_norm": 8.030763868651215, + "learning_rate": 1.5277823153007754e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.703125, + "logps/chosen": -900.0, + "logps/rejected": -1048.0, + "loss": 0.4119, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.0, + "step": 17850 + }, + { + "epoch": 0.66479313617837, + "grad_norm": 7.571473484851187, + "learning_rate": 1.5247904332233936e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1064.0, + "loss": 0.3844, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.5078125, + "rewards/rejected": -9.0625, + "step": 17860 + }, + { + "epoch": 0.6651653607786938, + "grad_norm": 6.738871790251661, + "learning_rate": 1.521800197627647e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.578125, + "logps/chosen": -932.0, + "logps/rejected": -1120.0, + "loss": 0.3778, + "rewards/accuracies": 0.887499988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.4375, + "step": 17870 + }, + { + "epoch": 0.6655375853790177, + "grad_norm": 8.025373089505704, + "learning_rate": 1.5188116135620577e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.4229, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.515625, + "rewards/rejected": -9.1875, + "step": 17880 + }, + { + "epoch": 0.6659098099793416, + "grad_norm": 6.979429716508786, + "learning_rate": 1.515824686072361e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.3823, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.53125, + "rewards/rejected": -9.0625, + "step": 17890 + }, + { + "epoch": 0.6662820345796654, + "grad_norm": 6.671378584773726, + "learning_rate": 1.5128394202014948e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.4375, + "logps/chosen": -944.0, + "logps/rejected": -1072.0, + "loss": 0.3773, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.515625, + "rewards/rejected": -8.9375, + "step": 17900 + }, + { + "epoch": 0.6666542591799892, + "grad_norm": 7.714565162408182, + "learning_rate": 1.5098558209895914e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.453125, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3738, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.84375, + "rewards/rejected": -9.25, + "step": 17910 + }, + { + "epoch": 0.667026483780313, + "grad_norm": 6.276840013586024, + "learning_rate": 1.50687389347397e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3692, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.125, + "step": 17920 + }, + { + "epoch": 0.6673987083806369, + "grad_norm": 7.3506717867648295, + "learning_rate": 1.5038936426891259e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.515625, + "logps/chosen": -916.0, + "logps/rejected": -1056.0, + "loss": 0.3831, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 1.546875, + "rewards/rejected": -8.875, + "step": 17930 + }, + { + "epoch": 0.6677709329809607, + "grad_norm": 7.774949445370347, + "learning_rate": 1.5009150736667247e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.46875, + "logps/chosen": -900.0, + "logps/rejected": -1096.0, + "loss": 0.3741, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.125, + "rewards/margins": 1.921875, + "rewards/rejected": -9.0625, + "step": 17940 + }, + { + "epoch": 0.6681431575812845, + "grad_norm": 6.870185693234993, + "learning_rate": 1.4979381914355928e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3817, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.375, + "step": 17950 + }, + { + "epoch": 0.6685153821816083, + "grad_norm": 8.482904606439572, + "learning_rate": 1.4949630010217087e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.75, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.4041, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.0625, + "step": 17960 + }, + { + "epoch": 0.6688876067819323, + "grad_norm": 8.397600846863826, + "learning_rate": 1.491989507448192e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.71875, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.3844, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.0, + "step": 17970 + }, + { + "epoch": 0.6692598313822561, + "grad_norm": 8.130276189145672, + "learning_rate": 1.4890177157353017e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.515625, + "logps/chosen": -896.0, + "logps/rejected": -1056.0, + "loss": 0.3706, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.828125, + "rewards/rejected": -9.0, + "step": 17980 + }, + { + "epoch": 0.6696320559825799, + "grad_norm": 7.648259189875532, + "learning_rate": 1.486047630900421e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -912.0, + "logps/rejected": -1088.0, + "loss": 0.389, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.15625, + "rewards/margins": 1.859375, + "rewards/rejected": -9.0, + "step": 17990 + }, + { + "epoch": 0.6700042805829037, + "grad_norm": 6.07605007352532, + "learning_rate": 1.4830792579580514e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.671875, + "logps/chosen": -904.0, + "logps/rejected": -1040.0, + "loss": 0.4008, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.21875, + "rewards/margins": 1.7265625, + "rewards/rejected": -8.9375, + "step": 18000 + }, + { + "epoch": 0.6703765051832276, + "grad_norm": 8.554490023642392, + "learning_rate": 1.4801126019198045e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.53125, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3838, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.3125, + "step": 18010 + }, + { + "epoch": 0.6707487297835514, + "grad_norm": 6.641347048249407, + "learning_rate": 1.4771476677943934e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.515625, + "logps/chosen": -944.0, + "logps/rejected": -1120.0, + "loss": 0.3867, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.8125, + "rewards/rejected": -9.4375, + "step": 18020 + }, + { + "epoch": 0.6711209543838752, + "grad_norm": 8.125100279140668, + "learning_rate": 1.4741844605876241e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -956.0, + "logps/rejected": -1080.0, + "loss": 0.3875, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.625, + "rewards/rejected": -9.25, + "step": 18030 + }, + { + "epoch": 0.671493178984199, + "grad_norm": 7.533340335951724, + "learning_rate": 1.4712229853023845e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.609375, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.3837, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.71875, + "rewards/margins": 1.421875, + "rewards/rejected": -9.125, + "step": 18040 + }, + { + "epoch": 0.6718654035845228, + "grad_norm": 6.614066059678995, + "learning_rate": 1.468263246938643e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.625, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.4014, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.375, + "step": 18050 + }, + { + "epoch": 0.6722376281848468, + "grad_norm": 7.254591252547914, + "learning_rate": 1.4653052504934327e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.609375, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.4061, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.375, + "step": 18060 + }, + { + "epoch": 0.6726098527851706, + "grad_norm": 7.162032675450714, + "learning_rate": 1.4623490009608453e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -948.0, + "logps/rejected": -1072.0, + "loss": 0.3701, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.5, + "rewards/rejected": -9.0, + "step": 18070 + }, + { + "epoch": 0.6729820773854944, + "grad_norm": 7.04059154120853, + "learning_rate": 1.4593945033320252e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.484375, + "logps/chosen": -924.0, + "logps/rejected": -1064.0, + "loss": 0.41, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.375, + "rewards/margins": 1.625, + "rewards/rejected": -9.0, + "step": 18080 + }, + { + "epoch": 0.6733543019858182, + "grad_norm": 6.893010869851695, + "learning_rate": 1.4564417625951558e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.75, + "logps/chosen": -936.0, + "logps/rejected": -1080.0, + "loss": 0.3872, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.125, + "step": 18090 + }, + { + "epoch": 0.6737265265861421, + "grad_norm": 8.39628289291, + "learning_rate": 1.4534907837354577e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.5, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3808, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.9375, + "rewards/rejected": -9.4375, + "step": 18100 + }, + { + "epoch": 0.6740987511864659, + "grad_norm": 7.507796246027934, + "learning_rate": 1.4505415717351752e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.5, + "logps/chosen": -932.0, + "logps/rejected": -1104.0, + "loss": 0.3845, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.59375, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.375, + "step": 18110 + }, + { + "epoch": 0.6744709757867897, + "grad_norm": 7.35796444155586, + "learning_rate": 1.4475941315735704e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.515625, + "logps/chosen": -932.0, + "logps/rejected": -1080.0, + "loss": 0.3718, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5, + "rewards/rejected": -9.1875, + "step": 18120 + }, + { + "epoch": 0.6748432003871135, + "grad_norm": 8.321434858983238, + "learning_rate": 1.4446484682269117e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.515625, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3911, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.625, + "rewards/margins": 1.625, + "rewards/rejected": -9.25, + "step": 18130 + }, + { + "epoch": 0.6752154249874375, + "grad_norm": 7.115933853084183, + "learning_rate": 1.4417045866684698e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.78125, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.4002, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.1875, + "step": 18140 + }, + { + "epoch": 0.6755876495877613, + "grad_norm": 7.542830705248919, + "learning_rate": 1.4387624918685072e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.3939, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.1875, + "step": 18150 + }, + { + "epoch": 0.6759598741880851, + "grad_norm": 6.866479859807674, + "learning_rate": 1.4358221887942684e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.78125, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.372, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.6875, + "rewards/rejected": -9.3125, + "step": 18160 + }, + { + "epoch": 0.6763320987884089, + "grad_norm": 6.9269356581410815, + "learning_rate": 1.432883682409975e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.625, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.3891, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.1875, + "step": 18170 + }, + { + "epoch": 0.6767043233887328, + "grad_norm": 7.5346146422333575, + "learning_rate": 1.4299469776768116e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.546875, + "logps/chosen": -976.0, + "logps/rejected": -1128.0, + "loss": 0.4042, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.84375, + "rewards/rejected": -9.5, + "step": 18180 + }, + { + "epoch": 0.6770765479890566, + "grad_norm": 7.003066318704803, + "learning_rate": 1.4270120795529245e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -904.0, + "logps/rejected": -1056.0, + "loss": 0.3839, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.3125, + "rewards/margins": 1.703125, + "rewards/rejected": -9.0, + "step": 18190 + }, + { + "epoch": 0.6774487725893804, + "grad_norm": 7.573161612694521, + "learning_rate": 1.424078992993408e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.609375, + "logps/chosen": -924.0, + "logps/rejected": -1064.0, + "loss": 0.4023, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.609375, + "rewards/rejected": -9.0, + "step": 18200 + }, + { + "epoch": 0.6778209971897042, + "grad_norm": 8.683266084544984, + "learning_rate": 1.4211477229502996e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -896.0, + "logps/rejected": -1020.0, + "loss": 0.3862, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.125, + "rewards/margins": 1.4453125, + "rewards/rejected": -8.5625, + "step": 18210 + }, + { + "epoch": 0.6781932217900281, + "grad_norm": 7.693060684866391, + "learning_rate": 1.418218274372567e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.671875, + "logps/chosen": -908.0, + "logps/rejected": -1072.0, + "loss": 0.3931, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.21875, + "rewards/margins": 1.6640625, + "rewards/rejected": -8.875, + "step": 18220 + }, + { + "epoch": 0.678565446390352, + "grad_norm": 6.905951124138664, + "learning_rate": 1.4152906522061047e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.3996, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.546875, + "rewards/rejected": -9.0625, + "step": 18230 + }, + { + "epoch": 0.6789376709906758, + "grad_norm": 7.384635884111532, + "learning_rate": 1.412364861393724e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.734375, + "logps/chosen": -952.0, + "logps/rejected": -1072.0, + "loss": 0.3875, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.453125, + "rewards/rejected": -9.0, + "step": 18240 + }, + { + "epoch": 0.6793098955909996, + "grad_norm": 8.364081560387007, + "learning_rate": 1.4094409068751428e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -900.0, + "logps/rejected": -1064.0, + "loss": 0.3899, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.25, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.0, + "step": 18250 + }, + { + "epoch": 0.6796821201913235, + "grad_norm": 8.601876354662146, + "learning_rate": 1.406518793586981e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -928.0, + "logps/rejected": -1096.0, + "loss": 0.3794, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.375, + "rewards/margins": 1.875, + "rewards/rejected": -9.25, + "step": 18260 + }, + { + "epoch": 0.6800543447916473, + "grad_norm": 8.819539522394559, + "learning_rate": 1.4035985264627456e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.703125, + "logps/chosen": -936.0, + "logps/rejected": -1072.0, + "loss": 0.4006, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.25, + "step": 18270 + }, + { + "epoch": 0.6804265693919711, + "grad_norm": 7.350958374800609, + "learning_rate": 1.400680110432831e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.609375, + "logps/chosen": -924.0, + "logps/rejected": -1088.0, + "loss": 0.3843, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.25, + "step": 18280 + }, + { + "epoch": 0.6807987939922949, + "grad_norm": 7.132154356650205, + "learning_rate": 1.3977635504245047e-07, + "logits/chosen": -3.546875, + "logits/rejected": -3.328125, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3604, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.3125, + "step": 18290 + }, + { + "epoch": 0.6811710185926187, + "grad_norm": 8.657679967173712, + "learning_rate": 1.394848851361901e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.40625, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.3921, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.1875, + "step": 18300 + }, + { + "epoch": 0.6815432431929426, + "grad_norm": 8.359870108483511, + "learning_rate": 1.3919360181660107e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.5625, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3995, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.1875, + "step": 18310 + }, + { + "epoch": 0.6819154677932665, + "grad_norm": 9.378476061301928, + "learning_rate": 1.3890250557546763e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.59375, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3845, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.1875, + "step": 18320 + }, + { + "epoch": 0.6822876923935903, + "grad_norm": 8.602130020835867, + "learning_rate": 1.3861159690425806e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -900.0, + "logps/rejected": -1056.0, + "loss": 0.4025, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.625, + "rewards/rejected": -8.9375, + "step": 18330 + }, + { + "epoch": 0.6826599169939142, + "grad_norm": 8.021595648031884, + "learning_rate": 1.3832087629412402e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.609375, + "logps/chosen": -916.0, + "logps/rejected": -1072.0, + "loss": 0.3848, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.1875, + "rewards/margins": 1.796875, + "rewards/rejected": -9.0, + "step": 18340 + }, + { + "epoch": 0.683032141594238, + "grad_norm": 7.402560429241675, + "learning_rate": 1.3803034423589982e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.734375, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3866, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6875, + "rewards/rejected": -9.25, + "step": 18350 + }, + { + "epoch": 0.6834043661945618, + "grad_norm": 6.63553992344501, + "learning_rate": 1.37740001220101e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.3894, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.46875, + "rewards/rejected": -9.1875, + "step": 18360 + }, + { + "epoch": 0.6837765907948856, + "grad_norm": 7.506600031750079, + "learning_rate": 1.3744984773692425e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.453125, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.3837, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.96875, + "rewards/rejected": -9.625, + "step": 18370 + }, + { + "epoch": 0.6841488153952094, + "grad_norm": 7.424224785763181, + "learning_rate": 1.3715988427624632e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.84375, + "logps/chosen": -968.0, + "logps/rejected": -1072.0, + "loss": 0.3884, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.0625, + "step": 18380 + }, + { + "epoch": 0.6845210399955333, + "grad_norm": 8.234275999065385, + "learning_rate": 1.3687011132762288e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3755, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.4375, + "step": 18390 + }, + { + "epoch": 0.6848932645958571, + "grad_norm": 9.010785268811787, + "learning_rate": 1.3658052938028834e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.609375, + "logps/chosen": -968.0, + "logps/rejected": -1096.0, + "loss": 0.4019, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.3125, + "step": 18400 + }, + { + "epoch": 0.685265489196181, + "grad_norm": 7.086300824155898, + "learning_rate": 1.362911389231541e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.703125, + "logps/chosen": -988.0, + "logps/rejected": -1120.0, + "loss": 0.3836, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.4375, + "step": 18410 + }, + { + "epoch": 0.6856377137965048, + "grad_norm": 7.02549916739348, + "learning_rate": 1.3600194044480866e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.578125, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.4096, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.125, + "step": 18420 + }, + { + "epoch": 0.6860099383968287, + "grad_norm": 8.302558557760715, + "learning_rate": 1.3571293443351627e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.546875, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.4009, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.5, + "step": 18430 + }, + { + "epoch": 0.6863821629971525, + "grad_norm": 7.16662530441311, + "learning_rate": 1.3542412137721643e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.578125, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3819, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.3125, + "step": 18440 + }, + { + "epoch": 0.6867543875974763, + "grad_norm": 7.250320510589996, + "learning_rate": 1.351355017635224e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.5625, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.4053, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.765625, + "rewards/rejected": -9.4375, + "step": 18450 + }, + { + "epoch": 0.6871266121978001, + "grad_norm": 6.019292678197596, + "learning_rate": 1.3484707607972134e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.59375, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3675, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.625, + "rewards/rejected": -9.375, + "step": 18460 + }, + { + "epoch": 0.687498836798124, + "grad_norm": 6.16050497037097, + "learning_rate": 1.3455884481277253e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.59375, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.367, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.90625, + "rewards/margins": 1.671875, + "rewards/rejected": -9.625, + "step": 18470 + }, + { + "epoch": 0.6878710613984478, + "grad_norm": 7.831060143008705, + "learning_rate": 1.342708084493075e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3557, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.9375, + "rewards/rejected": -9.5625, + "step": 18480 + }, + { + "epoch": 0.6882432859987716, + "grad_norm": 8.267383124788537, + "learning_rate": 1.339829674756285e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.546875, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.388, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.3125, + "step": 18490 + }, + { + "epoch": 0.6886155105990955, + "grad_norm": 9.132429083854552, + "learning_rate": 1.336953223777077e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.671875, + "logps/chosen": -932.0, + "logps/rejected": -1080.0, + "loss": 0.3678, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.0625, + "step": 18500 + }, + { + "epoch": 0.6889877351994194, + "grad_norm": 8.505335690781891, + "learning_rate": 1.3340787364118688e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.453125, + "logps/chosen": -896.0, + "logps/rejected": -1032.0, + "loss": 0.4108, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.28125, + "rewards/margins": 1.53125, + "rewards/rejected": -8.8125, + "step": 18510 + }, + { + "epoch": 0.6893599597997432, + "grad_norm": 7.726529456599936, + "learning_rate": 1.331206217513759e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.46875, + "logps/chosen": -900.0, + "logps/rejected": -1056.0, + "loss": 0.3947, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.1875, + "rewards/margins": 1.765625, + "rewards/rejected": -8.9375, + "step": 18520 + }, + { + "epoch": 0.689732184400067, + "grad_norm": 8.872996791038082, + "learning_rate": 1.328335671932529e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.578125, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.4074, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.640625, + "rewards/rejected": -9.0, + "step": 18530 + }, + { + "epoch": 0.6901044090003908, + "grad_norm": 8.092977051796215, + "learning_rate": 1.3254671045146222e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.4375, + "logps/chosen": -936.0, + "logps/rejected": -1064.0, + "loss": 0.4059, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.25, + "rewards/margins": 1.734375, + "rewards/rejected": -9.0, + "step": 18540 + }, + { + "epoch": 0.6904766336007147, + "grad_norm": 7.22462235567666, + "learning_rate": 1.322600520103146e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.5, + "logps/chosen": -896.0, + "logps/rejected": -1104.0, + "loss": 0.4094, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.21875, + "rewards/margins": 2.046875, + "rewards/rejected": -9.25, + "step": 18550 + }, + { + "epoch": 0.6908488582010385, + "grad_norm": 9.479235670142375, + "learning_rate": 1.319735923537857e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.578125, + "logps/chosen": -936.0, + "logps/rejected": -1072.0, + "loss": 0.3882, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.125, + "step": 18560 + }, + { + "epoch": 0.6912210828013623, + "grad_norm": 7.308703004239579, + "learning_rate": 1.3168733196551596e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.39, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.75, + "rewards/rejected": -9.3125, + "step": 18570 + }, + { + "epoch": 0.6915933074016862, + "grad_norm": 6.80595819075359, + "learning_rate": 1.314012713288092e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.59375, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.3763, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.0625, + "step": 18580 + }, + { + "epoch": 0.69196553200201, + "grad_norm": 7.3270344793655875, + "learning_rate": 1.3111541092663168e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.28125, + "logps/chosen": -944.0, + "logps/rejected": -1120.0, + "loss": 0.3871, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.84375, + "rewards/rejected": -9.3125, + "step": 18590 + }, + { + "epoch": 0.6923377566023339, + "grad_norm": 6.051578141509356, + "learning_rate": 1.308297512416121e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3873, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.5625, + "rewards/rejected": -8.9375, + "step": 18600 + }, + { + "epoch": 0.6927099812026577, + "grad_norm": 6.682986169838317, + "learning_rate": 1.3054429275603983e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3686, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.4375, + "rewards/margins": 1.890625, + "rewards/rejected": -9.3125, + "step": 18610 + }, + { + "epoch": 0.6930822058029815, + "grad_norm": 6.235463298433478, + "learning_rate": 1.302590359518651e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.6875, + "logps/chosen": -992.0, + "logps/rejected": -1080.0, + "loss": 0.3869, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.875, + "rewards/margins": 1.171875, + "rewards/rejected": -9.0625, + "step": 18620 + }, + { + "epoch": 0.6934544304033053, + "grad_norm": 7.002236343649768, + "learning_rate": 1.29973981310697e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.75, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3865, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.78125, + "rewards/margins": 1.578125, + "rewards/rejected": -9.375, + "step": 18630 + }, + { + "epoch": 0.6938266550036292, + "grad_norm": 7.964794938641898, + "learning_rate": 1.2968912931380375e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.578125, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.3878, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.90625, + "rewards/rejected": -9.625, + "step": 18640 + }, + { + "epoch": 0.694198879603953, + "grad_norm": 8.431792682688622, + "learning_rate": 1.2940448044211134e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.59375, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.3886, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.1875, + "step": 18650 + }, + { + "epoch": 0.6945711042042768, + "grad_norm": 9.568570362662708, + "learning_rate": 1.2912003517620252e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.75, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.3846, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5, + "rewards/margins": 1.6875, + "rewards/rejected": -9.1875, + "step": 18660 + }, + { + "epoch": 0.6949433288046007, + "grad_norm": 7.797695703828273, + "learning_rate": 1.2883579399631689e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.46875, + "logps/chosen": -972.0, + "logps/rejected": -1136.0, + "loss": 0.3971, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.78125, + "rewards/margins": 1.765625, + "rewards/rejected": -9.5625, + "step": 18670 + }, + { + "epoch": 0.6953155534049246, + "grad_norm": 7.652610669504206, + "learning_rate": 1.2855175738234886e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.6875, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3711, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.25, + "step": 18680 + }, + { + "epoch": 0.6956877780052484, + "grad_norm": 8.12784834288147, + "learning_rate": 1.282679258138479e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.59375, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3695, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.375, + "step": 18690 + }, + { + "epoch": 0.6960600026055722, + "grad_norm": 10.802294094844664, + "learning_rate": 1.27984299770017e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.3767, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.5625, + "step": 18700 + }, + { + "epoch": 0.696432227205896, + "grad_norm": 8.078290276621237, + "learning_rate": 1.277008797297123e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.625, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3818, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 1.78125, + "rewards/rejected": -9.375, + "step": 18710 + }, + { + "epoch": 0.6968044518062199, + "grad_norm": 6.944979135981245, + "learning_rate": 1.2741766617144218e-07, + "logits/chosen": -3.609375, + "logits/rejected": -3.546875, + "logps/chosen": -968.0, + "logps/rejected": -1152.0, + "loss": 0.3776, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.96875, + "rewards/rejected": -9.8125, + "step": 18720 + }, + { + "epoch": 0.6971766764065437, + "grad_norm": 8.16437300140285, + "learning_rate": 1.2713465957336633e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.640625, + "logps/chosen": -968.0, + "logps/rejected": -1096.0, + "loss": 0.3793, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.4921875, + "rewards/rejected": -9.125, + "step": 18730 + }, + { + "epoch": 0.6975489010068675, + "grad_norm": 8.32917419932018, + "learning_rate": 1.268518604132951e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.546875, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.396, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.625, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.25, + "step": 18740 + }, + { + "epoch": 0.6979211256071913, + "grad_norm": 8.083311461732476, + "learning_rate": 1.2656926916868833e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.484375, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.386, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.0625, + "step": 18750 + }, + { + "epoch": 0.6982933502075153, + "grad_norm": 7.558118595013816, + "learning_rate": 1.262868863166554e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.53125, + "logps/chosen": -912.0, + "logps/rejected": -1088.0, + "loss": 0.3797, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.96875, + "rewards/rejected": -9.375, + "step": 18760 + }, + { + "epoch": 0.6986655748078391, + "grad_norm": 7.4578964964410535, + "learning_rate": 1.260047123339532e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.59375, + "logps/chosen": -980.0, + "logps/rejected": -1128.0, + "loss": 0.4108, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.75, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.5, + "step": 18770 + }, + { + "epoch": 0.6990377994081629, + "grad_norm": 7.300139790287824, + "learning_rate": 1.2572274769698654e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.765625, + "logps/chosen": -976.0, + "logps/rejected": -1096.0, + "loss": 0.4149, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -8.0, + "rewards/margins": 1.2578125, + "rewards/rejected": -9.25, + "step": 18780 + }, + { + "epoch": 0.6994100240084867, + "grad_norm": 8.266171224416356, + "learning_rate": 1.2544099288180626e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.3782, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.25, + "step": 18790 + }, + { + "epoch": 0.6997822486088106, + "grad_norm": 9.046171443224837, + "learning_rate": 1.2515944836410942e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.4079, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.4375, + "step": 18800 + }, + { + "epoch": 0.7001544732091344, + "grad_norm": 7.33581480514214, + "learning_rate": 1.248781146192377e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.578125, + "logps/chosen": -880.0, + "logps/rejected": -1064.0, + "loss": 0.3836, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.21875, + "rewards/margins": 1.8125, + "rewards/rejected": -9.0, + "step": 18810 + }, + { + "epoch": 0.7005266978094582, + "grad_norm": 9.24243454512702, + "learning_rate": 1.2459699212217713e-07, + "logits/chosen": -3.671875, + "logits/rejected": -3.484375, + "logps/chosen": -904.0, + "logps/rejected": -1072.0, + "loss": 0.3829, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.25, + "rewards/margins": 2.015625, + "rewards/rejected": -9.25, + "step": 18820 + }, + { + "epoch": 0.700898922409782, + "grad_norm": 7.535894780193304, + "learning_rate": 1.2431608134755712e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.375, + "logps/chosen": -952.0, + "logps/rejected": -1128.0, + "loss": 0.3797, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.796875, + "rewards/rejected": -9.5, + "step": 18830 + }, + { + "epoch": 0.7012711470101058, + "grad_norm": 8.091285798686318, + "learning_rate": 1.2403538276964926e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -920.0, + "logps/rejected": -1096.0, + "loss": 0.3858, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.1875, + "step": 18840 + }, + { + "epoch": 0.7016433716104298, + "grad_norm": 7.43413272524799, + "learning_rate": 1.2375489686236724e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.53125, + "logps/chosen": -916.0, + "logps/rejected": -1080.0, + "loss": 0.3894, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.125, + "step": 18850 + }, + { + "epoch": 0.7020155962107536, + "grad_norm": 7.746951630529741, + "learning_rate": 1.2347462409926556e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -932.0, + "logps/rejected": -1080.0, + "loss": 0.3928, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.640625, + "rewards/rejected": -9.1875, + "step": 18860 + }, + { + "epoch": 0.7023878208110774, + "grad_norm": 7.082472461929826, + "learning_rate": 1.23194564953539e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.625, + "logps/chosen": -960.0, + "logps/rejected": -1088.0, + "loss": 0.3942, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.71875, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.25, + "step": 18870 + }, + { + "epoch": 0.7027600454114012, + "grad_norm": 6.973848857528124, + "learning_rate": 1.229147198980214e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.40625, + "logps/chosen": -912.0, + "logps/rejected": -1104.0, + "loss": 0.3523, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 2.125, + "rewards/rejected": -9.4375, + "step": 18880 + }, + { + "epoch": 0.7031322700117251, + "grad_norm": 8.119192524376171, + "learning_rate": 1.2263508940518532e-07, + "logits/chosen": -3.578125, + "logits/rejected": -3.515625, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.3882, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.25, + "step": 18890 + }, + { + "epoch": 0.7035044946120489, + "grad_norm": 9.448985232634346, + "learning_rate": 1.2235567394714112e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.71875, + "logps/chosen": -912.0, + "logps/rejected": -1072.0, + "loss": 0.3824, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.1875, + "step": 18900 + }, + { + "epoch": 0.7038767192123727, + "grad_norm": 7.68914088328252, + "learning_rate": 1.2207647399563597e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.515625, + "logps/chosen": -932.0, + "logps/rejected": -1112.0, + "loss": 0.3682, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.375, + "step": 18910 + }, + { + "epoch": 0.7042489438126965, + "grad_norm": 7.801215329845928, + "learning_rate": 1.2179749002205342e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.5625, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.4071, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.59375, + "rewards/margins": 1.71875, + "rewards/rejected": -9.3125, + "step": 18920 + }, + { + "epoch": 0.7046211684130205, + "grad_norm": 8.439628020060733, + "learning_rate": 1.21518722497412e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.5, + "logps/chosen": -916.0, + "logps/rejected": -1080.0, + "loss": 0.3601, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.4375, + "rewards/margins": 1.9375, + "rewards/rejected": -9.375, + "step": 18930 + }, + { + "epoch": 0.7049933930133443, + "grad_norm": 8.337174293133925, + "learning_rate": 1.212401718923651e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.578125, + "logps/chosen": -916.0, + "logps/rejected": -1096.0, + "loss": 0.37, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.78125, + "rewards/rejected": -9.25, + "step": 18940 + }, + { + "epoch": 0.7053656176136681, + "grad_norm": 7.441976727284874, + "learning_rate": 1.2096183867719981e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.375, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3927, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.96875, + "rewards/rejected": -9.4375, + "step": 18950 + }, + { + "epoch": 0.7057378422139919, + "grad_norm": 6.922873939243078, + "learning_rate": 1.206837233218363e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.46875, + "logps/chosen": -912.0, + "logps/rejected": -1072.0, + "loss": 0.3659, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.125, + "step": 18960 + }, + { + "epoch": 0.7061100668143158, + "grad_norm": 7.043289827445419, + "learning_rate": 1.2040582629582658e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.546875, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.3795, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.796875, + "rewards/rejected": -9.5, + "step": 18970 + }, + { + "epoch": 0.7064822914146396, + "grad_norm": 7.871198398541639, + "learning_rate": 1.2012814806835432e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.625, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.4049, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.25, + "step": 18980 + }, + { + "epoch": 0.7068545160149634, + "grad_norm": 7.959471998441874, + "learning_rate": 1.198506891082338e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.5, + "logps/chosen": -908.0, + "logps/rejected": -1072.0, + "loss": 0.3941, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.765625, + "rewards/rejected": -9.125, + "step": 18990 + }, + { + "epoch": 0.7072267406152872, + "grad_norm": 7.035038194827172, + "learning_rate": 1.1957344988390903e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.59375, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3895, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.796875, + "rewards/rejected": -9.375, + "step": 19000 + }, + { + "epoch": 0.707598965215611, + "grad_norm": 8.636248814666374, + "learning_rate": 1.192964308634531e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.546875, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3823, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.25, + "step": 19010 + }, + { + "epoch": 0.707971189815935, + "grad_norm": 7.0040908914217725, + "learning_rate": 1.1901963251456704e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.453125, + "logps/chosen": -972.0, + "logps/rejected": -1112.0, + "loss": 0.3903, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.671875, + "rewards/rejected": -9.4375, + "step": 19020 + }, + { + "epoch": 0.7083434144162588, + "grad_norm": 9.701430496278931, + "learning_rate": 1.1874305530457967e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.3771, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.671875, + "rewards/rejected": -9.1875, + "step": 19030 + }, + { + "epoch": 0.7087156390165826, + "grad_norm": 6.855117920448521, + "learning_rate": 1.1846669970044629e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -920.0, + "logps/rejected": -1080.0, + "loss": 0.3643, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.1875, + "step": 19040 + }, + { + "epoch": 0.7090878636169065, + "grad_norm": 8.265564464609023, + "learning_rate": 1.181905661687482e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.6875, + "logps/chosen": -952.0, + "logps/rejected": -1080.0, + "loss": 0.3923, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.1875, + "step": 19050 + }, + { + "epoch": 0.7094600882172303, + "grad_norm": 6.874734618220727, + "learning_rate": 1.179146551756914e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3813, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.90625, + "rewards/rejected": -9.625, + "step": 19060 + }, + { + "epoch": 0.7098323128175541, + "grad_norm": 8.913594605875394, + "learning_rate": 1.1763896718710656e-07, + "logits/chosen": -3.953125, + "logits/rejected": -3.71875, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3669, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.3125, + "step": 19070 + }, + { + "epoch": 0.7102045374178779, + "grad_norm": 7.41334444682267, + "learning_rate": 1.1736350266844766e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.65625, + "logps/chosen": -932.0, + "logps/rejected": -1128.0, + "loss": 0.3949, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.5, + "rewards/margins": 2.046875, + "rewards/rejected": -9.5625, + "step": 19080 + }, + { + "epoch": 0.7105767620182017, + "grad_norm": 8.75408203111484, + "learning_rate": 1.1708826208479145e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -952.0, + "logps/rejected": -1088.0, + "loss": 0.4085, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.84375, + "rewards/rejected": -9.375, + "step": 19090 + }, + { + "epoch": 0.7109489866185256, + "grad_norm": 6.990040493335933, + "learning_rate": 1.1681324590083663e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.3708, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 1.875, + "rewards/rejected": -9.375, + "step": 19100 + }, + { + "epoch": 0.7113212112188495, + "grad_norm": 7.716963592708909, + "learning_rate": 1.1653845458090286e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.59375, + "logps/chosen": -972.0, + "logps/rejected": -1088.0, + "loss": 0.3728, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.625, + "rewards/rejected": -9.3125, + "step": 19110 + }, + { + "epoch": 0.7116934358191733, + "grad_norm": 7.3883929041787555, + "learning_rate": 1.1626388858893033e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.59375, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3712, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.1875, + "step": 19120 + }, + { + "epoch": 0.7120656604194971, + "grad_norm": 9.091454804636204, + "learning_rate": 1.1598954838847877e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.5625, + "logps/chosen": -912.0, + "logps/rejected": -1096.0, + "loss": 0.3993, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.375, + "step": 19130 + }, + { + "epoch": 0.712437885019821, + "grad_norm": 6.660099120896379, + "learning_rate": 1.1571543444272674e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.640625, + "logps/chosen": -932.0, + "logps/rejected": -1080.0, + "loss": 0.3802, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.125, + "step": 19140 + }, + { + "epoch": 0.7128101096201448, + "grad_norm": 7.406599519246462, + "learning_rate": 1.1544154721447058e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -932.0, + "logps/rejected": -1104.0, + "loss": 0.3807, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.375, + "step": 19150 + }, + { + "epoch": 0.7131823342204686, + "grad_norm": 6.850006605130867, + "learning_rate": 1.1516788716612413e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.609375, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.3712, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.640625, + "rewards/rejected": -9.0625, + "step": 19160 + }, + { + "epoch": 0.7135545588207924, + "grad_norm": 7.0285145400381115, + "learning_rate": 1.1489445475971751e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.421875, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3991, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 1.4375, + "rewards/rejected": -8.75, + "step": 19170 + }, + { + "epoch": 0.7139267834211163, + "grad_norm": 6.78795941814448, + "learning_rate": 1.1462125045689661e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -904.0, + "logps/rejected": -1080.0, + "loss": 0.3675, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.15625, + "rewards/margins": 1.78125, + "rewards/rejected": -8.9375, + "step": 19180 + }, + { + "epoch": 0.7142990080214401, + "grad_norm": 8.365212910726626, + "learning_rate": 1.1434827471892222e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3762, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.671875, + "rewards/rejected": -9.125, + "step": 19190 + }, + { + "epoch": 0.714671232621764, + "grad_norm": 20.930114779097597, + "learning_rate": 1.1407552800666895e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.5, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.4026, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.5, + "step": 19200 + }, + { + "epoch": 0.7150434572220878, + "grad_norm": 7.152474616529817, + "learning_rate": 1.138030107806251e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -972.0, + "logps/rejected": -1160.0, + "loss": 0.3961, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.890625, + "rewards/rejected": -9.6875, + "step": 19210 + }, + { + "epoch": 0.7154156818224117, + "grad_norm": 7.773034532449301, + "learning_rate": 1.1353072350089135e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -956.0, + "logps/rejected": -1096.0, + "loss": 0.4141, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.609375, + "rewards/rejected": -9.125, + "step": 19220 + }, + { + "epoch": 0.7157879064227355, + "grad_norm": 7.67273194782146, + "learning_rate": 1.1325866662718025e-07, + "logits/chosen": -3.6875, + "logits/rejected": -3.59375, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.385, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.5625, + "step": 19230 + }, + { + "epoch": 0.7161601310230593, + "grad_norm": 7.424889183510072, + "learning_rate": 1.129868406188151e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.578125, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.3776, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.34375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.0, + "step": 19240 + }, + { + "epoch": 0.7165323556233831, + "grad_norm": 7.6193348533351815, + "learning_rate": 1.1271524593472973e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.703125, + "logps/chosen": -996.0, + "logps/rejected": -1120.0, + "loss": 0.3772, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.375, + "step": 19250 + }, + { + "epoch": 0.716904580223707, + "grad_norm": 8.510848796314397, + "learning_rate": 1.1244388303346722e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.4023, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.890625, + "rewards/rejected": -9.3125, + "step": 19260 + }, + { + "epoch": 0.7172768048240308, + "grad_norm": 7.610768449531311, + "learning_rate": 1.1217275237317942e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.453125, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3877, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8125, + "rewards/rejected": -9.375, + "step": 19270 + }, + { + "epoch": 0.7176490294243546, + "grad_norm": 8.512355345254507, + "learning_rate": 1.1190185441162613e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.796875, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.4014, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.546875, + "rewards/rejected": -9.125, + "step": 19280 + }, + { + "epoch": 0.7180212540246785, + "grad_norm": 7.531354891047735, + "learning_rate": 1.1163118960617402e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.4052, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.4765625, + "rewards/rejected": -9.3125, + "step": 19290 + }, + { + "epoch": 0.7183934786250024, + "grad_norm": 8.538965682100951, + "learning_rate": 1.1136075841379636e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.625, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.379, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.59375, + "rewards/rejected": -9.375, + "step": 19300 + }, + { + "epoch": 0.7187657032253262, + "grad_norm": 8.08798120046632, + "learning_rate": 1.1109056129107192e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.765625, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.402, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.625, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.125, + "step": 19310 + }, + { + "epoch": 0.71913792782565, + "grad_norm": 8.124411284023273, + "learning_rate": 1.1082059869418428e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.703125, + "logps/chosen": -908.0, + "logps/rejected": -1080.0, + "loss": 0.3798, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.84375, + "rewards/rejected": -9.25, + "step": 19320 + }, + { + "epoch": 0.7195101524259738, + "grad_norm": 8.333154684433953, + "learning_rate": 1.1055087107892123e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -980.0, + "logps/rejected": -1112.0, + "loss": 0.3814, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.4375, + "step": 19330 + }, + { + "epoch": 0.7198823770262976, + "grad_norm": 7.476419242766577, + "learning_rate": 1.102813789006734e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1080.0, + "loss": 0.3787, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.125, + "step": 19340 + }, + { + "epoch": 0.7202546016266215, + "grad_norm": 8.325558354033056, + "learning_rate": 1.1001212261443435e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.5, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3602, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.5, + "step": 19350 + }, + { + "epoch": 0.7206268262269453, + "grad_norm": 7.674522951043031, + "learning_rate": 1.0974310267479919e-07, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.3999, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.703125, + "rewards/rejected": -9.3125, + "step": 19360 + }, + { + "epoch": 0.7209990508272692, + "grad_norm": 7.411130915813204, + "learning_rate": 1.0947431953596412e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.546875, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3838, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.78125, + "rewards/rejected": -9.1875, + "step": 19370 + }, + { + "epoch": 0.721371275427593, + "grad_norm": 8.651573301013912, + "learning_rate": 1.0920577365172528e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.78125, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.3939, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.1875, + "step": 19380 + }, + { + "epoch": 0.7217435000279169, + "grad_norm": 9.456610855384243, + "learning_rate": 1.0893746547547861e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.5625, + "logps/chosen": -892.0, + "logps/rejected": -1064.0, + "loss": 0.385, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.28125, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.0625, + "step": 19390 + }, + { + "epoch": 0.7221157246282407, + "grad_norm": 8.275002796025563, + "learning_rate": 1.0866939546021822e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.3971, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.4765625, + "rewards/rejected": -9.0625, + "step": 19400 + }, + { + "epoch": 0.7224879492285645, + "grad_norm": 6.776957307297741, + "learning_rate": 1.084015640585367e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.59375, + "logps/chosen": -912.0, + "logps/rejected": -1096.0, + "loss": 0.38, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.953125, + "rewards/rejected": -9.3125, + "step": 19410 + }, + { + "epoch": 0.7228601738288883, + "grad_norm": 7.876010536025482, + "learning_rate": 1.0813397172262354e-07, + "logits/chosen": -3.984375, + "logits/rejected": -3.828125, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3867, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.4375, + "step": 19420 + }, + { + "epoch": 0.7232323984292122, + "grad_norm": 7.6111798620878925, + "learning_rate": 1.0786661890426436e-07, + "logits/chosen": -4.0, + "logits/rejected": -3.796875, + "logps/chosen": -924.0, + "logps/rejected": -1096.0, + "loss": 0.3837, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.3125, + "step": 19430 + }, + { + "epoch": 0.723604623029536, + "grad_norm": 8.875890548536699, + "learning_rate": 1.0759950605484078e-07, + "logits/chosen": -3.921875, + "logits/rejected": -3.609375, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3783, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.75, + "rewards/rejected": -9.4375, + "step": 19440 + }, + { + "epoch": 0.7239768476298598, + "grad_norm": 7.139278504129174, + "learning_rate": 1.0733263362532885e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -924.0, + "logps/rejected": -1088.0, + "loss": 0.4023, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.828125, + "rewards/rejected": -9.3125, + "step": 19450 + }, + { + "epoch": 0.7243490722301837, + "grad_norm": 9.200148867106291, + "learning_rate": 1.0706600206629931e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.578125, + "logps/chosen": -908.0, + "logps/rejected": -1088.0, + "loss": 0.3805, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.3125, + "step": 19460 + }, + { + "epoch": 0.7247212968305076, + "grad_norm": 7.3719496924308725, + "learning_rate": 1.0679961182791561e-07, + "logits/chosen": -3.859375, + "logits/rejected": -3.8125, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3817, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8125, + "rewards/rejected": -9.25, + "step": 19470 + }, + { + "epoch": 0.7250935214308314, + "grad_norm": 8.03116297286317, + "learning_rate": 1.0653346335993424e-07, + "logits/chosen": -3.890625, + "logits/rejected": -3.703125, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3936, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.4375, + "step": 19480 + }, + { + "epoch": 0.7254657460311552, + "grad_norm": 7.518574259984923, + "learning_rate": 1.0626755711170302e-07, + "logits/chosen": -3.75, + "logits/rejected": -3.640625, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.3867, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.0625, + "step": 19490 + }, + { + "epoch": 0.725837970631479, + "grad_norm": 7.282859874864732, + "learning_rate": 1.0600189353216132e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.53125, + "logps/chosen": -908.0, + "logps/rejected": -1072.0, + "loss": 0.3896, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 1.671875, + "rewards/rejected": -9.125, + "step": 19500 + }, + { + "epoch": 0.7262101952318029, + "grad_norm": 7.833298672394872, + "learning_rate": 1.0573647306983866e-07, + "logits/chosen": -3.84375, + "logits/rejected": -3.703125, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3833, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.703125, + "rewards/rejected": -9.375, + "step": 19510 + }, + { + "epoch": 0.7265824198321267, + "grad_norm": 7.072891334665583, + "learning_rate": 1.0547129617285377e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.3797, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.515625, + "rewards/rejected": -9.375, + "step": 19520 + }, + { + "epoch": 0.7269546444324505, + "grad_norm": 7.672237760055815, + "learning_rate": 1.0520636328891467e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.78125, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.3822, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.734375, + "rewards/rejected": -9.375, + "step": 19530 + }, + { + "epoch": 0.7273268690327743, + "grad_norm": 8.07209985081442, + "learning_rate": 1.0494167486531677e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.546875, + "logps/chosen": -940.0, + "logps/rejected": -1120.0, + "loss": 0.355, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 2.078125, + "rewards/rejected": -9.5625, + "step": 19540 + }, + { + "epoch": 0.7276990936330983, + "grad_norm": 8.338060924781983, + "learning_rate": 1.0467723134894357e-07, + "logits/chosen": -3.875, + "logits/rejected": -3.828125, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3762, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.4375, + "step": 19550 + }, + { + "epoch": 0.7280713182334221, + "grad_norm": 7.650734735768076, + "learning_rate": 1.0441303318626434e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.578125, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.3819, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.5, + "step": 19560 + }, + { + "epoch": 0.7284435428337459, + "grad_norm": 7.695932210472061, + "learning_rate": 1.0414908082333451e-07, + "logits/chosen": -3.71875, + "logits/rejected": -3.59375, + "logps/chosen": -936.0, + "logps/rejected": -1144.0, + "loss": 0.3855, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 2.140625, + "rewards/rejected": -9.6875, + "step": 19570 + }, + { + "epoch": 0.7288157674340697, + "grad_norm": 8.35569718132435, + "learning_rate": 1.0388537470579448e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.5625, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3964, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.625, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.5, + "step": 19580 + }, + { + "epoch": 0.7291879920343936, + "grad_norm": 8.501836049144211, + "learning_rate": 1.0362191527886857e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -952.0, + "logps/rejected": -1128.0, + "loss": 0.3873, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.65625, + "rewards/margins": 1.9375, + "rewards/rejected": -9.5625, + "step": 19590 + }, + { + "epoch": 0.7295602166347174, + "grad_norm": 8.386269626326106, + "learning_rate": 1.0335870298736526e-07, + "logits/chosen": -3.703125, + "logits/rejected": -3.5625, + "logps/chosen": -944.0, + "logps/rejected": -1056.0, + "loss": 0.3961, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.4765625, + "rewards/rejected": -8.9375, + "step": 19600 + }, + { + "epoch": 0.7299324412350412, + "grad_norm": 8.517234583309014, + "learning_rate": 1.030957382756751e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.4056, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.5, + "step": 19610 + }, + { + "epoch": 0.730304665835365, + "grad_norm": 6.668715277373133, + "learning_rate": 1.0283302158777113e-07, + "logits/chosen": -3.765625, + "logits/rejected": -3.46875, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3904, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.1875, + "step": 19620 + }, + { + "epoch": 0.7306768904356888, + "grad_norm": 6.568912095456722, + "learning_rate": 1.0257055336720726e-07, + "logits/chosen": -3.65625, + "logits/rejected": -3.5625, + "logps/chosen": -944.0, + "logps/rejected": -1120.0, + "loss": 0.3664, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.3125, + "step": 19630 + }, + { + "epoch": 0.7310491150360128, + "grad_norm": 7.873174831673161, + "learning_rate": 1.0230833405711822e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -908.0, + "logps/rejected": -1088.0, + "loss": 0.3631, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.40625, + "rewards/margins": 1.96875, + "rewards/rejected": -9.375, + "step": 19640 + }, + { + "epoch": 0.7314213396363366, + "grad_norm": 7.1763131529852275, + "learning_rate": 1.020463641002183e-07, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -920.0, + "logps/rejected": -1064.0, + "loss": 0.3774, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.703125, + "rewards/rejected": -9.1875, + "step": 19650 + }, + { + "epoch": 0.7317935642366604, + "grad_norm": 7.932583915752739, + "learning_rate": 1.0178464393880093e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3855, + "rewards/accuracies": 0.875, + "rewards/chosen": -7.46875, + "rewards/margins": 1.921875, + "rewards/rejected": -9.375, + "step": 19660 + }, + { + "epoch": 0.7321657888369842, + "grad_norm": 8.163695812235677, + "learning_rate": 1.0152317401473782e-07, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -956.0, + "logps/rejected": -1096.0, + "loss": 0.3804, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.640625, + "rewards/rejected": -9.25, + "step": 19670 + }, + { + "epoch": 0.7325380134373081, + "grad_norm": 9.024767704889392, + "learning_rate": 1.0126195476947779e-07, + "logits/chosen": -3.796875, + "logits/rejected": -3.796875, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.3964, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.671875, + "rewards/rejected": -9.25, + "step": 19680 + }, + { + "epoch": 0.7329102380376319, + "grad_norm": 9.321773705568685, + "learning_rate": 1.0100098664404719e-07, + "logits/chosen": -3.8125, + "logits/rejected": -3.59375, + "logps/chosen": -928.0, + "logps/rejected": -1096.0, + "loss": 0.3829, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.703125, + "rewards/rejected": -9.1875, + "step": 19690 + }, + { + "epoch": 0.7332824626379557, + "grad_norm": 7.256947973367732, + "learning_rate": 1.0074027007904764e-07, + "logits/chosen": -3.9375, + "logits/rejected": -3.71875, + "logps/chosen": -924.0, + "logps/rejected": -1088.0, + "loss": 0.3759, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.78125, + "rewards/rejected": -9.25, + "step": 19700 + }, + { + "epoch": 0.7336546872382795, + "grad_norm": 7.102238423113803, + "learning_rate": 1.0047980551465653e-07, + "logits/chosen": -3.734375, + "logits/rejected": -3.609375, + "logps/chosen": -944.0, + "logps/rejected": -1064.0, + "loss": 0.3996, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.0625, + "step": 19710 + }, + { + "epoch": 0.7340269118386035, + "grad_norm": 6.839653397779881, + "learning_rate": 1.002195933906255e-07, + "logits/chosen": -3.96875, + "logits/rejected": -3.640625, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3681, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.59375, + "rewards/margins": 1.65625, + "rewards/rejected": -9.25, + "step": 19720 + }, + { + "epoch": 0.7343991364389273, + "grad_norm": 7.123579304196685, + "learning_rate": 9.995963414628011e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.515625, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3813, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.25, + "step": 19730 + }, + { + "epoch": 0.7347713610392511, + "grad_norm": 7.726269239289189, + "learning_rate": 9.969992822051904e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.53125, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3773, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.3125, + "step": 19740 + }, + { + "epoch": 0.7351435856395749, + "grad_norm": 9.15410704498772, + "learning_rate": 9.944047605181319e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3783, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.25, + "step": 19750 + }, + { + "epoch": 0.7355158102398988, + "grad_norm": 7.641898838289834, + "learning_rate": 9.918127807820512e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -964.0, + "logps/rejected": -1144.0, + "loss": 0.3711, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 2.015625, + "rewards/rejected": -9.6875, + "step": 19760 + }, + { + "epoch": 0.7358880348402226, + "grad_norm": 7.8638503721680255, + "learning_rate": 9.892233473730799e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.578125, + "logps/chosen": -924.0, + "logps/rejected": -1064.0, + "loss": 0.3943, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.578125, + "rewards/rejected": -9.1875, + "step": 19770 + }, + { + "epoch": 0.7362602594405464, + "grad_norm": 7.126440868269323, + "learning_rate": 9.866364646630531e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.546875, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.3851, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.421875, + "rewards/rejected": -9.0, + "step": 19780 + }, + { + "epoch": 0.7366324840408702, + "grad_norm": 8.492718636847714, + "learning_rate": 9.84052137019499e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3821, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.375, + "step": 19790 + }, + { + "epoch": 0.737004708641194, + "grad_norm": 7.795228276134456, + "learning_rate": 9.814703688056319e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.59375, + "logps/chosen": -948.0, + "logps/rejected": -1080.0, + "loss": 0.3826, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.25, + "step": 19800 + }, + { + "epoch": 0.737376933241518, + "grad_norm": 7.507640258961813, + "learning_rate": 9.78891164380343e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3871, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.84375, + "rewards/rejected": -9.5, + "step": 19810 + }, + { + "epoch": 0.7377491578418418, + "grad_norm": 6.980266851087673, + "learning_rate": 9.763145280981974e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.578125, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3992, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.375, + "step": 19820 + }, + { + "epoch": 0.7381213824421656, + "grad_norm": 7.3323689212383005, + "learning_rate": 9.737404643094235e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.78125, + "logps/chosen": -912.0, + "logps/rejected": -1080.0, + "loss": 0.3728, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 1.75, + "rewards/rejected": -9.25, + "step": 19830 + }, + { + "epoch": 0.7384936070424895, + "grad_norm": 6.9386483885580095, + "learning_rate": 9.711689773599067e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3644, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.890625, + "rewards/rejected": -9.5625, + "step": 19840 + }, + { + "epoch": 0.7388658316428133, + "grad_norm": 7.915830672937266, + "learning_rate": 9.686000715911819e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.53125, + "logps/chosen": -916.0, + "logps/rejected": -1096.0, + "loss": 0.3835, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.90625, + "rewards/rejected": -9.25, + "step": 19850 + }, + { + "epoch": 0.7392380562431371, + "grad_norm": 8.95352560800234, + "learning_rate": 9.660337513404243e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -968.0, + "logps/rejected": -1136.0, + "loss": 0.4012, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.4375, + "step": 19860 + }, + { + "epoch": 0.7396102808434609, + "grad_norm": 8.075919008988745, + "learning_rate": 9.634700209404464e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.3895, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.875, + "rewards/rejected": -9.625, + "step": 19870 + }, + { + "epoch": 0.7399825054437847, + "grad_norm": 7.891910169540815, + "learning_rate": 9.609088847196866e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -964.0, + "logps/rejected": -1128.0, + "loss": 0.3773, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.4375, + "step": 19880 + }, + { + "epoch": 0.7403547300441086, + "grad_norm": 7.850702440358002, + "learning_rate": 9.583503470022053e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.421875, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3988, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.9375, + "rewards/rejected": -9.5625, + "step": 19890 + }, + { + "epoch": 0.7407269546444325, + "grad_norm": 6.037381520254476, + "learning_rate": 9.557944121076724e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.5, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3477, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.5, + "step": 19900 + }, + { + "epoch": 0.7410991792447563, + "grad_norm": 7.413380692041023, + "learning_rate": 9.532410843513666e-08, + "logits/chosen": -4.03125, + "logits/rejected": -3.78125, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3718, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.4375, + "step": 19910 + }, + { + "epoch": 0.7414714038450801, + "grad_norm": 7.582639668769937, + "learning_rate": 9.50690368044163e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.46875, + "logps/chosen": -916.0, + "logps/rejected": -1096.0, + "loss": 0.3894, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.3125, + "step": 19920 + }, + { + "epoch": 0.741843628445404, + "grad_norm": 7.427820329026051, + "learning_rate": 9.481422674925288e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.75, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.384, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.3125, + "step": 19930 + }, + { + "epoch": 0.7422158530457278, + "grad_norm": 8.479133339239517, + "learning_rate": 9.455967869985151e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3801, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.5, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.375, + "step": 19940 + }, + { + "epoch": 0.7425880776460516, + "grad_norm": 8.12132333751996, + "learning_rate": 9.430539308597474e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.578125, + "logps/chosen": -904.0, + "logps/rejected": -1088.0, + "loss": 0.3979, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.125, + "step": 19950 + }, + { + "epoch": 0.7429603022463754, + "grad_norm": 6.853107294575637, + "learning_rate": 9.405137033694222e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.46875, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3791, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.84375, + "rewards/rejected": -9.3125, + "step": 19960 + }, + { + "epoch": 0.7433325268466993, + "grad_norm": 8.136209201667418, + "learning_rate": 9.37976108816298e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3667, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 1.609375, + "rewards/rejected": -9.0625, + "step": 19970 + }, + { + "epoch": 0.7437047514470231, + "grad_norm": 7.961009166615228, + "learning_rate": 9.354411514846882e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.625, + "logps/chosen": -916.0, + "logps/rejected": -1088.0, + "loss": 0.3895, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.9921875, + "rewards/rejected": -9.375, + "step": 19980 + }, + { + "epoch": 0.744076976047347, + "grad_norm": 7.961107418899133, + "learning_rate": 9.329088356544518e-08, + "logits/chosen": -3.984375, + "logits/rejected": -3.609375, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3712, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6875, + "rewards/rejected": -9.25, + "step": 19990 + }, + { + "epoch": 0.7444492006476708, + "grad_norm": 6.707492237509258, + "learning_rate": 9.303791656009896e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -960.0, + "logps/rejected": -1136.0, + "loss": 0.4019, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.84375, + "rewards/rejected": -9.5, + "step": 20000 + }, + { + "epoch": 0.7444492006476708, + "eval_logits/chosen": -3.84375, + "eval_logits/rejected": -3.65625, + "eval_logps/chosen": -984.0, + "eval_logps/rejected": -1104.0, + "eval_loss": 0.46099165081977844, + "eval_rewards/accuracies": 0.7533908486366272, + "eval_rewards/chosen": -7.84375, + "eval_rewards/margins": 1.515625, + "eval_rewards/rejected": -9.375, + "eval_runtime": 6273.6564, + "eval_samples_per_second": 30.454, + "eval_steps_per_second": 0.476, + "step": 20000 + }, + { + "epoch": 0.7448214252479947, + "grad_norm": 7.2449139191141025, + "learning_rate": 9.278521455952354e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.734375, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3833, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.78125, + "rewards/rejected": -9.3125, + "step": 20010 + }, + { + "epoch": 0.7451936498483185, + "grad_norm": 8.0500684158033, + "learning_rate": 9.253277799036488e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.3924, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.1875, + "step": 20020 + }, + { + "epoch": 0.7455658744486423, + "grad_norm": 8.619208887200024, + "learning_rate": 9.228060727882083e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.578125, + "logps/chosen": -944.0, + "logps/rejected": -1120.0, + "loss": 0.3857, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.375, + "step": 20030 + }, + { + "epoch": 0.7459380990489661, + "grad_norm": 7.616474905220966, + "learning_rate": 9.202870285064021e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.3779, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.59375, + "rewards/rejected": -9.125, + "step": 20040 + }, + { + "epoch": 0.74631032364929, + "grad_norm": 7.743687183078503, + "learning_rate": 9.177706513112246e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.640625, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3781, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.53125, + "rewards/rejected": -9.125, + "step": 20050 + }, + { + "epoch": 0.7466825482496138, + "grad_norm": 8.499116797598386, + "learning_rate": 9.152569454511663e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.53125, + "logps/chosen": -968.0, + "logps/rejected": -1136.0, + "loss": 0.3953, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.625, + "step": 20060 + }, + { + "epoch": 0.7470547728499376, + "grad_norm": 7.639015754021952, + "learning_rate": 9.12745915170209e-08, + "logits/chosen": -3.640625, + "logits/rejected": -3.46875, + "logps/chosen": -936.0, + "logps/rejected": -1056.0, + "loss": 0.3891, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.5625, + "rewards/margins": 1.3828125, + "rewards/rejected": -8.9375, + "step": 20070 + }, + { + "epoch": 0.7474269974502615, + "grad_norm": 7.663238106058885, + "learning_rate": 9.102375647078145e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.3925, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.765625, + "rewards/rejected": -9.125, + "step": 20080 + }, + { + "epoch": 0.7477992220505854, + "grad_norm": 8.662648024141351, + "learning_rate": 9.077318982989222e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -896.0, + "logps/rejected": -1064.0, + "loss": 0.3614, + "rewards/accuracies": 0.875, + "rewards/chosen": -7.15625, + "rewards/margins": 1.9375, + "rewards/rejected": -9.125, + "step": 20090 + }, + { + "epoch": 0.7481714466509092, + "grad_norm": 9.085477473382282, + "learning_rate": 9.052289201739397e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.578125, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.3918, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.0625, + "step": 20100 + }, + { + "epoch": 0.748543671251233, + "grad_norm": 10.343320043773335, + "learning_rate": 9.027286345587354e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.515625, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3835, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.625, + "rewards/rejected": -9.375, + "step": 20110 + }, + { + "epoch": 0.7489158958515568, + "grad_norm": 7.488897865027447, + "learning_rate": 9.002310456746335e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -932.0, + "logps/rejected": -1048.0, + "loss": 0.3815, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.3125, + "rewards/margins": 1.5078125, + "rewards/rejected": -8.8125, + "step": 20120 + }, + { + "epoch": 0.7492881204518806, + "grad_norm": 7.939986273859413, + "learning_rate": 8.977361577384013e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.703125, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3715, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.34375, + "rewards/margins": 1.609375, + "rewards/rejected": -8.9375, + "step": 20130 + }, + { + "epoch": 0.7496603450522045, + "grad_norm": 8.35250032373012, + "learning_rate": 8.952439749622497e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.65625, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.3782, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.25, + "step": 20140 + }, + { + "epoch": 0.7500325696525283, + "grad_norm": 9.045397555003415, + "learning_rate": 8.927545015538212e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.703125, + "logps/chosen": -936.0, + "logps/rejected": -1072.0, + "loss": 0.3945, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.1875, + "step": 20150 + }, + { + "epoch": 0.7504047942528522, + "grad_norm": 8.164338565604146, + "learning_rate": 8.902677417161839e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.53125, + "logps/chosen": -924.0, + "logps/rejected": -1120.0, + "loss": 0.3797, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.34375, + "rewards/margins": 2.0625, + "rewards/rejected": -9.375, + "step": 20160 + }, + { + "epoch": 0.750777018853176, + "grad_norm": 7.616977540765588, + "learning_rate": 8.877836996478252e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.3916, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.5625, + "step": 20170 + }, + { + "epoch": 0.7511492434534999, + "grad_norm": 8.69316932165126, + "learning_rate": 8.853023795426421e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.5, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3928, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.5625, + "rewards/rejected": -9.3125, + "step": 20180 + }, + { + "epoch": 0.7515214680538237, + "grad_norm": 9.353599314491538, + "learning_rate": 8.828237855899373e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.703125, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3782, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.6875, + "rewards/rejected": -9.4375, + "step": 20190 + }, + { + "epoch": 0.7518936926541475, + "grad_norm": 9.047139286346642, + "learning_rate": 8.803479219744111e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.71875, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.3804, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.4375, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.1875, + "step": 20200 + }, + { + "epoch": 0.7522659172544713, + "grad_norm": 9.164246828622453, + "learning_rate": 8.778747928761548e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -924.0, + "logps/rejected": -1088.0, + "loss": 0.3748, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.25, + "step": 20210 + }, + { + "epoch": 0.7526381418547952, + "grad_norm": 6.535277400751438, + "learning_rate": 8.7540440247064e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -924.0, + "logps/rejected": -1112.0, + "loss": 0.3726, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.375, + "step": 20220 + }, + { + "epoch": 0.753010366455119, + "grad_norm": 7.533278046350786, + "learning_rate": 8.729367549287168e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -936.0, + "logps/rejected": -1112.0, + "loss": 0.3891, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.78125, + "rewards/rejected": -9.3125, + "step": 20230 + }, + { + "epoch": 0.7533825910554428, + "grad_norm": 8.002691659942183, + "learning_rate": 8.704718544166046e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.515625, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3838, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.375, + "step": 20240 + }, + { + "epoch": 0.7537548156557667, + "grad_norm": 7.055337751504257, + "learning_rate": 8.680097050958834e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.515625, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.4064, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.796875, + "rewards/rejected": -9.3125, + "step": 20250 + }, + { + "epoch": 0.7541270402560906, + "grad_norm": 7.728428792164973, + "learning_rate": 8.655503111234905e-08, + "logits/chosen": -4.0, + "logits/rejected": -3.6875, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3884, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.1875, + "step": 20260 + }, + { + "epoch": 0.7544992648564144, + "grad_norm": 6.300699140598843, + "learning_rate": 8.630936766517081e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.640625, + "logps/chosen": -908.0, + "logps/rejected": -1048.0, + "loss": 0.3797, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.5859375, + "rewards/rejected": -8.9375, + "step": 20270 + }, + { + "epoch": 0.7548714894567382, + "grad_norm": 9.178410009671971, + "learning_rate": 8.606398058281619e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.421875, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3658, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.4375, + "rewards/margins": 2.015625, + "rewards/rejected": -9.4375, + "step": 20280 + }, + { + "epoch": 0.755243714057062, + "grad_norm": 8.101701705174449, + "learning_rate": 8.581887027958107e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.3714, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.765625, + "rewards/rejected": -9.375, + "step": 20290 + }, + { + "epoch": 0.7556159386573859, + "grad_norm": 8.559119711704989, + "learning_rate": 8.557403716929418e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.59375, + "logps/chosen": -976.0, + "logps/rejected": -1128.0, + "loss": 0.3828, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.71875, + "rewards/margins": 1.75, + "rewards/rejected": -9.5, + "step": 20300 + }, + { + "epoch": 0.7559881632577097, + "grad_norm": 8.585380408192094, + "learning_rate": 8.532948166531592e-08, + "logits/chosen": -3.640625, + "logits/rejected": -3.53125, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.4067, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.3125, + "step": 20310 + }, + { + "epoch": 0.7563603878580335, + "grad_norm": 9.215859410638696, + "learning_rate": 8.508520418053839e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.5625, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.3951, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.125, + "step": 20320 + }, + { + "epoch": 0.7567326124583573, + "grad_norm": 7.544619012481699, + "learning_rate": 8.484120512738386e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.59375, + "logps/chosen": -896.0, + "logps/rejected": -1040.0, + "loss": 0.3846, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.375, + "rewards/margins": 1.4921875, + "rewards/rejected": -8.875, + "step": 20330 + }, + { + "epoch": 0.7571048370586813, + "grad_norm": 7.425122831543079, + "learning_rate": 8.459748491780502e-08, + "logits/chosen": -3.984375, + "logits/rejected": -3.6875, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3823, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.84375, + "rewards/rejected": -9.4375, + "step": 20340 + }, + { + "epoch": 0.7574770616590051, + "grad_norm": 7.891208826066001, + "learning_rate": 8.435404396328355e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -924.0, + "logps/rejected": -1064.0, + "loss": 0.3925, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.4375, + "rewards/margins": 1.5625, + "rewards/rejected": -9.0, + "step": 20350 + }, + { + "epoch": 0.7578492862593289, + "grad_norm": 7.828661944836035, + "learning_rate": 8.411088267482944e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.578125, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.3844, + "rewards/accuracies": 0.8812500238418579, + "rewards/chosen": -7.375, + "rewards/margins": 1.8125, + "rewards/rejected": -9.1875, + "step": 20360 + }, + { + "epoch": 0.7582215108596527, + "grad_norm": 8.391382605095894, + "learning_rate": 8.386800146298087e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.421875, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3771, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5, + "rewards/margins": 1.8125, + "rewards/rejected": -9.3125, + "step": 20370 + }, + { + "epoch": 0.7585937354599765, + "grad_norm": 7.538089930554933, + "learning_rate": 8.362540073780275e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.703125, + "logps/chosen": -936.0, + "logps/rejected": -1056.0, + "loss": 0.4107, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.484375, + "rewards/rejected": -9.0, + "step": 20380 + }, + { + "epoch": 0.7589659600603004, + "grad_norm": 7.330187781190223, + "learning_rate": 8.338308090888696e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3875, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.875, + "rewards/rejected": -9.4375, + "step": 20390 + }, + { + "epoch": 0.7593381846606242, + "grad_norm": 7.932278986389012, + "learning_rate": 8.314104238535066e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.640625, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.4052, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.125, + "step": 20400 + }, + { + "epoch": 0.759710409260948, + "grad_norm": 7.580772323734146, + "learning_rate": 8.289928557583639e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -932.0, + "logps/rejected": -1112.0, + "loss": 0.3652, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.9375, + "rewards/rejected": -9.3125, + "step": 20410 + }, + { + "epoch": 0.7600826338612718, + "grad_norm": 7.21145705666848, + "learning_rate": 8.265781088851068e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.515625, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3766, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 2.0, + "rewards/rejected": -9.4375, + "step": 20420 + }, + { + "epoch": 0.7604548584615958, + "grad_norm": 7.649007613826136, + "learning_rate": 8.241661873106426e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.4375, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.4051, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.3125, + "step": 20430 + }, + { + "epoch": 0.7608270830619196, + "grad_norm": 7.660158225405949, + "learning_rate": 8.217570951071055e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.515625, + "logps/chosen": -976.0, + "logps/rejected": -1104.0, + "loss": 0.4056, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.609375, + "rewards/rejected": -9.25, + "step": 20440 + }, + { + "epoch": 0.7611993076622434, + "grad_norm": 7.899040819222953, + "learning_rate": 8.193508363418514e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.546875, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.3705, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.609375, + "rewards/rejected": -9.0625, + "step": 20450 + }, + { + "epoch": 0.7615715322625672, + "grad_norm": 7.812854325649219, + "learning_rate": 8.169474150774563e-08, + "logits/chosen": -3.96875, + "logits/rejected": -3.640625, + "logps/chosen": -940.0, + "logps/rejected": -1120.0, + "loss": 0.4057, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.625, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.3125, + "step": 20460 + }, + { + "epoch": 0.7619437568628911, + "grad_norm": 8.480951647350905, + "learning_rate": 8.145468353717006e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3777, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.578125, + "rewards/rejected": -9.125, + "step": 20470 + }, + { + "epoch": 0.7623159814632149, + "grad_norm": 7.159897500973909, + "learning_rate": 8.121491012775733e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.3805, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.0, + "step": 20480 + }, + { + "epoch": 0.7626882060635387, + "grad_norm": 7.427749043637957, + "learning_rate": 8.09754216843253e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -924.0, + "logps/rejected": -1104.0, + "loss": 0.3715, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.25, + "step": 20490 + }, + { + "epoch": 0.7630604306638625, + "grad_norm": 7.776650558616942, + "learning_rate": 8.073621861121113e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.65625, + "logps/chosen": -912.0, + "logps/rejected": -1064.0, + "loss": 0.3637, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.5, + "rewards/margins": 1.46875, + "rewards/rejected": -9.0, + "step": 20500 + }, + { + "epoch": 0.7634326552641864, + "grad_norm": 7.494907492302637, + "learning_rate": 8.049730131227005e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3903, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.375, + "step": 20510 + }, + { + "epoch": 0.7638048798645103, + "grad_norm": 7.986983490899758, + "learning_rate": 8.02586701908746e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.59375, + "logps/chosen": -928.0, + "logps/rejected": -1064.0, + "loss": 0.4, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.4921875, + "rewards/rejected": -9.0, + "step": 20520 + }, + { + "epoch": 0.7641771044648341, + "grad_norm": 8.662329988252482, + "learning_rate": 8.002032564991459e-08, + "logits/chosen": -3.953125, + "logits/rejected": -3.671875, + "logps/chosen": -980.0, + "logps/rejected": -1152.0, + "loss": 0.3976, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -8.0, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.75, + "step": 20530 + }, + { + "epoch": 0.7645493290651579, + "grad_norm": 7.958387365138824, + "learning_rate": 7.978226809179558e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.5625, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.3653, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.375, + "step": 20540 + }, + { + "epoch": 0.7649215536654818, + "grad_norm": 8.766762151634595, + "learning_rate": 7.95444979184389e-08, + "logits/chosen": -3.6875, + "logits/rejected": -3.703125, + "logps/chosen": -972.0, + "logps/rejected": -1096.0, + "loss": 0.4004, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.875, + "rewards/margins": 1.546875, + "rewards/rejected": -9.4375, + "step": 20550 + }, + { + "epoch": 0.7652937782658056, + "grad_norm": 8.36734056390295, + "learning_rate": 7.930701553128036e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.53125, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.3975, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.515625, + "rewards/rejected": -9.0, + "step": 20560 + }, + { + "epoch": 0.7656660028661294, + "grad_norm": 7.462089415837083, + "learning_rate": 7.906982133127018e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3775, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.578125, + "rewards/rejected": -9.125, + "step": 20570 + }, + { + "epoch": 0.7660382274664532, + "grad_norm": 8.201381509037992, + "learning_rate": 7.883291571887196e-08, + "logits/chosen": -3.65625, + "logits/rejected": -3.546875, + "logps/chosen": -904.0, + "logps/rejected": -1080.0, + "loss": 0.3881, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.375, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.25, + "step": 20580 + }, + { + "epoch": 0.766410452066777, + "grad_norm": 7.544236742512034, + "learning_rate": 7.859629909406196e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.640625, + "logps/chosen": -952.0, + "logps/rejected": -1144.0, + "loss": 0.3866, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.375, + "step": 20590 + }, + { + "epoch": 0.766782676667101, + "grad_norm": 9.171874871278174, + "learning_rate": 7.83599718563287e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.4024, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.25, + "step": 20600 + }, + { + "epoch": 0.7671549012674248, + "grad_norm": 8.808357376711694, + "learning_rate": 7.812393440467177e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.71875, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3867, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.5, + "rewards/margins": 1.796875, + "rewards/rejected": -9.3125, + "step": 20610 + }, + { + "epoch": 0.7675271258677486, + "grad_norm": 7.070364723164209, + "learning_rate": 7.78881871376021e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1088.0, + "loss": 0.3734, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.1875, + "step": 20620 + }, + { + "epoch": 0.7678993504680725, + "grad_norm": 6.868926350147307, + "learning_rate": 7.765273045314005e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.734375, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3805, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.953125, + "rewards/rejected": -9.5, + "step": 20630 + }, + { + "epoch": 0.7682715750683963, + "grad_norm": 7.068605929969223, + "learning_rate": 7.741756474881588e-08, + "logits/chosen": -3.6875, + "logits/rejected": -3.59375, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.4011, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.640625, + "rewards/rejected": -9.125, + "step": 20640 + }, + { + "epoch": 0.7686437996687201, + "grad_norm": 9.251346803650792, + "learning_rate": 7.718269042166817e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3761, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.53125, + "rewards/rejected": -9.0625, + "step": 20650 + }, + { + "epoch": 0.7690160242690439, + "grad_norm": 6.961282640759425, + "learning_rate": 7.694810786824388e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3984, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.1875, + "step": 20660 + }, + { + "epoch": 0.7693882488693677, + "grad_norm": 7.278710212530748, + "learning_rate": 7.671381748459715e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.5, + "logps/chosen": -924.0, + "logps/rejected": -1088.0, + "loss": 0.3917, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8125, + "rewards/rejected": -9.25, + "step": 20670 + }, + { + "epoch": 0.7697604734696916, + "grad_norm": 7.345151005821905, + "learning_rate": 7.647981966628899e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.546875, + "logps/chosen": -884.0, + "logps/rejected": -1048.0, + "loss": 0.3611, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.1875, + "rewards/margins": 1.7578125, + "rewards/rejected": -8.9375, + "step": 20680 + }, + { + "epoch": 0.7701326980700155, + "grad_norm": 8.298512218652705, + "learning_rate": 7.624611480838647e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.71875, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3641, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.546875, + "rewards/rejected": -9.0625, + "step": 20690 + }, + { + "epoch": 0.7705049226703393, + "grad_norm": 8.283047606954991, + "learning_rate": 7.601270330546177e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.609375, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.3784, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.59375, + "rewards/rejected": -9.0625, + "step": 20700 + }, + { + "epoch": 0.7708771472706631, + "grad_norm": 7.2237400466981585, + "learning_rate": 7.577958555159209e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.53125, + "logps/chosen": -904.0, + "logps/rejected": -1064.0, + "loss": 0.3677, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.0625, + "step": 20710 + }, + { + "epoch": 0.771249371870987, + "grad_norm": 7.854870268066652, + "learning_rate": 7.554676194035859e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.734375, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.4014, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.5625, + "step": 20720 + }, + { + "epoch": 0.7716215964713108, + "grad_norm": 7.686189339835748, + "learning_rate": 7.531423286484584e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.71875, + "logps/chosen": -960.0, + "logps/rejected": -1128.0, + "loss": 0.3854, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.875, + "rewards/margins": 1.8125, + "rewards/rejected": -9.6875, + "step": 20730 + }, + { + "epoch": 0.7719938210716346, + "grad_norm": 8.526745892650448, + "learning_rate": 7.508199871764098e-08, + "logits/chosen": -3.953125, + "logits/rejected": -3.765625, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3758, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.5, + "step": 20740 + }, + { + "epoch": 0.7723660456719584, + "grad_norm": 8.738892131924189, + "learning_rate": 7.48500598908334e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.75, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3743, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.625, + "rewards/margins": 1.828125, + "rewards/rejected": -9.4375, + "step": 20750 + }, + { + "epoch": 0.7727382702722823, + "grad_norm": 7.648583661422197, + "learning_rate": 7.46184167760138e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -948.0, + "logps/rejected": -1080.0, + "loss": 0.3878, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.2578125, + "rewards/rejected": -9.0, + "step": 20760 + }, + { + "epoch": 0.7731104948726061, + "grad_norm": 6.741573481712693, + "learning_rate": 7.43870697642737e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.671875, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3857, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.890625, + "rewards/rejected": -9.5625, + "step": 20770 + }, + { + "epoch": 0.77348271947293, + "grad_norm": 7.762629046083911, + "learning_rate": 7.415601924620465e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1072.0, + "loss": 0.3842, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.25, + "step": 20780 + }, + { + "epoch": 0.7738549440732538, + "grad_norm": 7.156684711630175, + "learning_rate": 7.392526561189752e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.625, + "logps/chosen": -976.0, + "logps/rejected": -1120.0, + "loss": 0.3365, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.8125, + "rewards/margins": 1.640625, + "rewards/rejected": -9.4375, + "step": 20790 + }, + { + "epoch": 0.7742271686735777, + "grad_norm": 8.30894151512185, + "learning_rate": 7.369480925094204e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1104.0, + "loss": 0.4042, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.5625, + "step": 20800 + }, + { + "epoch": 0.7745993932739015, + "grad_norm": 7.7278981671843505, + "learning_rate": 7.346465055242606e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.8125, + "logps/chosen": -948.0, + "logps/rejected": -1072.0, + "loss": 0.3786, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.3125, + "rewards/rejected": -8.9375, + "step": 20810 + }, + { + "epoch": 0.7749716178742253, + "grad_norm": 9.85787052198705, + "learning_rate": 7.323478990493495e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -972.0, + "logps/rejected": -1112.0, + "loss": 0.403, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.1875, + "step": 20820 + }, + { + "epoch": 0.7753438424745491, + "grad_norm": 7.90650095446261, + "learning_rate": 7.30052276965506e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.75, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.3943, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.8125, + "rewards/rejected": -9.5, + "step": 20830 + }, + { + "epoch": 0.775716067074873, + "grad_norm": 7.648417586912853, + "learning_rate": 7.277596431485126e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.5, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3817, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.46875, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.3125, + "step": 20840 + }, + { + "epoch": 0.7760882916751968, + "grad_norm": 7.987626897291262, + "learning_rate": 7.254700014691059e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.65625, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.3872, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.25, + "step": 20850 + }, + { + "epoch": 0.7764605162755206, + "grad_norm": 7.4820770145769595, + "learning_rate": 7.231833557929712e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.3858, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.71875, + "rewards/rejected": -9.5, + "step": 20860 + }, + { + "epoch": 0.7768327408758445, + "grad_norm": 7.980528159730055, + "learning_rate": 7.208997099807356e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.71875, + "logps/chosen": -944.0, + "logps/rejected": -1072.0, + "loss": 0.3882, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.34375, + "rewards/margins": 1.703125, + "rewards/rejected": -9.0625, + "step": 20870 + }, + { + "epoch": 0.7772049654761684, + "grad_norm": 7.201528683900252, + "learning_rate": 7.186190678879603e-08, + "logits/chosen": -4.0, + "logits/rejected": -3.75, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3893, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.5, + "rewards/rejected": -9.0625, + "step": 20880 + }, + { + "epoch": 0.7775771900764922, + "grad_norm": 7.906700469268352, + "learning_rate": 7.163414333651357e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -924.0, + "logps/rejected": -1096.0, + "loss": 0.3763, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.25, + "step": 20890 + }, + { + "epoch": 0.777949414676816, + "grad_norm": 7.84357517889164, + "learning_rate": 7.140668102576756e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.703125, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.4001, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.125, + "step": 20900 + }, + { + "epoch": 0.7783216392771398, + "grad_norm": 9.52346940339506, + "learning_rate": 7.117952024059084e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3965, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 1.8125, + "rewards/rejected": -9.4375, + "step": 20910 + }, + { + "epoch": 0.7786938638774636, + "grad_norm": 8.895084300542662, + "learning_rate": 7.095266136450714e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.703125, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.4004, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.5625, + "rewards/rejected": -9.125, + "step": 20920 + }, + { + "epoch": 0.7790660884777875, + "grad_norm": 6.617738949192121, + "learning_rate": 7.072610478053051e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.40625, + "logps/chosen": -916.0, + "logps/rejected": -1104.0, + "loss": 0.3796, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.9921875, + "rewards/rejected": -9.4375, + "step": 20930 + }, + { + "epoch": 0.7794383130781113, + "grad_norm": 7.334368857089297, + "learning_rate": 7.049985087116469e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.796875, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.3778, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.609375, + "rewards/rejected": -9.25, + "step": 20940 + }, + { + "epoch": 0.7798105376784352, + "grad_norm": 7.827499943103778, + "learning_rate": 7.02739000184023e-08, + "logits/chosen": -3.625, + "logits/rejected": -3.78125, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.3873, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.375, + "step": 20950 + }, + { + "epoch": 0.780182762278759, + "grad_norm": 7.073236246827541, + "learning_rate": 7.004825260372449e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3954, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.375, + "rewards/margins": 1.828125, + "rewards/rejected": -9.1875, + "step": 20960 + }, + { + "epoch": 0.7805549868790829, + "grad_norm": 6.974769257269075, + "learning_rate": 6.982290900809976e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.84375, + "logps/chosen": -964.0, + "logps/rejected": -1080.0, + "loss": 0.3879, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.4765625, + "rewards/rejected": -9.25, + "step": 20970 + }, + { + "epoch": 0.7809272114794067, + "grad_norm": 9.114353031873724, + "learning_rate": 6.959786961198396e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.765625, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.4154, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.3125, + "step": 20980 + }, + { + "epoch": 0.7812994360797305, + "grad_norm": 6.824918980310406, + "learning_rate": 6.937313479531925e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.515625, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3711, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.375, + "step": 20990 + }, + { + "epoch": 0.7816716606800543, + "grad_norm": 6.084188009581788, + "learning_rate": 6.914870493753363e-08, + "logits/chosen": -3.609375, + "logits/rejected": -3.6875, + "logps/chosen": -900.0, + "logps/rejected": -1064.0, + "loss": 0.3661, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.0, + "step": 21000 + }, + { + "epoch": 0.7820438852803782, + "grad_norm": 6.696970926093566, + "learning_rate": 6.892458041754001e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3732, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.75, + "rewards/rejected": -9.375, + "step": 21010 + }, + { + "epoch": 0.782416109880702, + "grad_norm": 9.21679885128138, + "learning_rate": 6.870076161373603e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.4062, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.359375, + "rewards/rejected": -9.125, + "step": 21020 + }, + { + "epoch": 0.7827883344810258, + "grad_norm": 7.334941055226403, + "learning_rate": 6.847724890400306e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.546875, + "logps/chosen": -944.0, + "logps/rejected": -1120.0, + "loss": 0.3945, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.5625, + "step": 21030 + }, + { + "epoch": 0.7831605590813497, + "grad_norm": 7.467529195759886, + "learning_rate": 6.825404266570572e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.484375, + "logps/chosen": -912.0, + "logps/rejected": -1072.0, + "loss": 0.3905, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.1875, + "step": 21040 + }, + { + "epoch": 0.7835327836816736, + "grad_norm": 8.223782485413617, + "learning_rate": 6.803114327569126e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -928.0, + "logps/rejected": -1072.0, + "loss": 0.3895, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.4375, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.0, + "step": 21050 + }, + { + "epoch": 0.7839050082819974, + "grad_norm": 9.971316805166776, + "learning_rate": 6.780855111028863e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.578125, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.4056, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.5, + "step": 21060 + }, + { + "epoch": 0.7842772328823212, + "grad_norm": 8.448092564439245, + "learning_rate": 6.75862665453083e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.828125, + "logps/chosen": -952.0, + "logps/rejected": -1088.0, + "loss": 0.4028, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.59375, + "rewards/rejected": -9.25, + "step": 21070 + }, + { + "epoch": 0.784649457482645, + "grad_norm": 7.03881650671188, + "learning_rate": 6.736428995604143e-08, + "logits/chosen": -3.984375, + "logits/rejected": -3.640625, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.3828, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.25, + "step": 21080 + }, + { + "epoch": 0.7850216820829689, + "grad_norm": 9.20631352772174, + "learning_rate": 6.714262171725904e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -948.0, + "logps/rejected": -1064.0, + "loss": 0.3916, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.53125, + "rewards/rejected": -9.0, + "step": 21090 + }, + { + "epoch": 0.7853939066832927, + "grad_norm": 8.688912887060246, + "learning_rate": 6.692126220321181e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.71875, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.3914, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.71875, + "rewards/rejected": -9.125, + "step": 21100 + }, + { + "epoch": 0.7857661312836165, + "grad_norm": 6.990888326932167, + "learning_rate": 6.67002117876288e-08, + "logits/chosen": -3.671875, + "logits/rejected": -3.46875, + "logps/chosen": -928.0, + "logps/rejected": -1112.0, + "loss": 0.4039, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.375, + "rewards/margins": 2.046875, + "rewards/rejected": -9.4375, + "step": 21110 + }, + { + "epoch": 0.7861383558839403, + "grad_norm": 5.801038338792877, + "learning_rate": 6.647947084371755e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.640625, + "logps/chosen": -952.0, + "logps/rejected": -1088.0, + "loss": 0.3733, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.1875, + "step": 21120 + }, + { + "epoch": 0.7865105804842643, + "grad_norm": 8.430930640850288, + "learning_rate": 6.6259039744163e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.3768, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.4609375, + "rewards/rejected": -9.1875, + "step": 21130 + }, + { + "epoch": 0.7868828050845881, + "grad_norm": 7.479601649180905, + "learning_rate": 6.6038918861127e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.796875, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.3861, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5625, + "rewards/rejected": -9.25, + "step": 21140 + }, + { + "epoch": 0.7872550296849119, + "grad_norm": 7.85588374775539, + "learning_rate": 6.581910856624748e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.46875, + "logps/chosen": -916.0, + "logps/rejected": -1096.0, + "loss": 0.383, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.4375, + "step": 21150 + }, + { + "epoch": 0.7876272542852357, + "grad_norm": 6.937899965454852, + "learning_rate": 6.559960923063829e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.3591, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.609375, + "rewards/rejected": -9.3125, + "step": 21160 + }, + { + "epoch": 0.7879994788855595, + "grad_norm": 6.7874778024240605, + "learning_rate": 6.538042122488786e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.3872, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.75, + "rewards/rejected": -9.5, + "step": 21170 + }, + { + "epoch": 0.7883717034858834, + "grad_norm": 8.795888213229773, + "learning_rate": 6.516154491905943e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.609375, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.3741, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6875, + "rewards/rejected": -9.375, + "step": 21180 + }, + { + "epoch": 0.7887439280862072, + "grad_norm": 9.346947644444208, + "learning_rate": 6.494298068268986e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3868, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.25, + "step": 21190 + }, + { + "epoch": 0.789116152686531, + "grad_norm": 7.076504371381756, + "learning_rate": 6.472472888478888e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.6875, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.3655, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.4375, + "step": 21200 + }, + { + "epoch": 0.7894883772868548, + "grad_norm": 8.031942134792073, + "learning_rate": 6.450678989383901e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.75, + "logps/chosen": -952.0, + "logps/rejected": -1104.0, + "loss": 0.3801, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.5, + "step": 21210 + }, + { + "epoch": 0.7898606018871788, + "grad_norm": 8.435907011508373, + "learning_rate": 6.428916407779452e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.65625, + "logps/chosen": -964.0, + "logps/rejected": -1128.0, + "loss": 0.3958, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.5, + "step": 21220 + }, + { + "epoch": 0.7902328264875026, + "grad_norm": 7.515021465655062, + "learning_rate": 6.407185180408104e-08, + "logits/chosen": -3.953125, + "logits/rejected": -3.65625, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3736, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.5, + "step": 21230 + }, + { + "epoch": 0.7906050510878264, + "grad_norm": 8.002643553370545, + "learning_rate": 6.385485343959457e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.75, + "logps/chosen": -984.0, + "logps/rejected": -1088.0, + "loss": 0.3805, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.4296875, + "rewards/rejected": -9.1875, + "step": 21240 + }, + { + "epoch": 0.7909772756881502, + "grad_norm": 7.733178274349297, + "learning_rate": 6.363816935070152e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.3746, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.375, + "step": 21250 + }, + { + "epoch": 0.7913495002884741, + "grad_norm": 8.497923324758514, + "learning_rate": 6.34217999032372e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.765625, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3657, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.703125, + "rewards/rejected": -9.25, + "step": 21260 + }, + { + "epoch": 0.7917217248887979, + "grad_norm": 7.709453277150648, + "learning_rate": 6.320574546250627e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.4076, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.25, + "step": 21270 + }, + { + "epoch": 0.7920939494891217, + "grad_norm": 7.399149393571295, + "learning_rate": 6.29900063932812e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.515625, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3901, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.4375, + "rewards/margins": 1.921875, + "rewards/rejected": -9.3125, + "step": 21280 + }, + { + "epoch": 0.7924661740894455, + "grad_norm": 7.468768690110057, + "learning_rate": 6.277458305980198e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.59375, + "logps/chosen": -920.0, + "logps/rejected": -1072.0, + "loss": 0.3737, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.609375, + "rewards/rejected": -9.125, + "step": 21290 + }, + { + "epoch": 0.7928383986897694, + "grad_norm": 8.00262264035312, + "learning_rate": 6.255947582577576e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.3741, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.3125, + "step": 21300 + }, + { + "epoch": 0.7932106232900933, + "grad_norm": 7.869906460928921, + "learning_rate": 6.234468505437565e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.875, + "logps/chosen": -944.0, + "logps/rejected": -1120.0, + "loss": 0.3832, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.40625, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.1875, + "step": 21310 + }, + { + "epoch": 0.7935828478904171, + "grad_norm": 7.855413520749451, + "learning_rate": 6.213021110824099e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.59375, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.3659, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.5625, + "step": 21320 + }, + { + "epoch": 0.7939550724907409, + "grad_norm": 8.881522305857926, + "learning_rate": 6.191605434947566e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.46875, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.3609, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.875, + "rewards/margins": 1.734375, + "rewards/rejected": -9.625, + "step": 21330 + }, + { + "epoch": 0.7943272970910648, + "grad_norm": 8.851887089423007, + "learning_rate": 6.170221513964841e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.391, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.4453125, + "rewards/rejected": -9.125, + "step": 21340 + }, + { + "epoch": 0.7946995216913886, + "grad_norm": 9.545828009028906, + "learning_rate": 6.148869383979172e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.71875, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3821, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.65625, + "rewards/rejected": -9.25, + "step": 21350 + }, + { + "epoch": 0.7950717462917124, + "grad_norm": 7.690738372852881, + "learning_rate": 6.127549081040117e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -996.0, + "logps/rejected": -1168.0, + "loss": 0.3903, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.75, + "step": 21360 + }, + { + "epoch": 0.7954439708920362, + "grad_norm": 7.18595021003095, + "learning_rate": 6.106260641143546e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.78125, + "logps/chosen": -988.0, + "logps/rejected": -1144.0, + "loss": 0.3764, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.5625, + "step": 21370 + }, + { + "epoch": 0.79581619549236, + "grad_norm": 7.525377092734981, + "learning_rate": 6.085004100231475e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.3646, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.4375, + "step": 21380 + }, + { + "epoch": 0.796188420092684, + "grad_norm": 6.281116453144437, + "learning_rate": 6.063779494192112e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -964.0, + "logps/rejected": -1128.0, + "loss": 0.3787, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.703125, + "rewards/rejected": -9.5, + "step": 21390 + }, + { + "epoch": 0.7965606446930078, + "grad_norm": 6.8282964878912225, + "learning_rate": 6.042586858859703e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.4033, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.84375, + "rewards/rejected": -9.3125, + "step": 21400 + }, + { + "epoch": 0.7969328692933316, + "grad_norm": 8.38140312135992, + "learning_rate": 6.021426230014572e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.65625, + "logps/chosen": -924.0, + "logps/rejected": -1096.0, + "loss": 0.363, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.1875, + "step": 21410 + }, + { + "epoch": 0.7973050938936554, + "grad_norm": 7.068495129395425, + "learning_rate": 6.000297643382957e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.453125, + "logps/chosen": -920.0, + "logps/rejected": -1104.0, + "loss": 0.3596, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.375, + "rewards/margins": 1.984375, + "rewards/rejected": -9.375, + "step": 21420 + }, + { + "epoch": 0.7976773184939793, + "grad_norm": 7.458588294741837, + "learning_rate": 5.979201134637015e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3895, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.5, + "rewards/margins": 1.671875, + "rewards/rejected": -9.1875, + "step": 21430 + }, + { + "epoch": 0.7980495430943031, + "grad_norm": 8.726943232174335, + "learning_rate": 5.9581367393947616e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -936.0, + "logps/rejected": -1120.0, + "loss": 0.3962, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 2.046875, + "rewards/rejected": -9.5, + "step": 21440 + }, + { + "epoch": 0.7984217676946269, + "grad_norm": 8.635525755596907, + "learning_rate": 5.937104493219952e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.84375, + "logps/chosen": -956.0, + "logps/rejected": -1096.0, + "loss": 0.3696, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.25, + "step": 21450 + }, + { + "epoch": 0.7987939922949507, + "grad_norm": 12.25163092394332, + "learning_rate": 5.916104431622121e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.4011, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.5, + "step": 21460 + }, + { + "epoch": 0.7991662168952746, + "grad_norm": 7.916203604545604, + "learning_rate": 5.895136590056407e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3888, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.4375, + "step": 21470 + }, + { + "epoch": 0.7995384414955985, + "grad_norm": 7.158845599853865, + "learning_rate": 5.8742010039235957e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.75, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3815, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.71875, + "rewards/rejected": -9.3125, + "step": 21480 + }, + { + "epoch": 0.7999106660959223, + "grad_norm": 7.2715942586522635, + "learning_rate": 5.853297708569979e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.65625, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.3742, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 2.09375, + "rewards/rejected": -9.5625, + "step": 21490 + }, + { + "epoch": 0.8002828906962461, + "grad_norm": 7.670673431290395, + "learning_rate": 5.832426739287355e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.3788, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.875, + "rewards/rejected": -9.5625, + "step": 21500 + }, + { + "epoch": 0.80065511529657, + "grad_norm": 7.383268127390173, + "learning_rate": 5.811588131312936e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.53125, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3696, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.875, + "rewards/rejected": -9.5, + "step": 21510 + }, + { + "epoch": 0.8010273398968938, + "grad_norm": 7.863542641628323, + "learning_rate": 5.790781919829299e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -964.0, + "logps/rejected": -1128.0, + "loss": 0.39, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.4375, + "step": 21520 + }, + { + "epoch": 0.8013995644972176, + "grad_norm": 8.307749051086759, + "learning_rate": 5.770008139964333e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -940.0, + "logps/rejected": -1128.0, + "loss": 0.3796, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.5, + "step": 21530 + }, + { + "epoch": 0.8017717890975414, + "grad_norm": 6.93154452572152, + "learning_rate": 5.749266826791146e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.4054, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.375, + "step": 21540 + }, + { + "epoch": 0.8021440136978653, + "grad_norm": 7.184734812830204, + "learning_rate": 5.728558015328061e-08, + "logits/chosen": -4.0, + "logits/rejected": -3.6875, + "logps/chosen": -976.0, + "logps/rejected": -1120.0, + "loss": 0.3966, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.5, + "step": 21550 + }, + { + "epoch": 0.8025162382981891, + "grad_norm": 6.938804890196552, + "learning_rate": 5.707881740538509e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.388, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.8125, + "rewards/margins": 1.453125, + "rewards/rejected": -9.3125, + "step": 21560 + }, + { + "epoch": 0.802888462898513, + "grad_norm": 7.771299813099175, + "learning_rate": 5.687238037331002e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -920.0, + "logps/rejected": -1080.0, + "loss": 0.3861, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.59375, + "rewards/rejected": -9.125, + "step": 21570 + }, + { + "epoch": 0.8032606874988368, + "grad_norm": 7.545997563494077, + "learning_rate": 5.666626940559038e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.65625, + "logps/chosen": -924.0, + "logps/rejected": -1056.0, + "loss": 0.3688, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.5078125, + "rewards/rejected": -9.125, + "step": 21580 + }, + { + "epoch": 0.8036329120991607, + "grad_norm": 9.395540010482339, + "learning_rate": 5.646048485021085e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.4375, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.4006, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.375, + "step": 21590 + }, + { + "epoch": 0.8040051366994845, + "grad_norm": 7.324040400203472, + "learning_rate": 5.625502705460497e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -924.0, + "logps/rejected": -1056.0, + "loss": 0.3982, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.46875, + "rewards/margins": 1.375, + "rewards/rejected": -8.8125, + "step": 21600 + }, + { + "epoch": 0.8043773612998083, + "grad_norm": 8.25138863960593, + "learning_rate": 5.6049896365654577e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -960.0, + "logps/rejected": -1088.0, + "loss": 0.3804, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.625, + "rewards/rejected": -9.1875, + "step": 21610 + }, + { + "epoch": 0.8047495859001321, + "grad_norm": 8.445810399403587, + "learning_rate": 5.584509312968927e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.609375, + "logps/chosen": -916.0, + "logps/rejected": -1064.0, + "loss": 0.3871, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.59375, + "rewards/rejected": -9.0625, + "step": 21620 + }, + { + "epoch": 0.805121810500456, + "grad_norm": 8.53127792517278, + "learning_rate": 5.5640617692485654e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.5625, + "logps/chosen": -932.0, + "logps/rejected": -1104.0, + "loss": 0.3675, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.46875, + "rewards/margins": 1.890625, + "rewards/rejected": -9.375, + "step": 21630 + }, + { + "epoch": 0.8054940351007798, + "grad_norm": 7.842176654888013, + "learning_rate": 5.5436470399267103e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -952.0, + "logps/rejected": -1088.0, + "loss": 0.3865, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.3125, + "step": 21640 + }, + { + "epoch": 0.8058662597011036, + "grad_norm": 8.47351936390772, + "learning_rate": 5.523265159470289e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3908, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.71875, + "rewards/rejected": -9.3125, + "step": 21650 + }, + { + "epoch": 0.8062384843014275, + "grad_norm": 7.930886755581482, + "learning_rate": 5.5029161622907716e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.640625, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.3856, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.609375, + "rewards/rejected": -9.3125, + "step": 21660 + }, + { + "epoch": 0.8066107089017513, + "grad_norm": 7.080664371678285, + "learning_rate": 5.482600082744096e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.4375, + "logps/chosen": -916.0, + "logps/rejected": -1096.0, + "loss": 0.3616, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.375, + "step": 21670 + }, + { + "epoch": 0.8069829335020752, + "grad_norm": 8.118231736235908, + "learning_rate": 5.4623169551306445e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3765, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.375, + "step": 21680 + }, + { + "epoch": 0.807355158102399, + "grad_norm": 8.207252460575733, + "learning_rate": 5.442066813695151e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.46875, + "logps/chosen": -968.0, + "logps/rejected": -1152.0, + "loss": 0.3849, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.78125, + "rewards/margins": 2.0, + "rewards/rejected": -9.75, + "step": 21690 + }, + { + "epoch": 0.8077273827027228, + "grad_norm": 9.194929073054487, + "learning_rate": 5.421849692626665e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3835, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.75, + "step": 21700 + }, + { + "epoch": 0.8080996073030466, + "grad_norm": 7.228471063312755, + "learning_rate": 5.401665626058491e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.78125, + "logps/chosen": -948.0, + "logps/rejected": -1136.0, + "loss": 0.3866, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.71875, + "rewards/margins": 1.859375, + "rewards/rejected": -9.5625, + "step": 21710 + }, + { + "epoch": 0.8084718319033705, + "grad_norm": 7.491877341840319, + "learning_rate": 5.3815146480681056e-08, + "logits/chosen": -3.953125, + "logits/rejected": -3.734375, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3881, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.375, + "step": 21720 + }, + { + "epoch": 0.8088440565036943, + "grad_norm": 8.14711430504842, + "learning_rate": 5.361396792677142e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.372, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.1875, + "step": 21730 + }, + { + "epoch": 0.8092162811040181, + "grad_norm": 7.139363624794363, + "learning_rate": 5.341312093851305e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.515625, + "logps/chosen": -928.0, + "logps/rejected": -1112.0, + "loss": 0.3964, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.34375, + "rewards/margins": 1.921875, + "rewards/rejected": -9.25, + "step": 21740 + }, + { + "epoch": 0.809588505704342, + "grad_norm": 9.368027970963224, + "learning_rate": 5.3212605855003254e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.515625, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3978, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.53125, + "rewards/margins": 1.765625, + "rewards/rejected": -9.3125, + "step": 21750 + }, + { + "epoch": 0.8099607303046659, + "grad_norm": 8.139093973625473, + "learning_rate": 5.301242301477879e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.515625, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3818, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.78125, + "rewards/rejected": -9.25, + "step": 21760 + }, + { + "epoch": 0.8103329549049897, + "grad_norm": 7.676051667445268, + "learning_rate": 5.281257275581563e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.46875, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3975, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.9375, + "rewards/rejected": -9.5625, + "step": 21770 + }, + { + "epoch": 0.8107051795053135, + "grad_norm": 7.635836591331091, + "learning_rate": 5.261305541552824e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.578125, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.3776, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.8125, + "rewards/margins": 1.734375, + "rewards/rejected": -9.5625, + "step": 21780 + }, + { + "epoch": 0.8110774041056373, + "grad_norm": 8.742397448535758, + "learning_rate": 5.241387133076894e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.46875, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.3837, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.53125, + "rewards/rejected": -9.3125, + "step": 21790 + }, + { + "epoch": 0.8114496287059612, + "grad_norm": 8.28732230721892, + "learning_rate": 5.2215020837827527e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.625, + "logps/chosen": -936.0, + "logps/rejected": -1128.0, + "loss": 0.364, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 2.03125, + "rewards/rejected": -9.5625, + "step": 21800 + }, + { + "epoch": 0.811821853306285, + "grad_norm": 7.120447569574624, + "learning_rate": 5.201650427243034e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -956.0, + "logps/rejected": -1096.0, + "loss": 0.3876, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.703125, + "rewards/rejected": -9.375, + "step": 21810 + }, + { + "epoch": 0.8121940779066088, + "grad_norm": 8.415991887782464, + "learning_rate": 5.181832196974015e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.671875, + "logps/chosen": -952.0, + "logps/rejected": -1136.0, + "loss": 0.3913, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.5625, + "step": 21820 + }, + { + "epoch": 0.8125663025069327, + "grad_norm": 7.751388908413297, + "learning_rate": 5.162047426435537e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.3731, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.75, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.5, + "step": 21830 + }, + { + "epoch": 0.8129385271072566, + "grad_norm": 7.821635501625169, + "learning_rate": 5.142296149030945e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.71875, + "logps/chosen": -992.0, + "logps/rejected": -1144.0, + "loss": 0.3895, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.90625, + "rewards/margins": 1.59375, + "rewards/rejected": -9.5, + "step": 21840 + }, + { + "epoch": 0.8133107517075804, + "grad_norm": 8.109827520193788, + "learning_rate": 5.1225783981070245e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3555, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.90625, + "rewards/rejected": -9.625, + "step": 21850 + }, + { + "epoch": 0.8136829763079042, + "grad_norm": 8.255812022456158, + "learning_rate": 5.102894206953975e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.3639, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.5625, + "step": 21860 + }, + { + "epoch": 0.814055200908228, + "grad_norm": 8.66621352703113, + "learning_rate": 5.083243608805332e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -936.0, + "logps/rejected": -1072.0, + "loss": 0.3856, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5078125, + "rewards/rejected": -9.1875, + "step": 21870 + }, + { + "epoch": 0.8144274255085518, + "grad_norm": 8.259224310304848, + "learning_rate": 5.0636266368379085e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.59375, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.3992, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.8125, + "rewards/margins": 1.75, + "rewards/rejected": -9.5625, + "step": 21880 + }, + { + "epoch": 0.8147996501088757, + "grad_norm": 7.660229391811261, + "learning_rate": 5.0440433241717596e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.3885, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.609375, + "rewards/rejected": -9.375, + "step": 21890 + }, + { + "epoch": 0.8151718747091995, + "grad_norm": 9.281232474063378, + "learning_rate": 5.024493703870084e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -984.0, + "logps/rejected": -1136.0, + "loss": 0.3833, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.96875, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.625, + "step": 21900 + }, + { + "epoch": 0.8155440993095233, + "grad_norm": 8.459260049264113, + "learning_rate": 5.004977808939223e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -992.0, + "logps/rejected": -1128.0, + "loss": 0.407, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.90625, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.5, + "step": 21910 + }, + { + "epoch": 0.8159163239098473, + "grad_norm": 7.416334189628268, + "learning_rate": 4.9854956723285687e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.46875, + "logps/chosen": -956.0, + "logps/rejected": -1136.0, + "loss": 0.3717, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.875, + "rewards/rejected": -9.625, + "step": 21920 + }, + { + "epoch": 0.8162885485101711, + "grad_norm": 7.342191426443672, + "learning_rate": 4.966047326930517e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.5, + "logps/chosen": -952.0, + "logps/rejected": -1128.0, + "loss": 0.3771, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.78125, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.6875, + "step": 21930 + }, + { + "epoch": 0.8166607731104949, + "grad_norm": 7.33109556956649, + "learning_rate": 4.94663280558042e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.578125, + "logps/chosen": -976.0, + "logps/rejected": -1144.0, + "loss": 0.3851, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.96875, + "rewards/margins": 1.90625, + "rewards/rejected": -9.875, + "step": 21940 + }, + { + "epoch": 0.8170329977108187, + "grad_norm": 7.086034875288952, + "learning_rate": 4.9272521410565065e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -992.0, + "logps/rejected": -1128.0, + "loss": 0.3788, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.96875, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.5, + "step": 21950 + }, + { + "epoch": 0.8174052223111425, + "grad_norm": 8.423253023914196, + "learning_rate": 4.907905366079859e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.404, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.5, + "step": 21960 + }, + { + "epoch": 0.8177774469114664, + "grad_norm": 8.760946485376412, + "learning_rate": 4.888592513314338e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3751, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.4375, + "step": 21970 + }, + { + "epoch": 0.8181496715117902, + "grad_norm": 7.25364252406904, + "learning_rate": 4.869313615366541e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.546875, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.4106, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.875, + "rewards/margins": 1.5625, + "rewards/rejected": -9.4375, + "step": 21980 + }, + { + "epoch": 0.818521896112114, + "grad_norm": 7.900921295521825, + "learning_rate": 4.8500687047857145e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -972.0, + "logps/rejected": -1112.0, + "loss": 0.4049, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.515625, + "rewards/rejected": -9.3125, + "step": 21990 + }, + { + "epoch": 0.8188941207124378, + "grad_norm": 8.141610571198358, + "learning_rate": 4.830857814063744e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.75, + "logps/chosen": -980.0, + "logps/rejected": -1080.0, + "loss": 0.3952, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.3515625, + "rewards/rejected": -9.1875, + "step": 22000 + }, + { + "epoch": 0.8192663453127618, + "grad_norm": 8.414617263268871, + "learning_rate": 4.8116809756350767e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.84375, + "logps/chosen": -992.0, + "logps/rejected": -1128.0, + "loss": 0.3981, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.9375, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.5625, + "step": 22010 + }, + { + "epoch": 0.8196385699130856, + "grad_norm": 7.1666391629131825, + "learning_rate": 4.7925382218766604e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3867, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.4375, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.1875, + "step": 22020 + }, + { + "epoch": 0.8200107945134094, + "grad_norm": 6.9540436968370285, + "learning_rate": 4.7734295851079046e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.515625, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.393, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.4921875, + "rewards/rejected": -9.25, + "step": 22030 + }, + { + "epoch": 0.8203830191137332, + "grad_norm": 7.987981480848643, + "learning_rate": 4.7543550975906013e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.5625, + "logps/chosen": -976.0, + "logps/rejected": -1152.0, + "loss": 0.374, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -8.0, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.8125, + "step": 22040 + }, + { + "epoch": 0.8207552437140571, + "grad_norm": 7.5582257218927165, + "learning_rate": 4.735314791528908e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.46875, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3847, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.75, + "rewards/rejected": -9.25, + "step": 22050 + }, + { + "epoch": 0.8211274683143809, + "grad_norm": 7.302574112386361, + "learning_rate": 4.716308699069257e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3998, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.78125, + "rewards/rejected": -9.4375, + "step": 22060 + }, + { + "epoch": 0.8214996929147047, + "grad_norm": 7.707039088124113, + "learning_rate": 4.6973368523003376e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.328125, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.3735, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.625, + "rewards/rejected": -9.3125, + "step": 22070 + }, + { + "epoch": 0.8218719175150285, + "grad_norm": 7.1691476773656015, + "learning_rate": 4.6783992832529845e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.5, + "logps/chosen": -936.0, + "logps/rejected": -1136.0, + "loss": 0.3786, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.65625, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.625, + "step": 22080 + }, + { + "epoch": 0.8222441421153523, + "grad_norm": 7.490246978484917, + "learning_rate": 4.6594960239001975e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3982, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.5, + "step": 22090 + }, + { + "epoch": 0.8226163667156763, + "grad_norm": 8.66371419962431, + "learning_rate": 4.6406271061570166e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -984.0, + "logps/rejected": -1112.0, + "loss": 0.3908, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.84375, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.4375, + "step": 22100 + }, + { + "epoch": 0.8229885913160001, + "grad_norm": 8.273479884873563, + "learning_rate": 4.6217925618805356e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.765625, + "logps/chosen": -956.0, + "logps/rejected": -1072.0, + "loss": 0.4069, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 1.3828125, + "rewards/rejected": -9.0, + "step": 22110 + }, + { + "epoch": 0.8233608159163239, + "grad_norm": 8.36343937262187, + "learning_rate": 4.6029924228698e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.578125, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3827, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.4375, + "step": 22120 + }, + { + "epoch": 0.8237330405166478, + "grad_norm": 8.344846397083662, + "learning_rate": 4.5842267208657524e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.6875, + "logps/chosen": -964.0, + "logps/rejected": -1080.0, + "loss": 0.3873, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5, + "rewards/rejected": -9.1875, + "step": 22130 + }, + { + "epoch": 0.8241052651169716, + "grad_norm": 7.802170206864785, + "learning_rate": 4.565495487551213e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.59375, + "logps/chosen": -912.0, + "logps/rejected": -1056.0, + "loss": 0.3876, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.65625, + "rewards/rejected": -9.0625, + "step": 22140 + }, + { + "epoch": 0.8244774897172954, + "grad_norm": 7.161362213631662, + "learning_rate": 4.546798754550801e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3781, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.9765625, + "rewards/rejected": -9.5, + "step": 22150 + }, + { + "epoch": 0.8248497143176192, + "grad_norm": 6.332289107080237, + "learning_rate": 4.5281365534308946e-08, + "logits/chosen": -3.96875, + "logits/rejected": -3.625, + "logps/chosen": -940.0, + "logps/rejected": -1120.0, + "loss": 0.3614, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.890625, + "rewards/rejected": -9.6875, + "step": 22160 + }, + { + "epoch": 0.825221938917943, + "grad_norm": 7.8646491348246945, + "learning_rate": 4.5095089156995505e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -976.0, + "logps/rejected": -1112.0, + "loss": 0.3866, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.9375, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.5625, + "step": 22170 + }, + { + "epoch": 0.825594163518267, + "grad_norm": 7.724229859464605, + "learning_rate": 4.490915872806497e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.6875, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3834, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.625, + "rewards/margins": 1.703125, + "rewards/rejected": -9.3125, + "step": 22180 + }, + { + "epoch": 0.8259663881185908, + "grad_norm": 6.946791617051151, + "learning_rate": 4.4723574561430246e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.890625, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3772, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.375, + "step": 22190 + }, + { + "epoch": 0.8263386127189146, + "grad_norm": 7.888994067622612, + "learning_rate": 4.4538336970420004e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -956.0, + "logps/rejected": -1144.0, + "loss": 0.3682, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.625, + "rewards/margins": 2.03125, + "rewards/rejected": -9.6875, + "step": 22200 + }, + { + "epoch": 0.8267108373192384, + "grad_norm": 8.473637547091336, + "learning_rate": 4.435344626777754e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.3886, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.65625, + "rewards/margins": 1.65625, + "rewards/rejected": -9.3125, + "step": 22210 + }, + { + "epoch": 0.8270830619195623, + "grad_norm": 7.54840442443646, + "learning_rate": 4.41689027656604e-08, + "logits/chosen": -3.65625, + "logits/rejected": -3.609375, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3907, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.3125, + "step": 22220 + }, + { + "epoch": 0.8274552865198861, + "grad_norm": 6.124764322613412, + "learning_rate": 4.398470677564023e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.734375, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3514, + "rewards/accuracies": 0.8812500238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 2.046875, + "rewards/rejected": -9.75, + "step": 22230 + }, + { + "epoch": 0.8278275111202099, + "grad_norm": 8.477275432889517, + "learning_rate": 4.380085860870156e-08, + "logits/chosen": -3.96875, + "logits/rejected": -3.671875, + "logps/chosen": -916.0, + "logps/rejected": -1096.0, + "loss": 0.3814, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.3125, + "rewards/margins": 2.015625, + "rewards/rejected": -9.375, + "step": 22240 + }, + { + "epoch": 0.8281997357205337, + "grad_norm": 7.899745014812589, + "learning_rate": 4.361735857524221e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.53125, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3874, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.4375, + "step": 22250 + }, + { + "epoch": 0.8285719603208576, + "grad_norm": 7.259018744441789, + "learning_rate": 4.3434206985071667e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.578125, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3679, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.3125, + "step": 22260 + }, + { + "epoch": 0.8289441849211815, + "grad_norm": 8.126572976754941, + "learning_rate": 4.325140414741152e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.59375, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.3985, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.71875, + "rewards/rejected": -9.3125, + "step": 22270 + }, + { + "epoch": 0.8293164095215053, + "grad_norm": 8.987699426090657, + "learning_rate": 4.3068950370894476e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.5625, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3929, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.78125, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.375, + "step": 22280 + }, + { + "epoch": 0.8296886341218291, + "grad_norm": 8.62917494609193, + "learning_rate": 4.288684596356365e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.34375, + "logps/chosen": -924.0, + "logps/rejected": -1120.0, + "loss": 0.3814, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.859375, + "rewards/rejected": -9.4375, + "step": 22290 + }, + { + "epoch": 0.830060858722153, + "grad_norm": 6.748824102690535, + "learning_rate": 4.270509123287277e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -988.0, + "logps/rejected": -1136.0, + "loss": 0.376, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.75, + "rewards/rejected": -9.5, + "step": 22300 + }, + { + "epoch": 0.8304330833224768, + "grad_norm": 8.826158549637205, + "learning_rate": 4.2523686485684745e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.5, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3918, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.84375, + "rewards/rejected": -9.625, + "step": 22310 + }, + { + "epoch": 0.8308053079228006, + "grad_norm": 7.46883261922193, + "learning_rate": 4.23426320282719e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.734375, + "logps/chosen": -984.0, + "logps/rejected": -1144.0, + "loss": 0.3872, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.875, + "rewards/margins": 1.65625, + "rewards/rejected": -9.5, + "step": 22320 + }, + { + "epoch": 0.8311775325231244, + "grad_norm": 8.698144534568675, + "learning_rate": 4.2161928166314834e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.578125, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3986, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.4375, + "step": 22330 + }, + { + "epoch": 0.8315497571234483, + "grad_norm": 8.316780220489903, + "learning_rate": 4.1981575204902695e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -936.0, + "logps/rejected": -1088.0, + "loss": 0.38, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.703125, + "rewards/rejected": -9.3125, + "step": 22340 + }, + { + "epoch": 0.8319219817237721, + "grad_norm": 8.818721119513864, + "learning_rate": 4.1801573448531744e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.625, + "logps/chosen": -964.0, + "logps/rejected": -1144.0, + "loss": 0.3758, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.5, + "step": 22350 + }, + { + "epoch": 0.832294206324096, + "grad_norm": 8.014180447078797, + "learning_rate": 4.1621923201105466e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.640625, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3771, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.375, + "step": 22360 + }, + { + "epoch": 0.8326664309244198, + "grad_norm": 7.395196918998407, + "learning_rate": 4.144262476593402e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.59375, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.4057, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.625, + "rewards/margins": 1.84375, + "rewards/rejected": -9.5, + "step": 22370 + }, + { + "epoch": 0.8330386555247437, + "grad_norm": 7.785244864895281, + "learning_rate": 4.126367844573322e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.59375, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3817, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.4375, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.25, + "step": 22380 + }, + { + "epoch": 0.8334108801250675, + "grad_norm": 7.139314042393561, + "learning_rate": 4.108508454262485e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.65625, + "logps/chosen": -912.0, + "logps/rejected": -1112.0, + "loss": 0.3758, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.40625, + "rewards/margins": 1.96875, + "rewards/rejected": -9.375, + "step": 22390 + }, + { + "epoch": 0.8337831047253913, + "grad_norm": 7.945439356840114, + "learning_rate": 4.090684335813532e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.59375, + "logps/chosen": -956.0, + "logps/rejected": -1080.0, + "loss": 0.3838, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.1875, + "step": 22400 + }, + { + "epoch": 0.8341553293257151, + "grad_norm": 9.233922082688919, + "learning_rate": 4.0728955193195803e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.765625, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.3932, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.4375, + "step": 22410 + }, + { + "epoch": 0.834527553926039, + "grad_norm": 8.087577996388815, + "learning_rate": 4.055142034814119e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -960.0, + "logps/rejected": -1088.0, + "loss": 0.3953, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.609375, + "rewards/rejected": -9.3125, + "step": 22420 + }, + { + "epoch": 0.8348997785263628, + "grad_norm": 7.79257402931684, + "learning_rate": 4.0374239122710015e-08, + "logits/chosen": -3.984375, + "logits/rejected": -3.796875, + "logps/chosen": -940.0, + "logps/rejected": -1128.0, + "loss": 0.3749, + "rewards/accuracies": 0.875, + "rewards/chosen": -7.4375, + "rewards/margins": 2.09375, + "rewards/rejected": -9.5, + "step": 22430 + }, + { + "epoch": 0.8352720031266866, + "grad_norm": 7.08253603904175, + "learning_rate": 4.019741181604383e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3915, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.8125, + "rewards/margins": 1.734375, + "rewards/rejected": -9.5625, + "step": 22440 + }, + { + "epoch": 0.8356442277270105, + "grad_norm": 8.531559760161736, + "learning_rate": 4.002093872668655e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.671875, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.4017, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.4375, + "step": 22450 + }, + { + "epoch": 0.8360164523273343, + "grad_norm": 9.848186504569375, + "learning_rate": 3.984482015258411e-08, + "logits/chosen": -3.671875, + "logits/rejected": -3.703125, + "logps/chosen": -976.0, + "logps/rejected": -1120.0, + "loss": 0.3995, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.828125, + "rewards/rejected": -9.5, + "step": 22460 + }, + { + "epoch": 0.8363886769276582, + "grad_norm": 7.420027708912492, + "learning_rate": 3.966905639108384e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.625, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3987, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.90625, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.5, + "step": 22470 + }, + { + "epoch": 0.836760901527982, + "grad_norm": 10.037671937655398, + "learning_rate": 3.9493647738934046e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.3879, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.71875, + "rewards/margins": 1.53125, + "rewards/rejected": -9.25, + "step": 22480 + }, + { + "epoch": 0.8371331261283058, + "grad_norm": 7.86559931408963, + "learning_rate": 3.931859449228353e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.75, + "logps/chosen": -980.0, + "logps/rejected": -1128.0, + "loss": 0.3818, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.8125, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.6875, + "step": 22490 + }, + { + "epoch": 0.8375053507286296, + "grad_norm": 7.108645220874712, + "learning_rate": 3.91438969466811e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.546875, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.3823, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.4296875, + "rewards/rejected": -9.25, + "step": 22500 + }, + { + "epoch": 0.8378775753289535, + "grad_norm": 6.535619624834789, + "learning_rate": 3.896955539707483e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.546875, + "logps/chosen": -948.0, + "logps/rejected": -1080.0, + "loss": 0.3776, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.46875, + "rewards/rejected": -9.3125, + "step": 22510 + }, + { + "epoch": 0.8382497999292773, + "grad_norm": 7.32161716519995, + "learning_rate": 3.879557013781193e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.546875, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.3776, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.828125, + "rewards/rejected": -9.625, + "step": 22520 + }, + { + "epoch": 0.8386220245296011, + "grad_norm": 8.551366395470554, + "learning_rate": 3.862194146263803e-08, + "logits/chosen": -3.96875, + "logits/rejected": -3.75, + "logps/chosen": -976.0, + "logps/rejected": -1104.0, + "loss": 0.3703, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.84375, + "rewards/margins": 1.453125, + "rewards/rejected": -9.3125, + "step": 22530 + }, + { + "epoch": 0.838994249129925, + "grad_norm": 7.3589981510904074, + "learning_rate": 3.844866966469668e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.3881, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.5, + "step": 22540 + }, + { + "epoch": 0.8393664737302489, + "grad_norm": 7.660731823126742, + "learning_rate": 3.827575503652902e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.3905, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.8125, + "rewards/margins": 1.8125, + "rewards/rejected": -9.625, + "step": 22550 + }, + { + "epoch": 0.8397386983305727, + "grad_norm": 7.755866966312417, + "learning_rate": 3.810319787007293e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.703125, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.3779, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.71875, + "rewards/rejected": -9.5625, + "step": 22560 + }, + { + "epoch": 0.8401109229308965, + "grad_norm": 7.452165822311574, + "learning_rate": 3.7930998456663033e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -964.0, + "logps/rejected": -1128.0, + "loss": 0.3643, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.796875, + "rewards/rejected": -9.625, + "step": 22570 + }, + { + "epoch": 0.8404831475312203, + "grad_norm": 8.295257572721892, + "learning_rate": 3.7759157087029784e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.546875, + "logps/chosen": -984.0, + "logps/rejected": -1120.0, + "loss": 0.3853, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -8.0, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.6875, + "step": 22580 + }, + { + "epoch": 0.8408553721315442, + "grad_norm": 9.429769279145063, + "learning_rate": 3.7587674051299254e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.609375, + "logps/chosen": -944.0, + "logps/rejected": -1120.0, + "loss": 0.4071, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5, + "rewards/margins": 2.015625, + "rewards/rejected": -9.5625, + "step": 22590 + }, + { + "epoch": 0.841227596731868, + "grad_norm": 8.194327466583253, + "learning_rate": 3.7416549638992406e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.640625, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3989, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.5625, + "step": 22600 + }, + { + "epoch": 0.8415998213321918, + "grad_norm": 7.984678075267944, + "learning_rate": 3.724578413902477e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.65625, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.4059, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.4375, + "step": 22610 + }, + { + "epoch": 0.8419720459325157, + "grad_norm": 7.891787583750504, + "learning_rate": 3.7075377839705964e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.3731, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.625, + "rewards/rejected": -9.125, + "step": 22620 + }, + { + "epoch": 0.8423442705328396, + "grad_norm": 8.196379644294845, + "learning_rate": 3.690533102873911e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.53125, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3803, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.3125, + "step": 22630 + }, + { + "epoch": 0.8427164951331634, + "grad_norm": 6.899028729623778, + "learning_rate": 3.673564399322046e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.453125, + "logps/chosen": -928.0, + "logps/rejected": -1128.0, + "loss": 0.383, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 2.0, + "rewards/rejected": -9.625, + "step": 22640 + }, + { + "epoch": 0.8430887197334872, + "grad_norm": 8.064632974993069, + "learning_rate": 3.6566317019638634e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.578125, + "logps/chosen": -972.0, + "logps/rejected": -1112.0, + "loss": 0.3959, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.71875, + "rewards/margins": 1.6875, + "rewards/rejected": -9.4375, + "step": 22650 + }, + { + "epoch": 0.843460944333811, + "grad_norm": 6.407347229521458, + "learning_rate": 3.639735039387462e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.53125, + "logps/chosen": -916.0, + "logps/rejected": -1088.0, + "loss": 0.3731, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.25, + "step": 22660 + }, + { + "epoch": 0.8438331689341348, + "grad_norm": 7.731913708046398, + "learning_rate": 3.6228744401200826e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.515625, + "logps/chosen": -940.0, + "logps/rejected": -1128.0, + "loss": 0.3941, + "rewards/accuracies": 0.8812500238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.9765625, + "rewards/rejected": -9.625, + "step": 22670 + }, + { + "epoch": 0.8442053935344587, + "grad_norm": 8.095392367291199, + "learning_rate": 3.606049932628094e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.6875, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.369, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.84375, + "rewards/rejected": -9.3125, + "step": 22680 + }, + { + "epoch": 0.8445776181347825, + "grad_norm": 7.278351963105301, + "learning_rate": 3.58926154531691e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.546875, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3718, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.5625, + "step": 22690 + }, + { + "epoch": 0.8449498427351063, + "grad_norm": 8.88402489012204, + "learning_rate": 3.572509306530977e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.3872, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.78125, + "rewards/rejected": -9.3125, + "step": 22700 + }, + { + "epoch": 0.8453220673354302, + "grad_norm": 9.496584000361478, + "learning_rate": 3.555793244553712e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.71875, + "logps/chosen": -956.0, + "logps/rejected": -1136.0, + "loss": 0.3829, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.75, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.6875, + "step": 22710 + }, + { + "epoch": 0.8456942919357541, + "grad_norm": 7.338831387421984, + "learning_rate": 3.53911338760744e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -952.0, + "logps/rejected": -1104.0, + "loss": 0.3873, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.640625, + "rewards/rejected": -9.25, + "step": 22720 + }, + { + "epoch": 0.8460665165360779, + "grad_norm": 7.1818151108290245, + "learning_rate": 3.522469763853381e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.4047, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.375, + "step": 22730 + }, + { + "epoch": 0.8464387411364017, + "grad_norm": 8.76039515765638, + "learning_rate": 3.5058624013915516e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.5625, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.3719, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.25, + "step": 22740 + }, + { + "epoch": 0.8468109657367255, + "grad_norm": 7.377557131269985, + "learning_rate": 3.4892913282607714e-08, + "logits/chosen": -3.984375, + "logits/rejected": -3.875, + "logps/chosen": -1004.0, + "logps/rejected": -1128.0, + "loss": 0.398, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -8.0625, + "rewards/margins": 1.3515625, + "rewards/rejected": -9.4375, + "step": 22750 + }, + { + "epoch": 0.8471831903370494, + "grad_norm": 9.832517734822334, + "learning_rate": 3.472756572438579e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.3949, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.75, + "rewards/rejected": -9.25, + "step": 22760 + }, + { + "epoch": 0.8475554149373732, + "grad_norm": 7.364990500637907, + "learning_rate": 3.4562581618412136e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3882, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.46875, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.0, + "step": 22770 + }, + { + "epoch": 0.847927639537697, + "grad_norm": 7.682500299309095, + "learning_rate": 3.4397961243235244e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.671875, + "logps/chosen": -940.0, + "logps/rejected": -1120.0, + "loss": 0.3781, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.4375, + "step": 22780 + }, + { + "epoch": 0.8482998641380208, + "grad_norm": 8.361603081995874, + "learning_rate": 3.423370487678972e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.765625, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.3854, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.609375, + "rewards/rejected": -9.375, + "step": 22790 + }, + { + "epoch": 0.8486720887383448, + "grad_norm": 7.162098568776144, + "learning_rate": 3.406981279639554e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.53125, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.417, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.3125, + "step": 22800 + }, + { + "epoch": 0.8490443133386686, + "grad_norm": 8.023038139397185, + "learning_rate": 3.390628527875764e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.8125, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3698, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.3125, + "step": 22810 + }, + { + "epoch": 0.8494165379389924, + "grad_norm": 7.503261719509011, + "learning_rate": 3.374312259996548e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.765625, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3778, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.546875, + "rewards/rejected": -9.25, + "step": 22820 + }, + { + "epoch": 0.8497887625393162, + "grad_norm": 7.545575033391787, + "learning_rate": 3.358032503549246e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.6875, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3818, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.625, + "rewards/margins": 1.6875, + "rewards/rejected": -9.3125, + "step": 22830 + }, + { + "epoch": 0.8501609871396401, + "grad_norm": 6.604086146481576, + "learning_rate": 3.3417892860195615e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.3579, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.3125, + "step": 22840 + }, + { + "epoch": 0.8505332117399639, + "grad_norm": 8.373297998723224, + "learning_rate": 3.325582634831508e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.65625, + "logps/chosen": -960.0, + "logps/rejected": -1128.0, + "loss": 0.3732, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.5, + "step": 22850 + }, + { + "epoch": 0.8509054363402877, + "grad_norm": 7.423083309738103, + "learning_rate": 3.309412577347365e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.640625, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3512, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.5, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.3125, + "step": 22860 + }, + { + "epoch": 0.8512776609406115, + "grad_norm": 9.428748799259077, + "learning_rate": 3.2932791408676275e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3719, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.3125, + "step": 22870 + }, + { + "epoch": 0.8516498855409353, + "grad_norm": 8.883740819567608, + "learning_rate": 3.277182352630953e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -964.0, + "logps/rejected": -1144.0, + "loss": 0.3827, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.859375, + "rewards/rejected": -9.625, + "step": 22880 + }, + { + "epoch": 0.8520221101412593, + "grad_norm": 7.042690284835938, + "learning_rate": 3.261122239814135e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.84375, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.3552, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.3125, + "step": 22890 + }, + { + "epoch": 0.8523943347415831, + "grad_norm": 7.134969799451995, + "learning_rate": 3.2450988295320446e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -940.0, + "logps/rejected": -1120.0, + "loss": 0.3666, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.625, + "rewards/margins": 1.859375, + "rewards/rejected": -9.5, + "step": 22900 + }, + { + "epoch": 0.8527665593419069, + "grad_norm": 6.894453134653101, + "learning_rate": 3.229112148837593e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.609375, + "logps/chosen": -980.0, + "logps/rejected": -1112.0, + "loss": 0.4021, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.4375, + "step": 22910 + }, + { + "epoch": 0.8531387839422307, + "grad_norm": 8.01465164039426, + "learning_rate": 3.2131622247216576e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3706, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.375, + "step": 22920 + }, + { + "epoch": 0.8535110085425546, + "grad_norm": 7.235677663614719, + "learning_rate": 3.197249084113082e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3796, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.25, + "step": 22930 + }, + { + "epoch": 0.8538832331428784, + "grad_norm": 7.559830163966948, + "learning_rate": 3.1813727538785943e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.765625, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3721, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.71875, + "rewards/rejected": -9.375, + "step": 22940 + }, + { + "epoch": 0.8542554577432022, + "grad_norm": 9.088203859747761, + "learning_rate": 3.165533260822784e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.5625, + "logps/chosen": -920.0, + "logps/rejected": -1104.0, + "loss": 0.3794, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.9375, + "rewards/rejected": -9.4375, + "step": 22950 + }, + { + "epoch": 0.854627682343526, + "grad_norm": 7.202206767305839, + "learning_rate": 3.1497306316880385e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.65625, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.3683, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.625, + "step": 22960 + }, + { + "epoch": 0.85499990694385, + "grad_norm": 6.836963549660777, + "learning_rate": 3.133964893154503e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.5, + "logps/chosen": -996.0, + "logps/rejected": -1160.0, + "loss": 0.3733, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.9375, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.6875, + "step": 22970 + }, + { + "epoch": 0.8553721315441738, + "grad_norm": 8.031521318603092, + "learning_rate": 3.118236071840052e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.84375, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3944, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.75, + "rewards/rejected": -9.4375, + "step": 22980 + }, + { + "epoch": 0.8557443561444976, + "grad_norm": 9.151113074217673, + "learning_rate": 3.102544194300219e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -980.0, + "logps/rejected": -1144.0, + "loss": 0.3662, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.90625, + "rewards/rejected": -9.6875, + "step": 22990 + }, + { + "epoch": 0.8561165807448214, + "grad_norm": 7.0083281593171165, + "learning_rate": 3.0868892870281774e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.5625, + "logps/chosen": -956.0, + "logps/rejected": -1184.0, + "loss": 0.3734, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.90625, + "rewards/margins": 2.171875, + "rewards/rejected": -10.0625, + "step": 23000 + }, + { + "epoch": 0.8564888053451453, + "grad_norm": 9.008110146832417, + "learning_rate": 3.071271376454665e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.59375, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3728, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.75, + "rewards/margins": 1.984375, + "rewards/rejected": -9.75, + "step": 23010 + }, + { + "epoch": 0.8568610299454691, + "grad_norm": 8.175472584309263, + "learning_rate": 3.0556904889479736e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3805, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.59375, + "rewards/margins": 1.9609375, + "rewards/rejected": -9.5625, + "step": 23020 + }, + { + "epoch": 0.8572332545457929, + "grad_norm": 7.025577755484629, + "learning_rate": 3.040146650813866e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.4, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.640625, + "rewards/rejected": -9.375, + "step": 23030 + }, + { + "epoch": 0.8576054791461167, + "grad_norm": 8.408211292605815, + "learning_rate": 3.02463988829558e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.59375, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.4153, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.4375, + "step": 23040 + }, + { + "epoch": 0.8579777037464406, + "grad_norm": 6.594067946771017, + "learning_rate": 3.009170227573749e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.361, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 1.875, + "rewards/rejected": -9.5, + "step": 23050 + }, + { + "epoch": 0.8583499283467645, + "grad_norm": 8.276374859216219, + "learning_rate": 2.993737694766349e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -928.0, + "logps/rejected": -1096.0, + "loss": 0.3768, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.40625, + "rewards/margins": 1.84375, + "rewards/rejected": -9.25, + "step": 23060 + }, + { + "epoch": 0.8587221529470883, + "grad_norm": 6.989512747948214, + "learning_rate": 2.978342315928692e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.578125, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3761, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.578125, + "rewards/rejected": -9.25, + "step": 23070 + }, + { + "epoch": 0.8590943775474121, + "grad_norm": 7.852507668797501, + "learning_rate": 2.9629841170533408e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -952.0, + "logps/rejected": -1128.0, + "loss": 0.3819, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.71875, + "rewards/margins": 1.921875, + "rewards/rejected": -9.625, + "step": 23080 + }, + { + "epoch": 0.859466602147736, + "grad_norm": 8.286351261584846, + "learning_rate": 2.9476631240701212e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.374, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.1875, + "step": 23090 + }, + { + "epoch": 0.8598388267480598, + "grad_norm": 7.816207389365674, + "learning_rate": 2.9323793628460018e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.3747, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.4375, + "step": 23100 + }, + { + "epoch": 0.8602110513483836, + "grad_norm": 7.2818153013743245, + "learning_rate": 2.917132859185123e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -924.0, + "logps/rejected": -1072.0, + "loss": 0.401, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.1875, + "step": 23110 + }, + { + "epoch": 0.8605832759487074, + "grad_norm": 7.996087241585381, + "learning_rate": 2.9019236388286907e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3815, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.375, + "step": 23120 + }, + { + "epoch": 0.8609555005490312, + "grad_norm": 8.954523667661592, + "learning_rate": 2.886751727455003e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.578125, + "logps/chosen": -952.0, + "logps/rejected": -1104.0, + "loss": 0.4096, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.5, + "step": 23130 + }, + { + "epoch": 0.8613277251493551, + "grad_norm": 7.009420786021144, + "learning_rate": 2.8716171506793423e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3874, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.625, + "rewards/rejected": -9.3125, + "step": 23140 + }, + { + "epoch": 0.861699949749679, + "grad_norm": 8.02362416129298, + "learning_rate": 2.8565199340539553e-08, + "logits/chosen": -3.984375, + "logits/rejected": -3.875, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3771, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.78125, + "rewards/rejected": -9.375, + "step": 23150 + }, + { + "epoch": 0.8620721743500028, + "grad_norm": 7.37606317206679, + "learning_rate": 2.8414601030680273e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.59375, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3778, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.5, + "step": 23160 + }, + { + "epoch": 0.8624443989503267, + "grad_norm": 8.455780155171958, + "learning_rate": 2.8264376831476034e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -956.0, + "logps/rejected": -1096.0, + "loss": 0.3769, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.4375, + "step": 23170 + }, + { + "epoch": 0.8628166235506505, + "grad_norm": 7.1705599388362735, + "learning_rate": 2.8114526996556002e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.453125, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3769, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.875, + "rewards/rejected": -9.4375, + "step": 23180 + }, + { + "epoch": 0.8631888481509743, + "grad_norm": 8.161453703849475, + "learning_rate": 2.796505177891692e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -964.0, + "logps/rejected": -1128.0, + "loss": 0.3815, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.75, + "rewards/margins": 1.890625, + "rewards/rejected": -9.625, + "step": 23190 + }, + { + "epoch": 0.8635610727512981, + "grad_norm": 7.235544059057991, + "learning_rate": 2.7815951430923247e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.75, + "logps/chosen": -944.0, + "logps/rejected": -1080.0, + "loss": 0.382, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.5625, + "rewards/margins": 1.625, + "rewards/rejected": -9.1875, + "step": 23200 + }, + { + "epoch": 0.8639332973516219, + "grad_norm": 8.558291685305683, + "learning_rate": 2.7667226204306588e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.3933, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.84375, + "rewards/margins": 1.59375, + "rewards/rejected": -9.4375, + "step": 23210 + }, + { + "epoch": 0.8643055219519458, + "grad_norm": 7.934375788243854, + "learning_rate": 2.7518876350164923e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.484375, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.383, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.4375, + "step": 23220 + }, + { + "epoch": 0.8646777465522696, + "grad_norm": 8.49402132109239, + "learning_rate": 2.737090211896295e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.6875, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.3868, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.4375, + "step": 23230 + }, + { + "epoch": 0.8650499711525935, + "grad_norm": 7.324709795907441, + "learning_rate": 2.7223303760530726e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.578125, + "logps/chosen": -940.0, + "logps/rejected": -1120.0, + "loss": 0.392, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 2.0, + "rewards/rejected": -9.625, + "step": 23240 + }, + { + "epoch": 0.8654221957529173, + "grad_norm": 8.419987161609146, + "learning_rate": 2.7076081524064016e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.53125, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.397, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.5, + "step": 23250 + }, + { + "epoch": 0.8657944203532412, + "grad_norm": 8.120961578927778, + "learning_rate": 2.692923565812333e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.609375, + "logps/chosen": -960.0, + "logps/rejected": -1144.0, + "loss": 0.3774, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.71875, + "rewards/margins": 1.875, + "rewards/rejected": -9.625, + "step": 23260 + }, + { + "epoch": 0.866166644953565, + "grad_norm": 7.432177674973987, + "learning_rate": 2.678276641063404e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.53125, + "logps/chosen": -940.0, + "logps/rejected": -1128.0, + "loss": 0.3674, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.890625, + "rewards/rejected": -9.5625, + "step": 23270 + }, + { + "epoch": 0.8665388695538888, + "grad_norm": 7.8277850457451, + "learning_rate": 2.663667402888531e-08, + "logits/chosen": -3.671875, + "logits/rejected": -3.703125, + "logps/chosen": -952.0, + "logps/rejected": -1080.0, + "loss": 0.3885, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.25, + "step": 23280 + }, + { + "epoch": 0.8669110941542126, + "grad_norm": 7.618575853065507, + "learning_rate": 2.649095875953028e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.75, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3882, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.25, + "step": 23290 + }, + { + "epoch": 0.8672833187545365, + "grad_norm": 7.697885187086435, + "learning_rate": 2.634562084858538e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -968.0, + "logps/rejected": -1096.0, + "loss": 0.3883, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.5625, + "rewards/rejected": -9.4375, + "step": 23300 + }, + { + "epoch": 0.8676555433548603, + "grad_norm": 8.23114887860297, + "learning_rate": 2.6200660541429692e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -960.0, + "logps/rejected": -1136.0, + "loss": 0.3732, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.78125, + "rewards/margins": 1.96875, + "rewards/rejected": -9.75, + "step": 23310 + }, + { + "epoch": 0.8680277679551841, + "grad_norm": 9.164896557866575, + "learning_rate": 2.605607808280516e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -964.0, + "logps/rejected": -1136.0, + "loss": 0.3944, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.953125, + "rewards/rejected": -9.5, + "step": 23320 + }, + { + "epoch": 0.868399992555508, + "grad_norm": 7.559894670977543, + "learning_rate": 2.5911873716815442e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3833, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.796875, + "rewards/rejected": -9.375, + "step": 23330 + }, + { + "epoch": 0.8687722171558319, + "grad_norm": 7.256527179112857, + "learning_rate": 2.5768047686926086e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.640625, + "logps/chosen": -936.0, + "logps/rejected": -1120.0, + "loss": 0.3727, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.75, + "rewards/rejected": -9.375, + "step": 23340 + }, + { + "epoch": 0.8691444417561557, + "grad_norm": 7.042434515586065, + "learning_rate": 2.562460023596369e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.421875, + "logps/chosen": -912.0, + "logps/rejected": -1080.0, + "loss": 0.3949, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.890625, + "rewards/rejected": -9.375, + "step": 23350 + }, + { + "epoch": 0.8695166663564795, + "grad_norm": 6.290132048129441, + "learning_rate": 2.5481531606115825e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3954, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.71875, + "rewards/margins": 1.734375, + "rewards/rejected": -9.5, + "step": 23360 + }, + { + "epoch": 0.8698888909568033, + "grad_norm": 7.592129336101318, + "learning_rate": 2.533884203893044e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -928.0, + "logps/rejected": -1096.0, + "loss": 0.3848, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.375, + "step": 23370 + }, + { + "epoch": 0.8702611155571272, + "grad_norm": 8.05046030097679, + "learning_rate": 2.5196531775315528e-08, + "logits/chosen": -3.6875, + "logits/rejected": -3.59375, + "logps/chosen": -964.0, + "logps/rejected": -1096.0, + "loss": 0.3849, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.4375, + "step": 23380 + }, + { + "epoch": 0.870633340157451, + "grad_norm": 8.334980120104557, + "learning_rate": 2.5054601055538667e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.5625, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.364, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.5, + "step": 23390 + }, + { + "epoch": 0.8710055647577748, + "grad_norm": 6.995209242901596, + "learning_rate": 2.4913050119226563e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.3906, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.4375, + "step": 23400 + }, + { + "epoch": 0.8713777893580987, + "grad_norm": 7.368522666236933, + "learning_rate": 2.4771879205364832e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -980.0, + "logps/rejected": -1136.0, + "loss": 0.4064, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -8.0625, + "rewards/margins": 1.625, + "rewards/rejected": -9.6875, + "step": 23410 + }, + { + "epoch": 0.8717500139584226, + "grad_norm": 7.179543070215981, + "learning_rate": 2.4631088552297423e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -992.0, + "logps/rejected": -1112.0, + "loss": 0.3813, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.9375, + "rewards/margins": 1.40625, + "rewards/rejected": -9.3125, + "step": 23420 + }, + { + "epoch": 0.8721222385587464, + "grad_norm": 6.969375729195452, + "learning_rate": 2.4490678397726396e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.453125, + "logps/chosen": -960.0, + "logps/rejected": -1152.0, + "loss": 0.3892, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 2.03125, + "rewards/rejected": -9.875, + "step": 23430 + }, + { + "epoch": 0.8724944631590702, + "grad_norm": 8.37784616949306, + "learning_rate": 2.4350648978711142e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.578125, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.3725, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.3125, + "step": 23440 + }, + { + "epoch": 0.872866687759394, + "grad_norm": 7.328634563396927, + "learning_rate": 2.421100053166844e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.703125, + "logps/chosen": -968.0, + "logps/rejected": -1144.0, + "loss": 0.3869, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.84375, + "rewards/rejected": -9.5, + "step": 23450 + }, + { + "epoch": 0.8732389123597178, + "grad_norm": 6.996494210029249, + "learning_rate": 2.4071733292371944e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.53125, + "logps/chosen": -936.0, + "logps/rejected": -1120.0, + "loss": 0.364, + "rewards/accuracies": 0.893750011920929, + "rewards/chosen": -7.46875, + "rewards/margins": 2.03125, + "rewards/rejected": -9.5, + "step": 23460 + }, + { + "epoch": 0.8736111369600417, + "grad_norm": 7.4672031660140235, + "learning_rate": 2.3932847495951453e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.859375, + "logps/chosen": -960.0, + "logps/rejected": -1128.0, + "loss": 0.366, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.859375, + "rewards/rejected": -9.5, + "step": 23470 + }, + { + "epoch": 0.8739833615603655, + "grad_norm": 7.683824837627566, + "learning_rate": 2.3794343376892982e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.5, + "logps/chosen": -920.0, + "logps/rejected": -1088.0, + "loss": 0.3732, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.4375, + "step": 23480 + }, + { + "epoch": 0.8743555861606893, + "grad_norm": 7.158926842690174, + "learning_rate": 2.3656221169037926e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.765625, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.3897, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.734375, + "rewards/rejected": -9.5, + "step": 23490 + }, + { + "epoch": 0.8747278107610132, + "grad_norm": 7.63142793133654, + "learning_rate": 2.3518481105583104e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.3925, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.875, + "rewards/margins": 1.671875, + "rewards/rejected": -9.5, + "step": 23500 + }, + { + "epoch": 0.8751000353613371, + "grad_norm": 7.437015785256054, + "learning_rate": 2.3381123419080022e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -980.0, + "logps/rejected": -1120.0, + "loss": 0.3832, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.625, + "step": 23510 + }, + { + "epoch": 0.8754722599616609, + "grad_norm": 7.507636291724757, + "learning_rate": 2.3244148341434707e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.640625, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3972, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.25, + "step": 23520 + }, + { + "epoch": 0.8758444845619847, + "grad_norm": 7.950372150486875, + "learning_rate": 2.3107556103907022e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.453125, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3754, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.4375, + "step": 23530 + }, + { + "epoch": 0.8762167091623085, + "grad_norm": 8.582897850737993, + "learning_rate": 2.2971346937110668e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.4375, + "logps/chosen": -928.0, + "logps/rejected": -1144.0, + "loss": 0.3839, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 2.0625, + "rewards/rejected": -9.625, + "step": 23540 + }, + { + "epoch": 0.8765889337626324, + "grad_norm": 7.412439102486501, + "learning_rate": 2.283552107101247e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3906, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.8125, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.375, + "step": 23550 + }, + { + "epoch": 0.8769611583629562, + "grad_norm": 8.232224985677536, + "learning_rate": 2.270007873493221e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.78125, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.408, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.5078125, + "rewards/rejected": -9.0625, + "step": 23560 + }, + { + "epoch": 0.87733338296328, + "grad_norm": 7.929402476657699, + "learning_rate": 2.256502015754211e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.609375, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.4098, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.4375, + "step": 23570 + }, + { + "epoch": 0.8777056075636038, + "grad_norm": 6.249545658203031, + "learning_rate": 2.2430345566866378e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -960.0, + "logps/rejected": -1104.0, + "loss": 0.385, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.5, + "step": 23580 + }, + { + "epoch": 0.8780778321639278, + "grad_norm": 7.121101943554836, + "learning_rate": 2.2296055190281023e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.546875, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.3846, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.625, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.4375, + "step": 23590 + }, + { + "epoch": 0.8784500567642516, + "grad_norm": 7.445947921275176, + "learning_rate": 2.2162149254513374e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -936.0, + "logps/rejected": -1080.0, + "loss": 0.3824, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.1875, + "step": 23600 + }, + { + "epoch": 0.8788222813645754, + "grad_norm": 7.008136428397299, + "learning_rate": 2.2028627985641702e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3766, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.25, + "step": 23610 + }, + { + "epoch": 0.8791945059648992, + "grad_norm": 9.428053672567371, + "learning_rate": 2.1895491609094735e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -960.0, + "logps/rejected": -1080.0, + "loss": 0.3786, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.25, + "step": 23620 + }, + { + "epoch": 0.879566730565223, + "grad_norm": 6.965567056686397, + "learning_rate": 2.1762740349651476e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.609375, + "logps/chosen": -932.0, + "logps/rejected": -1064.0, + "loss": 0.3924, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.59375, + "rewards/rejected": -9.1875, + "step": 23630 + }, + { + "epoch": 0.8799389551655469, + "grad_norm": 8.233107927923399, + "learning_rate": 2.1630374431440668e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3666, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.4375, + "step": 23640 + }, + { + "epoch": 0.8803111797658707, + "grad_norm": 7.990932484125737, + "learning_rate": 2.149839407794052e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.78125, + "logps/chosen": -972.0, + "logps/rejected": -1104.0, + "loss": 0.3693, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.71875, + "rewards/margins": 1.5625, + "rewards/rejected": -9.25, + "step": 23650 + }, + { + "epoch": 0.8806834043661945, + "grad_norm": 8.457721229650284, + "learning_rate": 2.136679951197823e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.71875, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.3574, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.4375, + "step": 23660 + }, + { + "epoch": 0.8810556289665183, + "grad_norm": 9.092648384261125, + "learning_rate": 2.1235590955729632e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.515625, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.4001, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 1.734375, + "rewards/rejected": -9.1875, + "step": 23670 + }, + { + "epoch": 0.8814278535668423, + "grad_norm": 8.329676556304953, + "learning_rate": 2.1104768630718915e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.765625, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3915, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.59375, + "rewards/rejected": -9.3125, + "step": 23680 + }, + { + "epoch": 0.8818000781671661, + "grad_norm": 7.824932105876317, + "learning_rate": 2.0974332757818153e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.640625, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3728, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.125, + "step": 23690 + }, + { + "epoch": 0.8821723027674899, + "grad_norm": 8.249231385804052, + "learning_rate": 2.084428355724699e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3847, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.65625, + "rewards/margins": 1.875, + "rewards/rejected": -9.5, + "step": 23700 + }, + { + "epoch": 0.8825445273678137, + "grad_norm": 7.361717393223829, + "learning_rate": 2.0714621248572124e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.59375, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.4, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.65625, + "rewards/rejected": -9.25, + "step": 23710 + }, + { + "epoch": 0.8829167519681376, + "grad_norm": 6.63534360905492, + "learning_rate": 2.0585346050707138e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3713, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.671875, + "rewards/rejected": -9.3125, + "step": 23720 + }, + { + "epoch": 0.8832889765684614, + "grad_norm": 8.807030508722738, + "learning_rate": 2.045645818191208e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.59375, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3727, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.25, + "step": 23730 + }, + { + "epoch": 0.8836612011687852, + "grad_norm": 8.824500303269753, + "learning_rate": 2.0327957859792967e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.640625, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.3915, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.84375, + "rewards/rejected": -9.5, + "step": 23740 + }, + { + "epoch": 0.884033425769109, + "grad_norm": 7.777502681653569, + "learning_rate": 2.0199845301301616e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.59375, + "logps/chosen": -984.0, + "logps/rejected": -1136.0, + "loss": 0.3804, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.9375, + "rewards/margins": 1.53125, + "rewards/rejected": -9.4375, + "step": 23750 + }, + { + "epoch": 0.8844056503694329, + "grad_norm": 8.743415934980693, + "learning_rate": 2.007212072273501e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.734375, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.3889, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.734375, + "rewards/rejected": -9.4375, + "step": 23760 + }, + { + "epoch": 0.8847778749697568, + "grad_norm": 7.846106413119858, + "learning_rate": 1.9944784339735232e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.734375, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.3952, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.625, + "rewards/rejected": -9.4375, + "step": 23770 + }, + { + "epoch": 0.8851500995700806, + "grad_norm": 7.46948168535247, + "learning_rate": 1.981783636728887e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.578125, + "logps/chosen": -924.0, + "logps/rejected": -1104.0, + "loss": 0.3649, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.4375, + "rewards/margins": 1.9921875, + "rewards/rejected": -9.4375, + "step": 23780 + }, + { + "epoch": 0.8855223241704044, + "grad_norm": 7.721275113500026, + "learning_rate": 1.9691277019726838e-08, + "logits/chosen": -3.96875, + "logits/rejected": -3.859375, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.377, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.4375, + "step": 23790 + }, + { + "epoch": 0.8858945487707283, + "grad_norm": 7.443427468231076, + "learning_rate": 1.956510651072385e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.484375, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3829, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.734375, + "rewards/rejected": -9.4375, + "step": 23800 + }, + { + "epoch": 0.8862667733710521, + "grad_norm": 8.99734584932058, + "learning_rate": 1.9439325053298123e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.75, + "logps/chosen": -984.0, + "logps/rejected": -1120.0, + "loss": 0.3948, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -8.0625, + "rewards/margins": 1.4296875, + "rewards/rejected": -9.5, + "step": 23810 + }, + { + "epoch": 0.8866389979713759, + "grad_norm": 7.972096153402294, + "learning_rate": 1.9313932859811033e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3986, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.6875, + "step": 23820 + }, + { + "epoch": 0.8870112225716997, + "grad_norm": 7.308577147954605, + "learning_rate": 1.918893014196682e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.59375, + "logps/chosen": -920.0, + "logps/rejected": -1080.0, + "loss": 0.3742, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.796875, + "rewards/rejected": -9.25, + "step": 23830 + }, + { + "epoch": 0.8873834471720236, + "grad_norm": 8.0342999596137, + "learning_rate": 1.9064317110812106e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.578125, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3794, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.3125, + "step": 23840 + }, + { + "epoch": 0.8877556717723475, + "grad_norm": 6.769370536093424, + "learning_rate": 1.894009397673549e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.3887, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.65625, + "rewards/rejected": -9.4375, + "step": 23850 + }, + { + "epoch": 0.8881278963726713, + "grad_norm": 10.114355579038438, + "learning_rate": 1.881626094946745e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.4375, + "logps/chosen": -976.0, + "logps/rejected": -1128.0, + "loss": 0.3756, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.5625, + "step": 23860 + }, + { + "epoch": 0.8885001209729951, + "grad_norm": 7.591787194937937, + "learning_rate": 1.8692818238079778e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.546875, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.4123, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.4375, + "step": 23870 + }, + { + "epoch": 0.888872345573319, + "grad_norm": 8.59697232232149, + "learning_rate": 1.8569766050985257e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3787, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.703125, + "rewards/rejected": -9.375, + "step": 23880 + }, + { + "epoch": 0.8892445701736428, + "grad_norm": 8.338137123278548, + "learning_rate": 1.8447104595937428e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.5625, + "logps/chosen": -936.0, + "logps/rejected": -1136.0, + "loss": 0.3686, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 2.125, + "rewards/rejected": -9.8125, + "step": 23890 + }, + { + "epoch": 0.8896167947739666, + "grad_norm": 7.062740904062344, + "learning_rate": 1.832483408002994e-08, + "logits/chosen": -3.6875, + "logits/rejected": -3.59375, + "logps/chosen": -936.0, + "logps/rejected": -1080.0, + "loss": 0.3976, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.546875, + "rewards/rejected": -9.125, + "step": 23900 + }, + { + "epoch": 0.8899890193742904, + "grad_norm": 6.061875564220678, + "learning_rate": 1.82029547096966e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -984.0, + "logps/rejected": -1112.0, + "loss": 0.3745, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": -7.90625, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.5, + "step": 23910 + }, + { + "epoch": 0.8903612439746142, + "grad_norm": 9.082797920973723, + "learning_rate": 1.8081466690710755e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.59375, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3918, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.375, + "step": 23920 + }, + { + "epoch": 0.8907334685749381, + "grad_norm": 8.254154693838451, + "learning_rate": 1.7960370228185083e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.65625, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3886, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.46875, + "rewards/margins": 1.671875, + "rewards/rejected": -9.125, + "step": 23930 + }, + { + "epoch": 0.891105693175262, + "grad_norm": 8.295709625398294, + "learning_rate": 1.7839665526571014e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -960.0, + "logps/rejected": -1136.0, + "loss": 0.3661, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.75, + "rewards/margins": 1.890625, + "rewards/rejected": -9.625, + "step": 23940 + }, + { + "epoch": 0.8914779177755858, + "grad_norm": 7.819768258036864, + "learning_rate": 1.7719352789658775e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.392, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.4375, + "step": 23950 + }, + { + "epoch": 0.8918501423759096, + "grad_norm": 7.6720267294618525, + "learning_rate": 1.759943222057661e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -964.0, + "logps/rejected": -1136.0, + "loss": 0.364, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.5625, + "step": 23960 + }, + { + "epoch": 0.8922223669762335, + "grad_norm": 11.897852411899958, + "learning_rate": 1.7479904021790863e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.6875, + "logps/chosen": -980.0, + "logps/rejected": -1136.0, + "loss": 0.3925, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.9375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.625, + "step": 23970 + }, + { + "epoch": 0.8925945915765573, + "grad_norm": 10.611319732656625, + "learning_rate": 1.736076839510531e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.4051, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.375, + "step": 23980 + }, + { + "epoch": 0.8929668161768811, + "grad_norm": 6.714058338379632, + "learning_rate": 1.7242025541660875e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.4041, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.3125, + "step": 23990 + }, + { + "epoch": 0.8933390407772049, + "grad_norm": 6.125954344285272, + "learning_rate": 1.7123675661935483e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.78125, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.4024, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.90625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.5625, + "step": 24000 + }, + { + "epoch": 0.8937112653775288, + "grad_norm": 9.384844756909843, + "learning_rate": 1.7005718955743432e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -988.0, + "logps/rejected": -1144.0, + "loss": 0.4032, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.9375, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.75, + "step": 24010 + }, + { + "epoch": 0.8940834899778526, + "grad_norm": 8.615495388964437, + "learning_rate": 1.6888155622235474e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -976.0, + "logps/rejected": -1144.0, + "loss": 0.398, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.5625, + "step": 24020 + }, + { + "epoch": 0.8944557145781765, + "grad_norm": 7.869135045463567, + "learning_rate": 1.6770985859897863e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.46875, + "logps/chosen": -932.0, + "logps/rejected": -1104.0, + "loss": 0.3618, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.5, + "rewards/margins": 1.890625, + "rewards/rejected": -9.375, + "step": 24030 + }, + { + "epoch": 0.8948279391785003, + "grad_norm": 7.362574538668546, + "learning_rate": 1.6654209866552638e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.71875, + "logps/chosen": -992.0, + "logps/rejected": -1128.0, + "loss": 0.3733, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.90625, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.75, + "step": 24040 + }, + { + "epoch": 0.8952001637788242, + "grad_norm": 9.806680353282909, + "learning_rate": 1.6537827839356923e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.546875, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.4088, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.671875, + "rewards/rejected": -9.375, + "step": 24050 + }, + { + "epoch": 0.895572388379148, + "grad_norm": 8.58482624740034, + "learning_rate": 1.642183997480273e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.625, + "logps/chosen": -956.0, + "logps/rejected": -1072.0, + "loss": 0.3986, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.4453125, + "rewards/rejected": -9.1875, + "step": 24060 + }, + { + "epoch": 0.8959446129794718, + "grad_norm": 7.170916296070867, + "learning_rate": 1.630624646871659e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.4375, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3968, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 2.03125, + "rewards/rejected": -9.625, + "step": 24070 + }, + { + "epoch": 0.8963168375797956, + "grad_norm": 7.086395382937031, + "learning_rate": 1.619104751625913e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3452, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.71875, + "rewards/rejected": -9.375, + "step": 24080 + }, + { + "epoch": 0.8966890621801195, + "grad_norm": 6.888671145877337, + "learning_rate": 1.6076243311924974e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.640625, + "logps/chosen": -928.0, + "logps/rejected": -1064.0, + "loss": 0.3689, + "rewards/accuracies": 0.731249988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.578125, + "rewards/rejected": -9.25, + "step": 24090 + }, + { + "epoch": 0.8970612867804433, + "grad_norm": 8.026012423504191, + "learning_rate": 1.5961834049542154e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.59375, + "logps/chosen": -972.0, + "logps/rejected": -1112.0, + "loss": 0.4113, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.4375, + "step": 24100 + }, + { + "epoch": 0.8974335113807671, + "grad_norm": 8.449592701000958, + "learning_rate": 1.5847819922272077e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -932.0, + "logps/rejected": -1128.0, + "loss": 0.3675, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 2.109375, + "rewards/rejected": -9.5, + "step": 24110 + }, + { + "epoch": 0.897805735981091, + "grad_norm": 7.616328800398696, + "learning_rate": 1.573420112260884e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.484375, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3788, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.3125, + "step": 24120 + }, + { + "epoch": 0.8981779605814149, + "grad_norm": 8.121434555411774, + "learning_rate": 1.56209778423792e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.65625, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3794, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.25, + "step": 24130 + }, + { + "epoch": 0.8985501851817387, + "grad_norm": 7.199913062183862, + "learning_rate": 1.550815027274216e-08, + "logits/chosen": -3.625, + "logits/rejected": -3.484375, + "logps/chosen": -916.0, + "logps/rejected": -1096.0, + "loss": 0.3874, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.4375, + "step": 24140 + }, + { + "epoch": 0.8989224097820625, + "grad_norm": 7.834115318469685, + "learning_rate": 1.5395718604188506e-08, + "logits/chosen": -3.75, + "logits/rejected": -3.640625, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.3792, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.578125, + "rewards/rejected": -9.25, + "step": 24150 + }, + { + "epoch": 0.8992946343823863, + "grad_norm": 7.066007652832291, + "learning_rate": 1.528368302654079e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.515625, + "logps/chosen": -936.0, + "logps/rejected": -1080.0, + "loss": 0.3877, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.65625, + "rewards/margins": 1.546875, + "rewards/rejected": -9.1875, + "step": 24160 + }, + { + "epoch": 0.8996668589827101, + "grad_norm": 7.709458252757219, + "learning_rate": 1.5172043728952672e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.6875, + "logps/chosen": -976.0, + "logps/rejected": -1128.0, + "loss": 0.381, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.84375, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.625, + "step": 24170 + }, + { + "epoch": 0.900039083583034, + "grad_norm": 8.926782992191475, + "learning_rate": 1.506080089990888e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.75, + "logps/chosen": -948.0, + "logps/rejected": -1096.0, + "loss": 0.3977, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.40625, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.3125, + "step": 24180 + }, + { + "epoch": 0.9004113081833578, + "grad_norm": 9.10356845704118, + "learning_rate": 1.4949954727224627e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.578125, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.3948, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.5, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.1875, + "step": 24190 + }, + { + "epoch": 0.9007835327836817, + "grad_norm": 6.504294296086254, + "learning_rate": 1.48395053980456e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.671875, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.3962, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.3125, + "step": 24200 + }, + { + "epoch": 0.9011557573840056, + "grad_norm": 6.757474926442064, + "learning_rate": 1.472945309884735e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.515625, + "logps/chosen": -932.0, + "logps/rejected": -1072.0, + "loss": 0.386, + "rewards/accuracies": 0.737500011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.40625, + "rewards/rejected": -9.125, + "step": 24210 + }, + { + "epoch": 0.9015279819843294, + "grad_norm": 7.2983616340408535, + "learning_rate": 1.4619798015435198e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.4136, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.4765625, + "rewards/rejected": -9.375, + "step": 24220 + }, + { + "epoch": 0.9019002065846532, + "grad_norm": 7.720140323166754, + "learning_rate": 1.4510540332943799e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.703125, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3529, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.4375, + "step": 24230 + }, + { + "epoch": 0.902272431184977, + "grad_norm": 8.476672522650148, + "learning_rate": 1.4401680235836766e-08, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -924.0, + "logps/rejected": -1112.0, + "loss": 0.3745, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 2.0, + "rewards/rejected": -9.5, + "step": 24240 + }, + { + "epoch": 0.9026446557853008, + "grad_norm": 7.566248208144642, + "learning_rate": 1.4293217907906663e-08, + "logits/chosen": -3.6875, + "logits/rejected": -3.609375, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3727, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.75, + "rewards/margins": 1.671875, + "rewards/rejected": -9.4375, + "step": 24250 + }, + { + "epoch": 0.9030168803856247, + "grad_norm": 8.742504638356277, + "learning_rate": 1.4185153532274313e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.625, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.379, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.3125, + "step": 24260 + }, + { + "epoch": 0.9033891049859485, + "grad_norm": 8.305964372214007, + "learning_rate": 1.4077487291388746e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.53125, + "logps/chosen": -932.0, + "logps/rejected": -1112.0, + "loss": 0.3776, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 1.859375, + "rewards/rejected": -9.4375, + "step": 24270 + }, + { + "epoch": 0.9037613295862723, + "grad_norm": 7.468556622895356, + "learning_rate": 1.3970219367026692e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.578125, + "logps/chosen": -968.0, + "logps/rejected": -1136.0, + "loss": 0.3743, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.5, + "step": 24280 + }, + { + "epoch": 0.9041335541865962, + "grad_norm": 7.992257195242798, + "learning_rate": 1.3863349940292562e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -936.0, + "logps/rejected": -1112.0, + "loss": 0.3589, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.625, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.5, + "step": 24290 + }, + { + "epoch": 0.9045057787869201, + "grad_norm": 7.9115847678859, + "learning_rate": 1.3756879191617831e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3739, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.375, + "step": 24300 + }, + { + "epoch": 0.9048780033872439, + "grad_norm": 8.300383475053408, + "learning_rate": 1.365080730076093e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.5625, + "logps/chosen": -940.0, + "logps/rejected": -1128.0, + "loss": 0.378, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.5, + "step": 24310 + }, + { + "epoch": 0.9052502279875677, + "grad_norm": 7.554307295537521, + "learning_rate": 1.3545134446806911e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3793, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.5625, + "step": 24320 + }, + { + "epoch": 0.9056224525878915, + "grad_norm": 8.437668317453543, + "learning_rate": 1.343986080816703e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.46875, + "logps/chosen": -928.0, + "logps/rejected": -1096.0, + "loss": 0.3743, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.375, + "step": 24330 + }, + { + "epoch": 0.9059946771882154, + "grad_norm": 8.72210225861552, + "learning_rate": 1.3334986562578614e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -988.0, + "logps/rejected": -1112.0, + "loss": 0.375, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -8.125, + "rewards/margins": 1.4453125, + "rewards/rejected": -9.5625, + "step": 24340 + }, + { + "epoch": 0.9063669017885392, + "grad_norm": 8.157291870928926, + "learning_rate": 1.3230511887104639e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.640625, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3653, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.671875, + "rewards/rejected": -9.3125, + "step": 24350 + }, + { + "epoch": 0.906739126388863, + "grad_norm": 7.419196843865015, + "learning_rate": 1.3126436958133507e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.515625, + "logps/chosen": -928.0, + "logps/rejected": -1104.0, + "loss": 0.3656, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.859375, + "rewards/rejected": -9.375, + "step": 24360 + }, + { + "epoch": 0.9071113509891868, + "grad_norm": 7.799395303034371, + "learning_rate": 1.3022761951378663e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -960.0, + "logps/rejected": -1120.0, + "loss": 0.3579, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.8125, + "rewards/rejected": -9.5, + "step": 24370 + }, + { + "epoch": 0.9074835755895108, + "grad_norm": 8.035944812606981, + "learning_rate": 1.2919487041878369e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.734375, + "logps/chosen": -952.0, + "logps/rejected": -1088.0, + "loss": 0.3922, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.3125, + "step": 24380 + }, + { + "epoch": 0.9078558001898346, + "grad_norm": 7.44304132857029, + "learning_rate": 1.2816612403995397e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.640625, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3924, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.78125, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.375, + "step": 24390 + }, + { + "epoch": 0.9082280247901584, + "grad_norm": 7.850317381255466, + "learning_rate": 1.2714138211416758e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3801, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.5, + "step": 24400 + }, + { + "epoch": 0.9086002493904822, + "grad_norm": 7.672167977278572, + "learning_rate": 1.2612064637153336e-08, + "logits/chosen": -3.734375, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3841, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.3125, + "step": 24410 + }, + { + "epoch": 0.908972473990806, + "grad_norm": 7.637465638332765, + "learning_rate": 1.251039185353961e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.4024, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.5, + "step": 24420 + }, + { + "epoch": 0.9093446985911299, + "grad_norm": 8.123031020217443, + "learning_rate": 1.2409120032233433e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.5625, + "logps/chosen": -960.0, + "logps/rejected": -1128.0, + "loss": 0.3836, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.375, + "step": 24430 + }, + { + "epoch": 0.9097169231914537, + "grad_norm": 8.788958772757523, + "learning_rate": 1.2308249344215704e-08, + "logits/chosen": -3.828125, + "logits/rejected": -3.53125, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.4029, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.5625, + "step": 24440 + }, + { + "epoch": 0.9100891477917775, + "grad_norm": 7.608099359312187, + "learning_rate": 1.220777995979011e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.625, + "logps/chosen": -972.0, + "logps/rejected": -1144.0, + "loss": 0.3778, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.828125, + "rewards/rejected": -9.6875, + "step": 24450 + }, + { + "epoch": 0.9104613723921013, + "grad_norm": 9.326755098618014, + "learning_rate": 1.210771204858263e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -936.0, + "logps/rejected": -1112.0, + "loss": 0.3599, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.703125, + "rewards/rejected": -9.375, + "step": 24460 + }, + { + "epoch": 0.9108335969924253, + "grad_norm": 7.9267426859429815, + "learning_rate": 1.200804577954162e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -984.0, + "logps/rejected": -1144.0, + "loss": 0.3949, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.875, + "rewards/rejected": -9.75, + "step": 24470 + }, + { + "epoch": 0.9112058215927491, + "grad_norm": 6.54227519354369, + "learning_rate": 1.1908781320937256e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.640625, + "logps/chosen": -964.0, + "logps/rejected": -1128.0, + "loss": 0.3862, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.5, + "step": 24480 + }, + { + "epoch": 0.9115780461930729, + "grad_norm": 8.300787377740791, + "learning_rate": 1.1809918840361282e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.625, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3908, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.5, + "step": 24490 + }, + { + "epoch": 0.9119502707933967, + "grad_norm": 7.522409596731626, + "learning_rate": 1.171145850472688e-08, + "logits/chosen": -3.796875, + "logits/rejected": -3.703125, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.3776, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.71875, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.5625, + "step": 24500 + }, + { + "epoch": 0.9123224953937206, + "grad_norm": 7.699094846255386, + "learning_rate": 1.16134004802681e-08, + "logits/chosen": -3.921875, + "logits/rejected": -3.703125, + "logps/chosen": -972.0, + "logps/rejected": -1160.0, + "loss": 0.3737, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.78125, + "rewards/margins": 1.9375, + "rewards/rejected": -9.6875, + "step": 24510 + }, + { + "epoch": 0.9126947199940444, + "grad_norm": 6.741315373186182, + "learning_rate": 1.1515744932539929e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.625, + "logps/chosen": -996.0, + "logps/rejected": -1120.0, + "loss": 0.3556, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.90625, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.5625, + "step": 24520 + }, + { + "epoch": 0.9130669445943682, + "grad_norm": 9.524287978227134, + "learning_rate": 1.1418492026417703e-08, + "logits/chosen": -3.71875, + "logits/rejected": -3.609375, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.4003, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6875, + "rewards/rejected": -9.5, + "step": 24530 + }, + { + "epoch": 0.913439169194692, + "grad_norm": 8.761360796146077, + "learning_rate": 1.1321641926097137e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.3518, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.9375, + "rewards/margins": 1.671875, + "rewards/rejected": -9.625, + "step": 24540 + }, + { + "epoch": 0.9138113937950159, + "grad_norm": 8.548143936738693, + "learning_rate": 1.1225194795093623e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3893, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.59375, + "rewards/rejected": -9.3125, + "step": 24550 + }, + { + "epoch": 0.9141836183953398, + "grad_norm": 7.356786296428599, + "learning_rate": 1.1129150796242436e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.5625, + "logps/chosen": -944.0, + "logps/rejected": -1120.0, + "loss": 0.3677, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.9765625, + "rewards/rejected": -9.5625, + "step": 24560 + }, + { + "epoch": 0.9145558429956636, + "grad_norm": 8.134624126383903, + "learning_rate": 1.1033510091698117e-08, + "logits/chosen": -3.9375, + "logits/rejected": -3.6875, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.4008, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.375, + "step": 24570 + }, + { + "epoch": 0.9149280675959874, + "grad_norm": 9.191711565618723, + "learning_rate": 1.0938272842934304e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3709, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.375, + "step": 24580 + }, + { + "epoch": 0.9153002921963113, + "grad_norm": 8.586915312959455, + "learning_rate": 1.0843439210743572e-08, + "logits/chosen": -3.703125, + "logits/rejected": -3.609375, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.3999, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.6875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.4375, + "step": 24590 + }, + { + "epoch": 0.9156725167966351, + "grad_norm": 8.205902605994037, + "learning_rate": 1.0749009355236898e-08, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.3885, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.375, + "step": 24600 + }, + { + "epoch": 0.9160447413969589, + "grad_norm": 8.255725667513316, + "learning_rate": 1.0654983435843645e-08, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.3836, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.75, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.3125, + "step": 24610 + }, + { + "epoch": 0.9164169659972827, + "grad_norm": 8.926505569083105, + "learning_rate": 1.0561361611311188e-08, + "logits/chosen": -3.671875, + "logits/rejected": -3.484375, + "logps/chosen": -936.0, + "logps/rejected": -1136.0, + "loss": 0.3549, + "rewards/accuracies": 0.887499988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 2.21875, + "rewards/rejected": -9.9375, + "step": 24620 + }, + { + "epoch": 0.9167891905976066, + "grad_norm": 7.936119776674965, + "learning_rate": 1.046814403970464e-08, + "logits/chosen": -3.890625, + "logits/rejected": -3.734375, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.3886, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.90625, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.5625, + "step": 24630 + }, + { + "epoch": 0.9171614151979305, + "grad_norm": 7.635210531673523, + "learning_rate": 1.037533087840664e-08, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -984.0, + "logps/rejected": -1136.0, + "loss": 0.3823, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.96875, + "rewards/margins": 1.609375, + "rewards/rejected": -9.5625, + "step": 24640 + }, + { + "epoch": 0.9175336397982543, + "grad_norm": 8.575933521526409, + "learning_rate": 1.0282922284116951e-08, + "logits/chosen": -3.765625, + "logits/rejected": -3.65625, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.3916, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.96875, + "rewards/margins": 1.625, + "rewards/rejected": -9.5625, + "step": 24650 + }, + { + "epoch": 0.9179058643985781, + "grad_norm": 11.640605377886343, + "learning_rate": 1.0190918412852384e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.796875, + "logps/chosen": -952.0, + "logps/rejected": -1128.0, + "loss": 0.3984, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 2.046875, + "rewards/rejected": -9.6875, + "step": 24660 + }, + { + "epoch": 0.918278088998902, + "grad_norm": 8.139747004873367, + "learning_rate": 1.0099319419946406e-08, + "logits/chosen": -3.90625, + "logits/rejected": -3.640625, + "logps/chosen": -940.0, + "logps/rejected": -1136.0, + "loss": 0.3801, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 2.046875, + "rewards/rejected": -9.6875, + "step": 24670 + }, + { + "epoch": 0.9186503135992258, + "grad_norm": 9.978017658068548, + "learning_rate": 1.0008125460048921e-08, + "logits/chosen": -3.8125, + "logits/rejected": -3.515625, + "logps/chosen": -972.0, + "logps/rejected": -1136.0, + "loss": 0.3811, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.9375, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.625, + "step": 24680 + }, + { + "epoch": 0.9190225381995496, + "grad_norm": 7.515756241230707, + "learning_rate": 9.917336687125938e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -964.0, + "logps/rejected": -1112.0, + "loss": 0.3801, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.3125, + "step": 24690 + }, + { + "epoch": 0.9193947627998734, + "grad_norm": 6.734743377996093, + "learning_rate": 9.826953254459508e-09, + "logits/chosen": -3.90625, + "logits/rejected": -3.6875, + "logps/chosen": -996.0, + "logps/rejected": -1136.0, + "loss": 0.3801, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -8.0, + "rewards/margins": 1.515625, + "rewards/rejected": -9.5625, + "step": 24700 + }, + { + "epoch": 0.9197669874001972, + "grad_norm": 8.01737259049045, + "learning_rate": 9.736975314647205e-09, + "logits/chosen": -3.96875, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3869, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.375, + "step": 24710 + }, + { + "epoch": 0.9201392120005211, + "grad_norm": 6.974434479985267, + "learning_rate": 9.647403019602068e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.3956, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.6875, + "rewards/rejected": -9.4375, + "step": 24720 + }, + { + "epoch": 0.920511436600845, + "grad_norm": 7.683392163599637, + "learning_rate": 9.558236520552265e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.765625, + "logps/chosen": -976.0, + "logps/rejected": -1128.0, + "loss": 0.3794, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.875, + "rewards/margins": 1.6875, + "rewards/rejected": -9.5625, + "step": 24730 + }, + { + "epoch": 0.9208836612011688, + "grad_norm": 7.030826030041779, + "learning_rate": 9.469475968040763e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.75, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.3718, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.796875, + "rewards/rejected": -9.5625, + "step": 24740 + }, + { + "epoch": 0.9212558858014926, + "grad_norm": 9.099713273938125, + "learning_rate": 9.381121511925243e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.5625, + "logps/chosen": -992.0, + "logps/rejected": -1160.0, + "loss": 0.4022, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.5, + "step": 24750 + }, + { + "epoch": 0.9216281104018165, + "grad_norm": 8.782674466854482, + "learning_rate": 9.293173301377772e-09, + "logits/chosen": -3.953125, + "logits/rejected": -3.921875, + "logps/chosen": -984.0, + "logps/rejected": -1144.0, + "loss": 0.387, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.796875, + "rewards/rejected": -9.5625, + "step": 24760 + }, + { + "epoch": 0.9220003350021403, + "grad_norm": 8.166861497095521, + "learning_rate": 9.205631484884485e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.59375, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3872, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.625, + "step": 24770 + }, + { + "epoch": 0.9223725596024641, + "grad_norm": 8.662590351472907, + "learning_rate": 9.11849621024538e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.5625, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.3849, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.828125, + "rewards/rejected": -9.625, + "step": 24780 + }, + { + "epoch": 0.9227447842027879, + "grad_norm": 9.416919522717194, + "learning_rate": 9.031767624574083e-09, + "logits/chosen": -3.78125, + "logits/rejected": -3.734375, + "logps/chosen": -976.0, + "logps/rejected": -1128.0, + "loss": 0.3801, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.5625, + "step": 24790 + }, + { + "epoch": 0.9231170088031118, + "grad_norm": 8.003333767896079, + "learning_rate": 8.945445874297659e-09, + "logits/chosen": -3.796875, + "logits/rejected": -3.734375, + "logps/chosen": -968.0, + "logps/rejected": -1136.0, + "loss": 0.3801, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.875, + "rewards/margins": 1.515625, + "rewards/rejected": -9.375, + "step": 24800 + }, + { + "epoch": 0.9234892334034356, + "grad_norm": 8.177854924222288, + "learning_rate": 8.859531105156193e-09, + "logits/chosen": -3.859375, + "logits/rejected": -3.78125, + "logps/chosen": -980.0, + "logps/rejected": -1112.0, + "loss": 0.3762, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.546875, + "rewards/rejected": -9.3125, + "step": 24810 + }, + { + "epoch": 0.9238614580037595, + "grad_norm": 7.169427388075016, + "learning_rate": 8.774023462202768e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -992.0, + "logps/rejected": -1144.0, + "loss": 0.3838, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.6875, + "step": 24820 + }, + { + "epoch": 0.9242336826040833, + "grad_norm": 7.905858490028348, + "learning_rate": 8.688923089802957e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.6875, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.3778, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.5, + "step": 24830 + }, + { + "epoch": 0.9246059072044072, + "grad_norm": 8.79668516589034, + "learning_rate": 8.604230131634832e-09, + "logits/chosen": -3.921875, + "logits/rejected": -3.8125, + "logps/chosen": -988.0, + "logps/rejected": -1144.0, + "loss": 0.381, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.96875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.75, + "step": 24840 + }, + { + "epoch": 0.924978131804731, + "grad_norm": 8.580434253660142, + "learning_rate": 8.519944730688594e-09, + "logits/chosen": -3.625, + "logits/rejected": -3.484375, + "logps/chosen": -976.0, + "logps/rejected": -1112.0, + "loss": 0.3742, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.4375, + "step": 24850 + }, + { + "epoch": 0.9253503564050548, + "grad_norm": 9.715055464613178, + "learning_rate": 8.436067029266358e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.71875, + "logps/chosen": -972.0, + "logps/rejected": -1096.0, + "loss": 0.4074, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.9375, + "rewards/margins": 1.46875, + "rewards/rejected": -9.375, + "step": 24860 + }, + { + "epoch": 0.9257225810053786, + "grad_norm": 7.971859200012785, + "learning_rate": 8.352597168981845e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1104.0, + "loss": 0.3708, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.8125, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.375, + "step": 24870 + }, + { + "epoch": 0.9260948056057025, + "grad_norm": 7.990376771678073, + "learning_rate": 8.269535290760271e-09, + "logits/chosen": -3.859375, + "logits/rejected": -3.46875, + "logps/chosen": -960.0, + "logps/rejected": -1136.0, + "loss": 0.37, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.625, + "step": 24880 + }, + { + "epoch": 0.9264670302060263, + "grad_norm": 7.290364375365611, + "learning_rate": 8.18688153483793e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.5625, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.3862, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.4375, + "step": 24890 + }, + { + "epoch": 0.9268392548063501, + "grad_norm": 8.158983456696227, + "learning_rate": 8.104636040762281e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -968.0, + "logps/rejected": -1136.0, + "loss": 0.3867, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.5625, + "step": 24900 + }, + { + "epoch": 0.927211479406674, + "grad_norm": 7.092862182723741, + "learning_rate": 8.022798947391302e-09, + "logits/chosen": -3.71875, + "logits/rejected": -3.515625, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.3767, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -8.0, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.5625, + "step": 24910 + }, + { + "epoch": 0.9275837040069979, + "grad_norm": 8.864238313394411, + "learning_rate": 7.941370392893526e-09, + "logits/chosen": -3.71875, + "logits/rejected": -3.703125, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.3798, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.765625, + "rewards/rejected": -9.5, + "step": 24920 + }, + { + "epoch": 0.9279559286073217, + "grad_norm": 6.9544353166281825, + "learning_rate": 7.86035051474776e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.46875, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3606, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.71875, + "rewards/rejected": -9.25, + "step": 24930 + }, + { + "epoch": 0.9283281532076455, + "grad_norm": 7.1815304422499695, + "learning_rate": 7.779739449742723e-09, + "logits/chosen": -4.0, + "logits/rejected": -3.84375, + "logps/chosen": -992.0, + "logps/rejected": -1144.0, + "loss": 0.3906, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.625, + "step": 24940 + }, + { + "epoch": 0.9287003778079693, + "grad_norm": 7.423891097177366, + "learning_rate": 7.699537333977101e-09, + "logits/chosen": -3.953125, + "logits/rejected": -3.609375, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.4018, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.625, + "step": 24950 + }, + { + "epoch": 0.9290726024082931, + "grad_norm": 9.061510486130416, + "learning_rate": 7.619744302858944e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.640625, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3617, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.5625, + "rewards/margins": 1.796875, + "rewards/rejected": -9.375, + "step": 24960 + }, + { + "epoch": 0.929444827008617, + "grad_norm": 10.84337078464033, + "learning_rate": 7.540360491105763e-09, + "logits/chosen": -3.65625, + "logits/rejected": -3.515625, + "logps/chosen": -940.0, + "logps/rejected": -1072.0, + "loss": 0.4236, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.6875, + "rewards/margins": 1.3203125, + "rewards/rejected": -9.0, + "step": 24970 + }, + { + "epoch": 0.9298170516089408, + "grad_norm": 7.289127447021336, + "learning_rate": 7.461386032744099e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -944.0, + "logps/rejected": -1112.0, + "loss": 0.3938, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.375, + "step": 24980 + }, + { + "epoch": 0.9301892762092646, + "grad_norm": 8.793529128155344, + "learning_rate": 7.382821061109407e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.5, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3889, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.703125, + "rewards/rejected": -9.375, + "step": 24990 + }, + { + "epoch": 0.9305615008095885, + "grad_norm": 7.577486593713324, + "learning_rate": 7.304665708845803e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.609375, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3791, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.625, + "rewards/rejected": -9.375, + "step": 25000 + }, + { + "epoch": 0.9305615008095885, + "eval_logits/chosen": -3.796875, + "eval_logits/rejected": -3.609375, + "eval_logps/chosen": -1000.0, + "eval_logps/rejected": -1120.0, + "eval_loss": 0.45970889925956726, + "eval_rewards/accuracies": 0.7556513547897339, + "eval_rewards/chosen": -7.96875, + "eval_rewards/margins": 1.4921875, + "eval_rewards/rejected": -9.4375, + "eval_runtime": 6272.6886, + "eval_samples_per_second": 30.459, + "eval_steps_per_second": 0.476, + "step": 25000 + }, + { + "epoch": 0.9309337254099124, + "grad_norm": 7.631697835806511, + "learning_rate": 7.2269201079057375e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.546875, + "logps/chosen": -952.0, + "logps/rejected": -1136.0, + "loss": 0.3766, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.921875, + "rewards/rejected": -9.625, + "step": 25010 + }, + { + "epoch": 0.9313059500102362, + "grad_norm": 8.070707657785505, + "learning_rate": 7.149584389549962e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -976.0, + "logps/rejected": -1120.0, + "loss": 0.3959, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.4375, + "step": 25020 + }, + { + "epoch": 0.93167817461056, + "grad_norm": 8.025421810078772, + "learning_rate": 7.072658684347116e-09, + "logits/chosen": -3.78125, + "logits/rejected": -3.59375, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3868, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.625, + "step": 25030 + }, + { + "epoch": 0.9320503992108838, + "grad_norm": 6.194625094905456, + "learning_rate": 6.996143122173753e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.5, + "logps/chosen": -944.0, + "logps/rejected": -1128.0, + "loss": 0.3574, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.953125, + "rewards/rejected": -9.5625, + "step": 25040 + }, + { + "epoch": 0.9324226238112077, + "grad_norm": 6.98009351294653, + "learning_rate": 6.920037832213788e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.734375, + "logps/chosen": -976.0, + "logps/rejected": -1120.0, + "loss": 0.3749, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.875, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.625, + "step": 25050 + }, + { + "epoch": 0.9327948484115315, + "grad_norm": 9.032522811445986, + "learning_rate": 6.8443429429585755e-09, + "logits/chosen": -3.859375, + "logits/rejected": -3.640625, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.3738, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.5625, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.5, + "step": 25060 + }, + { + "epoch": 0.9331670730118553, + "grad_norm": 6.209517150245189, + "learning_rate": 6.769058582206555e-09, + "logits/chosen": -3.96875, + "logits/rejected": -3.625, + "logps/chosen": -980.0, + "logps/rejected": -1144.0, + "loss": 0.3785, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.9375, + "rewards/rejected": -9.6875, + "step": 25070 + }, + { + "epoch": 0.9335392976121792, + "grad_norm": 9.51104922502353, + "learning_rate": 6.694184877062941e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.4375, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.3986, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.90625, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.625, + "step": 25080 + }, + { + "epoch": 0.9339115222125031, + "grad_norm": 7.860594520966091, + "learning_rate": 6.619721953939866e-09, + "logits/chosen": -3.859375, + "logits/rejected": -3.625, + "logps/chosen": -1008.0, + "logps/rejected": -1136.0, + "loss": 0.3943, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -8.1875, + "rewards/margins": 1.4609375, + "rewards/rejected": -9.625, + "step": 25090 + }, + { + "epoch": 0.9342837468128269, + "grad_norm": 8.943069700669607, + "learning_rate": 6.545669938555654e-09, + "logits/chosen": -3.671875, + "logits/rejected": -3.484375, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3878, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.65625, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.5, + "step": 25100 + }, + { + "epoch": 0.9346559714131507, + "grad_norm": 8.670590824412393, + "learning_rate": 6.4720289559351e-09, + "logits/chosen": -3.9375, + "logits/rejected": -3.78125, + "logps/chosen": -996.0, + "logps/rejected": -1136.0, + "loss": 0.3834, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.90625, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.625, + "step": 25110 + }, + { + "epoch": 0.9350281960134745, + "grad_norm": 6.779608787994875, + "learning_rate": 6.3987991304088885e-09, + "logits/chosen": -3.859375, + "logits/rejected": -3.71875, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.348, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.875, + "rewards/rejected": -9.5625, + "step": 25120 + }, + { + "epoch": 0.9354004206137984, + "grad_norm": 7.566086459376941, + "learning_rate": 6.325980585613594e-09, + "logits/chosen": -3.734375, + "logits/rejected": -3.546875, + "logps/chosen": -964.0, + "logps/rejected": -1144.0, + "loss": 0.3703, + "rewards/accuracies": 0.875, + "rewards/chosen": -7.78125, + "rewards/margins": 2.0, + "rewards/rejected": -9.75, + "step": 25130 + }, + { + "epoch": 0.9357726452141222, + "grad_norm": 7.768196780379803, + "learning_rate": 6.2535734444914004e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.703125, + "logps/chosen": -972.0, + "logps/rejected": -1144.0, + "loss": 0.3673, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.9375, + "rewards/rejected": -9.6875, + "step": 25140 + }, + { + "epoch": 0.936144869814446, + "grad_norm": 8.055386654010553, + "learning_rate": 6.181577829289936e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.609375, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.3787, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.90625, + "rewards/margins": 1.578125, + "rewards/rejected": -9.5, + "step": 25150 + }, + { + "epoch": 0.9365170944147698, + "grad_norm": 8.773668401241743, + "learning_rate": 6.109993861561969e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -976.0, + "logps/rejected": -1136.0, + "loss": 0.4049, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.8125, + "rewards/margins": 1.8125, + "rewards/rejected": -9.625, + "step": 25160 + }, + { + "epoch": 0.9368893190150938, + "grad_norm": 6.528191170735717, + "learning_rate": 6.0388216621652945e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -976.0, + "logps/rejected": -1136.0, + "loss": 0.3944, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.90625, + "rewards/margins": 1.65625, + "rewards/rejected": -9.5625, + "step": 25170 + }, + { + "epoch": 0.9372615436154176, + "grad_norm": 7.945368788731117, + "learning_rate": 5.968061351262599e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -936.0, + "logps/rejected": -1072.0, + "loss": 0.3756, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.40625, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.125, + "step": 25180 + }, + { + "epoch": 0.9376337682157414, + "grad_norm": 9.538435349616632, + "learning_rate": 5.897713048320985e-09, + "logits/chosen": -3.609375, + "logits/rejected": -3.53125, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.4049, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.5625, + "step": 25190 + }, + { + "epoch": 0.9380059928160652, + "grad_norm": 7.283961316472517, + "learning_rate": 5.827776872112111e-09, + "logits/chosen": -3.921875, + "logits/rejected": -3.703125, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3711, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.78125, + "rewards/margins": 1.6875, + "rewards/rejected": -9.5, + "step": 25200 + }, + { + "epoch": 0.938378217416389, + "grad_norm": 6.890310256572558, + "learning_rate": 5.758252940711666e-09, + "logits/chosen": -3.640625, + "logits/rejected": -3.46875, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3675, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.5, + "step": 25210 + }, + { + "epoch": 0.9387504420167129, + "grad_norm": 7.2407951668217425, + "learning_rate": 5.689141371499479e-09, + "logits/chosen": -3.6875, + "logits/rejected": -3.65625, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3884, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.671875, + "rewards/rejected": -9.5, + "step": 25220 + }, + { + "epoch": 0.9391226666170367, + "grad_norm": 6.070852889925006, + "learning_rate": 5.6204422811591546e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -936.0, + "logps/rejected": -1096.0, + "loss": 0.3521, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.3125, + "step": 25230 + }, + { + "epoch": 0.9394948912173605, + "grad_norm": 8.514178948364906, + "learning_rate": 5.5521557856778035e-09, + "logits/chosen": -3.78125, + "logits/rejected": -3.5625, + "logps/chosen": -992.0, + "logps/rejected": -1136.0, + "loss": 0.3903, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -8.0, + "rewards/margins": 1.640625, + "rewards/rejected": -9.625, + "step": 25240 + }, + { + "epoch": 0.9398671158176843, + "grad_norm": 7.275877498281245, + "learning_rate": 5.484282000346007e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3822, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.3125, + "step": 25250 + }, + { + "epoch": 0.9402393404180083, + "grad_norm": 7.244057043784297, + "learning_rate": 5.416821039757491e-09, + "logits/chosen": -3.796875, + "logits/rejected": -3.75, + "logps/chosen": -1032.0, + "logps/rejected": -1152.0, + "loss": 0.3752, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -8.25, + "rewards/margins": 1.4375, + "rewards/rejected": -9.6875, + "step": 25260 + }, + { + "epoch": 0.9406115650183321, + "grad_norm": 6.236855043596449, + "learning_rate": 5.34977301780909e-09, + "logits/chosen": -3.890625, + "logits/rejected": -3.71875, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.3784, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.78125, + "rewards/margins": 1.5390625, + "rewards/rejected": -9.3125, + "step": 25270 + }, + { + "epoch": 0.9409837896186559, + "grad_norm": 7.603446749171045, + "learning_rate": 5.283138047700392e-09, + "logits/chosen": -3.65625, + "logits/rejected": -3.484375, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3677, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.71875, + "rewards/rejected": -9.375, + "step": 25280 + }, + { + "epoch": 0.9413560142189797, + "grad_norm": 7.913301335245522, + "learning_rate": 5.216916241933683e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.640625, + "logps/chosen": -968.0, + "logps/rejected": -1168.0, + "loss": 0.3801, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 2.046875, + "rewards/rejected": -9.875, + "step": 25290 + }, + { + "epoch": 0.9417282388193036, + "grad_norm": 9.191383995070396, + "learning_rate": 5.151107712313529e-09, + "logits/chosen": -3.625, + "logits/rejected": -3.53125, + "logps/chosen": -960.0, + "logps/rejected": -1128.0, + "loss": 0.3781, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.78125, + "rewards/rejected": -9.5625, + "step": 25300 + }, + { + "epoch": 0.9421004634196274, + "grad_norm": 8.237004236431517, + "learning_rate": 5.085712569946915e-09, + "logits/chosen": -3.6875, + "logits/rejected": -3.421875, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.4061, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.375, + "step": 25310 + }, + { + "epoch": 0.9424726880199512, + "grad_norm": 7.546572287719575, + "learning_rate": 5.020730925242828e-09, + "logits/chosen": -3.96875, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3962, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.8125, + "rewards/margins": 1.640625, + "rewards/rejected": -9.5, + "step": 25320 + }, + { + "epoch": 0.942844912620275, + "grad_norm": 8.52329649689671, + "learning_rate": 4.956162887912146e-09, + "logits/chosen": -3.890625, + "logits/rejected": -3.640625, + "logps/chosen": -972.0, + "logps/rejected": -1136.0, + "loss": 0.3899, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.5, + "step": 25330 + }, + { + "epoch": 0.9432171372205989, + "grad_norm": 9.012531388577552, + "learning_rate": 4.89200856696742e-09, + "logits/chosen": -4.0, + "logits/rejected": -3.796875, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.4091, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.8125, + "rewards/margins": 1.578125, + "rewards/rejected": -9.375, + "step": 25340 + }, + { + "epoch": 0.9435893618209228, + "grad_norm": 9.169900512268091, + "learning_rate": 4.828268070722674e-09, + "logits/chosen": -3.78125, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1152.0, + "loss": 0.377, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 1.890625, + "rewards/rejected": -9.75, + "step": 25350 + }, + { + "epoch": 0.9439615864212466, + "grad_norm": 9.00945638081036, + "learning_rate": 4.764941506793324e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.46875, + "logps/chosen": -952.0, + "logps/rejected": -1136.0, + "loss": 0.3673, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 2.0625, + "rewards/rejected": -9.75, + "step": 25360 + }, + { + "epoch": 0.9443338110215704, + "grad_norm": 7.250554197229469, + "learning_rate": 4.702028982095901e-09, + "logits/chosen": -3.6875, + "logits/rejected": -3.609375, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.4058, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.4375, + "step": 25370 + }, + { + "epoch": 0.9447060356218943, + "grad_norm": 7.248450395478969, + "learning_rate": 4.639530602847913e-09, + "logits/chosen": -3.796875, + "logits/rejected": -3.625, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.4013, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.6875, + "rewards/rejected": -9.4375, + "step": 25380 + }, + { + "epoch": 0.9450782602222181, + "grad_norm": 7.633810984411593, + "learning_rate": 4.57744647456762e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.59375, + "logps/chosen": -956.0, + "logps/rejected": -1088.0, + "loss": 0.3692, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.3125, + "step": 25390 + }, + { + "epoch": 0.9454504848225419, + "grad_norm": 8.336438292462582, + "learning_rate": 4.515776702073926e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.578125, + "logps/chosen": -976.0, + "logps/rejected": -1144.0, + "loss": 0.394, + "rewards/accuracies": 0.78125, + "rewards/chosen": -8.0, + "rewards/margins": 1.78125, + "rewards/rejected": -9.75, + "step": 25400 + }, + { + "epoch": 0.9458227094228657, + "grad_norm": 8.285698119956546, + "learning_rate": 4.454521389486099e-09, + "logits/chosen": -3.640625, + "logits/rejected": -3.546875, + "logps/chosen": -972.0, + "logps/rejected": -1112.0, + "loss": 0.3806, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.84375, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.375, + "step": 25410 + }, + { + "epoch": 0.9461949340231895, + "grad_norm": 8.28420116918595, + "learning_rate": 4.393680640223718e-09, + "logits/chosen": -3.90625, + "logits/rejected": -3.734375, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.3803, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.5625, + "step": 25420 + }, + { + "epoch": 0.9465671586235135, + "grad_norm": 8.465246251637536, + "learning_rate": 4.333254557006477e-09, + "logits/chosen": -3.703125, + "logits/rejected": -3.515625, + "logps/chosen": -924.0, + "logps/rejected": -1112.0, + "loss": 0.3704, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 2.015625, + "rewards/rejected": -9.5625, + "step": 25430 + }, + { + "epoch": 0.9469393832238373, + "grad_norm": 7.224155767896263, + "learning_rate": 4.273243241853852e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.515625, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3865, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.734375, + "rewards/rejected": -9.5, + "step": 25440 + }, + { + "epoch": 0.9473116078241611, + "grad_norm": 8.004760148096517, + "learning_rate": 4.213646796085157e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.640625, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.3972, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.90625, + "rewards/rejected": -9.5625, + "step": 25450 + }, + { + "epoch": 0.947683832424485, + "grad_norm": 8.778924617314685, + "learning_rate": 4.154465320319184e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.75, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3692, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.4375, + "step": 25460 + }, + { + "epoch": 0.9480560570248088, + "grad_norm": 6.82027651671271, + "learning_rate": 4.095698914474255e-09, + "logits/chosen": -3.921875, + "logits/rejected": -3.59375, + "logps/chosen": -944.0, + "logps/rejected": -1128.0, + "loss": 0.3616, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.921875, + "rewards/rejected": -9.5625, + "step": 25470 + }, + { + "epoch": 0.9484282816251326, + "grad_norm": 9.475251845700777, + "learning_rate": 4.037347677767728e-09, + "logits/chosen": -3.78125, + "logits/rejected": -3.515625, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.4001, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.625, + "step": 25480 + }, + { + "epoch": 0.9488005062254564, + "grad_norm": 8.704643368113006, + "learning_rate": 3.97941170871613e-09, + "logits/chosen": -3.71875, + "logits/rejected": -3.5625, + "logps/chosen": -936.0, + "logps/rejected": -1104.0, + "loss": 0.3724, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.5625, + "step": 25490 + }, + { + "epoch": 0.9491727308257802, + "grad_norm": 8.138239216401093, + "learning_rate": 3.921891105134884e-09, + "logits/chosen": -3.921875, + "logits/rejected": -3.84375, + "logps/chosen": -1004.0, + "logps/rejected": -1112.0, + "loss": 0.3761, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.9375, + "rewards/margins": 1.3359375, + "rewards/rejected": -9.3125, + "step": 25500 + }, + { + "epoch": 0.9495449554261041, + "grad_norm": 8.072424717729907, + "learning_rate": 3.864785964138112e-09, + "logits/chosen": -3.703125, + "logits/rejected": -3.546875, + "logps/chosen": -972.0, + "logps/rejected": -1120.0, + "loss": 0.3825, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.5625, + "step": 25510 + }, + { + "epoch": 0.949917180026428, + "grad_norm": 8.015566055455706, + "learning_rate": 3.80809638213847e-09, + "logits/chosen": -3.71875, + "logits/rejected": -3.515625, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.3623, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.5, + "step": 25520 + }, + { + "epoch": 0.9502894046267518, + "grad_norm": 7.740809910212882, + "learning_rate": 3.751822454847037e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.71875, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3675, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.8671875, + "rewards/rejected": -9.5, + "step": 25530 + }, + { + "epoch": 0.9506616292270756, + "grad_norm": 7.034224908861516, + "learning_rate": 3.6959642772730893e-09, + "logits/chosen": -3.859375, + "logits/rejected": -3.515625, + "logps/chosen": -976.0, + "logps/rejected": -1120.0, + "loss": 0.3863, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -8.0, + "rewards/margins": 1.546875, + "rewards/rejected": -9.5625, + "step": 25540 + }, + { + "epoch": 0.9510338538273995, + "grad_norm": 8.296773412644795, + "learning_rate": 3.6405219437240785e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.578125, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3685, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.71875, + "rewards/rejected": -9.375, + "step": 25550 + }, + { + "epoch": 0.9514060784277233, + "grad_norm": 7.6369514816938535, + "learning_rate": 3.5854955478052672e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.515625, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.3957, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.53125, + "rewards/margins": 1.6328125, + "rewards/rejected": -9.1875, + "step": 25560 + }, + { + "epoch": 0.9517783030280471, + "grad_norm": 7.495784635748868, + "learning_rate": 3.5308851824197296e-09, + "logits/chosen": -3.6875, + "logits/rejected": -3.5, + "logps/chosen": -940.0, + "logps/rejected": -1096.0, + "loss": 0.3732, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.75, + "rewards/margins": 1.75, + "rewards/rejected": -9.5, + "step": 25570 + }, + { + "epoch": 0.9521505276283709, + "grad_norm": 7.806614104980573, + "learning_rate": 3.476690939768101e-09, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.3773, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.875, + "rewards/margins": 1.84375, + "rewards/rejected": -9.75, + "step": 25580 + }, + { + "epoch": 0.9525227522286948, + "grad_norm": 7.836814804627553, + "learning_rate": 3.4229129113484968e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.578125, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3901, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.8125, + "rewards/margins": 1.765625, + "rewards/rejected": -9.625, + "step": 25590 + }, + { + "epoch": 0.9528949768290186, + "grad_norm": 6.980650345662951, + "learning_rate": 3.3695511879562877e-09, + "logits/chosen": -3.6875, + "logits/rejected": -3.53125, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.37, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.875, + "rewards/margins": 1.703125, + "rewards/rejected": -9.5625, + "step": 25600 + }, + { + "epoch": 0.9532672014293425, + "grad_norm": 8.900378271132563, + "learning_rate": 3.316605859684074e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.6875, + "logps/chosen": -952.0, + "logps/rejected": -1112.0, + "loss": 0.3992, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.65625, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.375, + "step": 25610 + }, + { + "epoch": 0.9536394260296663, + "grad_norm": 7.901574362846449, + "learning_rate": 3.264077015921268e-09, + "logits/chosen": -3.734375, + "logits/rejected": -3.625, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3797, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.59375, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.3125, + "step": 25620 + }, + { + "epoch": 0.9540116506299902, + "grad_norm": 7.3257724612832416, + "learning_rate": 3.21196474535429e-09, + "logits/chosen": -3.734375, + "logits/rejected": -3.578125, + "logps/chosen": -976.0, + "logps/rejected": -1160.0, + "loss": 0.3739, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.875, + "rewards/margins": 2.0, + "rewards/rejected": -9.875, + "step": 25630 + }, + { + "epoch": 0.954383875230314, + "grad_norm": 6.7874370008127345, + "learning_rate": 3.1602691359661758e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.46875, + "logps/chosen": -932.0, + "logps/rejected": -1120.0, + "loss": 0.3606, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.625, + "rewards/margins": 1.875, + "rewards/rejected": -9.5, + "step": 25640 + }, + { + "epoch": 0.9547560998306378, + "grad_norm": 7.381654221756642, + "learning_rate": 3.108990275036444e-09, + "logits/chosen": -3.640625, + "logits/rejected": -3.59375, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3886, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.71875, + "rewards/margins": 1.90625, + "rewards/rejected": -9.625, + "step": 25650 + }, + { + "epoch": 0.9551283244309616, + "grad_norm": 9.18251277547178, + "learning_rate": 3.0581282491411176e-09, + "logits/chosen": -3.90625, + "logits/rejected": -3.75, + "logps/chosen": -976.0, + "logps/rejected": -1144.0, + "loss": 0.3855, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -8.0625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.8125, + "step": 25660 + }, + { + "epoch": 0.9555005490312855, + "grad_norm": 7.317491219413723, + "learning_rate": 3.0076831441523677e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.65625, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3794, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.8125, + "rewards/margins": 1.765625, + "rewards/rejected": -9.625, + "step": 25670 + }, + { + "epoch": 0.9558727736316093, + "grad_norm": 8.822584395363911, + "learning_rate": 2.957655045238455e-09, + "logits/chosen": -3.9375, + "logits/rejected": -3.828125, + "logps/chosen": -956.0, + "logps/rejected": -1096.0, + "loss": 0.3923, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.5078125, + "rewards/rejected": -9.3125, + "step": 25680 + }, + { + "epoch": 0.9562449982319331, + "grad_norm": 9.52031695832083, + "learning_rate": 2.9080440368636773e-09, + "logits/chosen": -3.890625, + "logits/rejected": -3.5625, + "logps/chosen": -976.0, + "logps/rejected": -1120.0, + "loss": 0.4156, + "rewards/accuracies": 0.768750011920929, + "rewards/chosen": -7.9375, + "rewards/margins": 1.6015625, + "rewards/rejected": -9.5625, + "step": 25690 + }, + { + "epoch": 0.956617222832257, + "grad_norm": 8.16522125589425, + "learning_rate": 2.8588502027881156e-09, + "logits/chosen": -3.84375, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1080.0, + "loss": 0.3717, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.640625, + "rewards/rejected": -9.25, + "step": 25700 + }, + { + "epoch": 0.9569894474325809, + "grad_norm": 9.69540881989094, + "learning_rate": 2.8100736260674442e-09, + "logits/chosen": -3.78125, + "logits/rejected": -3.6875, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3786, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.3125, + "step": 25710 + }, + { + "epoch": 0.9573616720329047, + "grad_norm": 6.74493207484038, + "learning_rate": 2.761714389052955e-09, + "logits/chosen": -3.6875, + "logits/rejected": -3.5625, + "logps/chosen": -972.0, + "logps/rejected": -1104.0, + "loss": 0.3839, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.78125, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.3125, + "step": 25720 + }, + { + "epoch": 0.9577338966332285, + "grad_norm": 8.176889945201019, + "learning_rate": 2.713772573391282e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.609375, + "logps/chosen": -968.0, + "logps/rejected": -1144.0, + "loss": 0.3788, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.625, + "rewards/margins": 1.9765625, + "rewards/rejected": -9.625, + "step": 25730 + }, + { + "epoch": 0.9581061212335523, + "grad_norm": 8.062601603222628, + "learning_rate": 2.6662482600243452e-09, + "logits/chosen": -3.609375, + "logits/rejected": -3.46875, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.4082, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.71875, + "rewards/rejected": -9.4375, + "step": 25740 + }, + { + "epoch": 0.9584783458338761, + "grad_norm": 6.993259073569726, + "learning_rate": 2.619141529189184e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.734375, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.3939, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.4375, + "step": 25750 + }, + { + "epoch": 0.9588505704342, + "grad_norm": 7.967946801585202, + "learning_rate": 2.572452460417762e-09, + "logits/chosen": -3.734375, + "logits/rejected": -3.5625, + "logps/chosen": -980.0, + "logps/rejected": -1128.0, + "loss": 0.3937, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.78125, + "rewards/margins": 1.71875, + "rewards/rejected": -9.5, + "step": 25760 + }, + { + "epoch": 0.9592227950345238, + "grad_norm": 8.581037306013657, + "learning_rate": 2.526181132536942e-09, + "logits/chosen": -3.90625, + "logits/rejected": -3.578125, + "logps/chosen": -976.0, + "logps/rejected": -1160.0, + "loss": 0.3659, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.5625, + "step": 25770 + }, + { + "epoch": 0.9595950196348476, + "grad_norm": 7.593190323321908, + "learning_rate": 2.480327623668288e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.625, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3744, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 1.65625, + "rewards/rejected": -9.5, + "step": 25780 + }, + { + "epoch": 0.9599672442351715, + "grad_norm": 7.798552310304482, + "learning_rate": 2.434892011227929e-09, + "logits/chosen": -3.71875, + "logits/rejected": -3.625, + "logps/chosen": -996.0, + "logps/rejected": -1136.0, + "loss": 0.3847, + "rewards/accuracies": 0.8687499761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.75, + "step": 25790 + }, + { + "epoch": 0.9603394688354954, + "grad_norm": 10.116244172551605, + "learning_rate": 2.389874371926448e-09, + "logits/chosen": -3.734375, + "logits/rejected": -3.53125, + "logps/chosen": -972.0, + "logps/rejected": -1104.0, + "loss": 0.4119, + "rewards/accuracies": 0.762499988079071, + "rewards/chosen": -7.8125, + "rewards/margins": 1.53125, + "rewards/rejected": -9.3125, + "step": 25800 + }, + { + "epoch": 0.9607116934358192, + "grad_norm": 7.719807534308138, + "learning_rate": 2.345274781768769e-09, + "logits/chosen": -3.734375, + "logits/rejected": -3.796875, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.3676, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.75, + "rewards/margins": 1.71875, + "rewards/rejected": -9.5, + "step": 25810 + }, + { + "epoch": 0.961083918036143, + "grad_norm": 7.738893376286991, + "learning_rate": 2.3010933160539927e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.5625, + "logps/chosen": -960.0, + "logps/rejected": -1136.0, + "loss": 0.4013, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.625, + "step": 25820 + }, + { + "epoch": 0.9614561426364668, + "grad_norm": 8.963374675001797, + "learning_rate": 2.2573300493752835e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.59375, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.3896, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.5546875, + "rewards/rejected": -9.375, + "step": 25830 + }, + { + "epoch": 0.9618283672367907, + "grad_norm": 7.226494130739676, + "learning_rate": 2.213985055619788e-09, + "logits/chosen": -3.734375, + "logits/rejected": -3.65625, + "logps/chosen": -940.0, + "logps/rejected": -1088.0, + "loss": 0.3785, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.65625, + "rewards/rejected": -9.375, + "step": 25840 + }, + { + "epoch": 0.9622005918371145, + "grad_norm": 8.417548661889851, + "learning_rate": 2.171058407968357e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.609375, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3951, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.4375, + "step": 25850 + }, + { + "epoch": 0.9625728164374383, + "grad_norm": 7.305723917301859, + "learning_rate": 2.128550178895655e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -988.0, + "logps/rejected": -1144.0, + "loss": 0.374, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.875, + "rewards/margins": 1.84375, + "rewards/rejected": -9.75, + "step": 25860 + }, + { + "epoch": 0.9629450410377622, + "grad_norm": 7.879032513305666, + "learning_rate": 2.086460440169857e-09, + "logits/chosen": -3.71875, + "logits/rejected": -3.484375, + "logps/chosen": -932.0, + "logps/rejected": -1104.0, + "loss": 0.3913, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.5, + "step": 25870 + }, + { + "epoch": 0.9633172656380861, + "grad_norm": 11.534620433635054, + "learning_rate": 2.044789262852592e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.609375, + "logps/chosen": -928.0, + "logps/rejected": -1088.0, + "loss": 0.4003, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.4375, + "step": 25880 + }, + { + "epoch": 0.9636894902384099, + "grad_norm": 7.331810182404094, + "learning_rate": 2.003536717298804e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.578125, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.36, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.6875, + "rewards/margins": 1.78125, + "rewards/rejected": -9.5, + "step": 25890 + }, + { + "epoch": 0.9640617148387337, + "grad_norm": 8.61588283703836, + "learning_rate": 1.9627028731566685e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -948.0, + "logps/rejected": -1128.0, + "loss": 0.4013, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.5625, + "step": 25900 + }, + { + "epoch": 0.9644339394390575, + "grad_norm": 8.846961450421611, + "learning_rate": 1.922287799367456e-09, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -1000.0, + "logps/rejected": -1168.0, + "loss": 0.3828, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.9375, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.8125, + "step": 25910 + }, + { + "epoch": 0.9648061640393814, + "grad_norm": 6.995577685406074, + "learning_rate": 1.882291564165389e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.515625, + "logps/chosen": -956.0, + "logps/rejected": -1136.0, + "loss": 0.3566, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.75, + "step": 25920 + }, + { + "epoch": 0.9651783886397052, + "grad_norm": 9.382213783387089, + "learning_rate": 1.8427142350775638e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.546875, + "logps/chosen": -948.0, + "logps/rejected": -1120.0, + "loss": 0.4013, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.90625, + "rewards/margins": 1.84375, + "rewards/rejected": -9.75, + "step": 25930 + }, + { + "epoch": 0.965550613240029, + "grad_norm": 7.987110342805769, + "learning_rate": 1.803555878923807e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.625, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3901, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.78125, + "rewards/rejected": -9.4375, + "step": 25940 + }, + { + "epoch": 0.9659228378403528, + "grad_norm": 7.945906471987939, + "learning_rate": 1.7648165618166233e-09, + "logits/chosen": -3.71875, + "logits/rejected": -3.46875, + "logps/chosen": -968.0, + "logps/rejected": -1096.0, + "loss": 0.3913, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6875, + "rewards/rejected": -9.5, + "step": 25950 + }, + { + "epoch": 0.9662950624406768, + "grad_norm": 7.025577573931613, + "learning_rate": 1.726496349160944e-09, + "logits/chosen": -3.921875, + "logits/rejected": -3.625, + "logps/chosen": -920.0, + "logps/rejected": -1120.0, + "loss": 0.3416, + "rewards/accuracies": 0.875, + "rewards/chosen": -7.40625, + "rewards/margins": 2.171875, + "rewards/rejected": -9.625, + "step": 25960 + }, + { + "epoch": 0.9666672870410006, + "grad_norm": 8.6813760592304, + "learning_rate": 1.688595305654239e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.53125, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.3868, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.625, + "rewards/rejected": -9.375, + "step": 25970 + }, + { + "epoch": 0.9670395116413244, + "grad_norm": 6.809003511614786, + "learning_rate": 1.651113495286155e-09, + "logits/chosen": -3.6875, + "logits/rejected": -3.53125, + "logps/chosen": -984.0, + "logps/rejected": -1136.0, + "loss": 0.3897, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.625, + "step": 25980 + }, + { + "epoch": 0.9674117362416482, + "grad_norm": 8.258772799954308, + "learning_rate": 1.6140509813386273e-09, + "logits/chosen": -3.671875, + "logits/rejected": -3.453125, + "logps/chosen": -968.0, + "logps/rejected": -1104.0, + "loss": 0.3866, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.75, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.375, + "step": 25990 + }, + { + "epoch": 0.967783960841972, + "grad_norm": 8.085420707648852, + "learning_rate": 1.5774078263856571e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.703125, + "logps/chosen": -956.0, + "logps/rejected": -1112.0, + "loss": 0.3866, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.671875, + "rewards/rejected": -9.5, + "step": 26000 + }, + { + "epoch": 0.9681561854422959, + "grad_norm": 6.763752401290458, + "learning_rate": 1.5411840922931184e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.5625, + "logps/chosen": -948.0, + "logps/rejected": -1104.0, + "loss": 0.3653, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.875, + "rewards/rejected": -9.625, + "step": 26010 + }, + { + "epoch": 0.9685284100426197, + "grad_norm": 8.873395725235099, + "learning_rate": 1.5053798402189788e-09, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -952.0, + "logps/rejected": -1104.0, + "loss": 0.3893, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.65625, + "rewards/rejected": -9.375, + "step": 26020 + }, + { + "epoch": 0.9689006346429435, + "grad_norm": 7.638329481683679, + "learning_rate": 1.4699951306127722e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.65625, + "logps/chosen": -1004.0, + "logps/rejected": -1144.0, + "loss": 0.3621, + "rewards/accuracies": 0.78125, + "rewards/chosen": -8.0625, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.8125, + "step": 26030 + }, + { + "epoch": 0.9692728592432673, + "grad_norm": 8.548017444344138, + "learning_rate": 1.4350300232158218e-09, + "logits/chosen": -3.890625, + "logits/rejected": -3.71875, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.3928, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.4375, + "step": 26040 + }, + { + "epoch": 0.9696450838435913, + "grad_norm": 8.345502480858306, + "learning_rate": 1.400484577060962e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.796875, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.3772, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.765625, + "rewards/rejected": -9.5, + "step": 26050 + }, + { + "epoch": 0.9700173084439151, + "grad_norm": 6.655085833674345, + "learning_rate": 1.3663588504725098e-09, + "logits/chosen": -3.765625, + "logits/rejected": -3.671875, + "logps/chosen": -944.0, + "logps/rejected": -1088.0, + "loss": 0.3745, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.5625, + "rewards/margins": 1.65625, + "rewards/rejected": -9.25, + "step": 26060 + }, + { + "epoch": 0.9703895330442389, + "grad_norm": 9.511087938778354, + "learning_rate": 1.3326529010662112e-09, + "logits/chosen": -3.71875, + "logits/rejected": -3.671875, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.3809, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.53125, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.4375, + "step": 26070 + }, + { + "epoch": 0.9707617576445627, + "grad_norm": 8.245052236908169, + "learning_rate": 1.2993667857489898e-09, + "logits/chosen": -3.90625, + "logits/rejected": -3.609375, + "logps/chosen": -964.0, + "logps/rejected": -1128.0, + "loss": 0.36, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.625, + "step": 26080 + }, + { + "epoch": 0.9711339822448866, + "grad_norm": 7.044550269147712, + "learning_rate": 1.2665005607190581e-09, + "logits/chosen": -3.75, + "logits/rejected": -3.6875, + "logps/chosen": -952.0, + "logps/rejected": -1104.0, + "loss": 0.3812, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.671875, + "rewards/rejected": -9.375, + "step": 26090 + }, + { + "epoch": 0.9715062068452104, + "grad_norm": 7.635425409795397, + "learning_rate": 1.2340542814655853e-09, + "logits/chosen": -3.875, + "logits/rejected": -3.8125, + "logps/chosen": -992.0, + "logps/rejected": -1136.0, + "loss": 0.368, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.875, + "rewards/margins": 1.671875, + "rewards/rejected": -9.5625, + "step": 26100 + }, + { + "epoch": 0.9718784314455342, + "grad_norm": 8.719924367688913, + "learning_rate": 1.2020280027688622e-09, + "logits/chosen": -3.796875, + "logits/rejected": -3.546875, + "logps/chosen": -972.0, + "logps/rejected": -1104.0, + "loss": 0.3911, + "rewards/accuracies": 0.7124999761581421, + "rewards/chosen": -7.9375, + "rewards/margins": 1.40625, + "rewards/rejected": -9.375, + "step": 26110 + }, + { + "epoch": 0.972250656045858, + "grad_norm": 7.164402845771902, + "learning_rate": 1.1704217786999703e-09, + "logits/chosen": -3.8125, + "logits/rejected": -3.46875, + "logps/chosen": -960.0, + "logps/rejected": -1112.0, + "loss": 0.3701, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.90625, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.5625, + "step": 26120 + }, + { + "epoch": 0.9726228806461819, + "grad_norm": 7.87262105810357, + "learning_rate": 1.139235662620891e-09, + "logits/chosen": -3.984375, + "logits/rejected": -3.765625, + "logps/chosen": -1004.0, + "logps/rejected": -1152.0, + "loss": 0.4072, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -8.0625, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.625, + "step": 26130 + }, + { + "epoch": 0.9729951052465058, + "grad_norm": 8.144870765894575, + "learning_rate": 1.1084697071842008e-09, + "logits/chosen": -3.796875, + "logits/rejected": -3.515625, + "logps/chosen": -944.0, + "logps/rejected": -1096.0, + "loss": 0.3756, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.625, + "rewards/margins": 1.75, + "rewards/rejected": -9.375, + "step": 26140 + }, + { + "epoch": 0.9733673298468296, + "grad_norm": 6.937050152498703, + "learning_rate": 1.0781239643332384e-09, + "logits/chosen": -3.890625, + "logits/rejected": -3.671875, + "logps/chosen": -984.0, + "logps/rejected": -1152.0, + "loss": 0.3759, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.90625, + "rewards/margins": 1.796875, + "rewards/rejected": -9.6875, + "step": 26150 + }, + { + "epoch": 0.9737395544471534, + "grad_norm": 9.082579862245037, + "learning_rate": 1.0481984853017988e-09, + "logits/chosen": -3.703125, + "logits/rejected": -3.65625, + "logps/chosen": -972.0, + "logps/rejected": -1128.0, + "loss": 0.3746, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.78125, + "rewards/margins": 1.609375, + "rewards/rejected": -9.375, + "step": 26160 + }, + { + "epoch": 0.9741117790474773, + "grad_norm": 8.27083146515157, + "learning_rate": 1.0186933206141612e-09, + "logits/chosen": -3.828125, + "logits/rejected": -3.609375, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3678, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.75, + "rewards/rejected": -9.5, + "step": 26170 + }, + { + "epoch": 0.9744840036478011, + "grad_norm": 7.107041321925005, + "learning_rate": 9.89608520084978e-10, + "logits/chosen": -3.6875, + "logits/rejected": -3.703125, + "logps/chosen": -1008.0, + "logps/rejected": -1152.0, + "loss": 0.4007, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -8.0, + "rewards/margins": 1.8046875, + "rewards/rejected": -9.8125, + "step": 26180 + }, + { + "epoch": 0.9748562282481249, + "grad_norm": 8.50234389762464, + "learning_rate": 9.609441328191082e-10, + "logits/chosen": -3.828125, + "logits/rejected": -3.578125, + "logps/chosen": -968.0, + "logps/rejected": -1136.0, + "loss": 0.3862, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.65625, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.5, + "step": 26190 + }, + { + "epoch": 0.9752284528484487, + "grad_norm": 7.991625998355685, + "learning_rate": 9.327002072117563e-10, + "logits/chosen": -3.734375, + "logits/rejected": -3.421875, + "logps/chosen": -964.0, + "logps/rejected": -1136.0, + "loss": 0.388, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.703125, + "rewards/rejected": -9.5625, + "step": 26200 + }, + { + "epoch": 0.9756006774487725, + "grad_norm": 7.61531207710337, + "learning_rate": 9.048767909480837e-10, + "logits/chosen": -3.78125, + "logits/rejected": -3.515625, + "logps/chosen": -944.0, + "logps/rejected": -1104.0, + "loss": 0.3741, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.375, + "step": 26210 + }, + { + "epoch": 0.9759729020490965, + "grad_norm": 8.957474840452447, + "learning_rate": 8.774739310034585e-10, + "logits/chosen": -3.8125, + "logits/rejected": -3.71875, + "logps/chosen": -980.0, + "logps/rejected": -1128.0, + "loss": 0.3625, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.765625, + "rewards/rejected": -9.5625, + "step": 26220 + }, + { + "epoch": 0.9763451266494203, + "grad_norm": 7.349552090097092, + "learning_rate": 8.504916736430667e-10, + "logits/chosen": -3.859375, + "logits/rejected": -3.53125, + "logps/chosen": -972.0, + "logps/rejected": -1136.0, + "loss": 0.4034, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.875, + "rewards/margins": 1.9296875, + "rewards/rejected": -9.8125, + "step": 26230 + }, + { + "epoch": 0.9767173512497441, + "grad_norm": 7.213014655405053, + "learning_rate": 8.239300644220237e-10, + "logits/chosen": -3.84375, + "logits/rejected": -3.71875, + "logps/chosen": -1012.0, + "logps/rejected": -1160.0, + "loss": 0.3794, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.9375, + "rewards/margins": 1.8515625, + "rewards/rejected": -9.75, + "step": 26240 + }, + { + "epoch": 0.977089575850068, + "grad_norm": 6.697929968556677, + "learning_rate": 7.977891481852906e-10, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3999, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.9375, + "rewards/margins": 1.7109375, + "rewards/rejected": -9.6875, + "step": 26250 + }, + { + "epoch": 0.9774618004503918, + "grad_norm": 8.565907787681383, + "learning_rate": 7.720689690674798e-10, + "logits/chosen": -3.8125, + "logits/rejected": -3.640625, + "logps/chosen": -932.0, + "logps/rejected": -1104.0, + "loss": 0.379, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.53125, + "rewards/margins": 1.859375, + "rewards/rejected": -9.375, + "step": 26260 + }, + { + "epoch": 0.9778340250507156, + "grad_norm": 8.59511364501124, + "learning_rate": 7.467695704929666e-10, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -980.0, + "logps/rejected": -1136.0, + "loss": 0.3682, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.8125, + "rewards/margins": 1.78125, + "rewards/rejected": -9.5625, + "step": 26270 + }, + { + "epoch": 0.9782062496510394, + "grad_norm": 8.250858173852171, + "learning_rate": 7.218909951755836e-10, + "logits/chosen": -3.75, + "logits/rejected": -3.75, + "logps/chosen": -956.0, + "logps/rejected": -1104.0, + "loss": 0.4063, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.625, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.375, + "step": 26280 + }, + { + "epoch": 0.9785784742513632, + "grad_norm": 8.450769404262243, + "learning_rate": 6.974332851187592e-10, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -956.0, + "logps/rejected": -1120.0, + "loss": 0.3986, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.71875, + "rewards/margins": 1.7890625, + "rewards/rejected": -9.5, + "step": 26290 + }, + { + "epoch": 0.9789506988516871, + "grad_norm": 7.956833651297262, + "learning_rate": 6.733964816153237e-10, + "logits/chosen": -3.859375, + "logits/rejected": -3.765625, + "logps/chosen": -988.0, + "logps/rejected": -1136.0, + "loss": 0.3676, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -8.0, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.6875, + "step": 26300 + }, + { + "epoch": 0.979322923452011, + "grad_norm": 8.702286729175416, + "learning_rate": 6.497806252474814e-10, + "logits/chosen": -3.78125, + "logits/rejected": -3.625, + "logps/chosen": -928.0, + "logps/rejected": -1080.0, + "loss": 0.3837, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.65625, + "rewards/margins": 1.59375, + "rewards/rejected": -9.25, + "step": 26310 + }, + { + "epoch": 0.9796951480523348, + "grad_norm": 7.602147763743852, + "learning_rate": 6.265857558867271e-10, + "logits/chosen": -3.65625, + "logits/rejected": -3.40625, + "logps/chosen": -968.0, + "logps/rejected": -1120.0, + "loss": 0.369, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.65625, + "rewards/margins": 1.734375, + "rewards/rejected": -9.375, + "step": 26320 + }, + { + "epoch": 0.9800673726526586, + "grad_norm": 7.003905768878151, + "learning_rate": 6.038119126938191e-10, + "logits/chosen": -3.859375, + "logits/rejected": -3.6875, + "logps/chosen": -956.0, + "logps/rejected": -1096.0, + "loss": 0.3887, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.375, + "step": 26330 + }, + { + "epoch": 0.9804395972529825, + "grad_norm": 8.172243776991232, + "learning_rate": 5.814591341186392e-10, + "logits/chosen": -3.734375, + "logits/rejected": -3.671875, + "logps/chosen": -964.0, + "logps/rejected": -1104.0, + "loss": 0.382, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6953125, + "rewards/rejected": -9.5, + "step": 26340 + }, + { + "epoch": 0.9808118218533063, + "grad_norm": 8.412479608639437, + "learning_rate": 5.595274579002219e-10, + "logits/chosen": -3.859375, + "logits/rejected": -3.703125, + "logps/chosen": -968.0, + "logps/rejected": -1136.0, + "loss": 0.3821, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.828125, + "rewards/rejected": -9.5625, + "step": 26350 + }, + { + "epoch": 0.9811840464536301, + "grad_norm": 9.828988978201002, + "learning_rate": 5.380169210666141e-10, + "logits/chosen": -3.875, + "logits/rejected": -3.546875, + "logps/chosen": -952.0, + "logps/rejected": -1128.0, + "loss": 0.4118, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.8125, + "rewards/margins": 1.8125, + "rewards/rejected": -9.625, + "step": 26360 + }, + { + "epoch": 0.9815562710539539, + "grad_norm": 8.205889761169583, + "learning_rate": 5.169275599347933e-10, + "logits/chosen": -3.9375, + "logits/rejected": -3.765625, + "logps/chosen": -1008.0, + "logps/rejected": -1152.0, + "loss": 0.3924, + "rewards/accuracies": 0.7437499761581421, + "rewards/chosen": -8.0, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.6875, + "step": 26370 + }, + { + "epoch": 0.9819284956542778, + "grad_norm": 7.088840004209817, + "learning_rate": 4.96259410110722e-10, + "logits/chosen": -3.90625, + "logits/rejected": -3.8125, + "logps/chosen": -952.0, + "logps/rejected": -1128.0, + "loss": 0.3533, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.75, + "rewards/margins": 1.78125, + "rewards/rejected": -9.5625, + "step": 26380 + }, + { + "epoch": 0.9823007202546016, + "grad_norm": 9.365059660968761, + "learning_rate": 4.760125064891818e-10, + "logits/chosen": -3.796875, + "logits/rejected": -3.671875, + "logps/chosen": -1000.0, + "logps/rejected": -1144.0, + "loss": 0.3741, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.78125, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.6875, + "step": 26390 + }, + { + "epoch": 0.9826729448549255, + "grad_norm": 8.742787351403228, + "learning_rate": 4.561868832537452e-10, + "logits/chosen": -3.90625, + "logits/rejected": -3.78125, + "logps/chosen": -960.0, + "logps/rejected": -1136.0, + "loss": 0.385, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.9453125, + "rewards/rejected": -9.625, + "step": 26400 + }, + { + "epoch": 0.9830451694552493, + "grad_norm": 8.124395148854394, + "learning_rate": 4.367825738767206e-10, + "logits/chosen": -3.78125, + "logits/rejected": -3.609375, + "logps/chosen": -924.0, + "logps/rejected": -1080.0, + "loss": 0.3806, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.5, + "rewards/margins": 1.703125, + "rewards/rejected": -9.1875, + "step": 26410 + }, + { + "epoch": 0.9834173940555732, + "grad_norm": 6.030875182374471, + "learning_rate": 4.1779961111915176e-10, + "logits/chosen": -3.75, + "logits/rejected": -3.515625, + "logps/chosen": -968.0, + "logps/rejected": -1104.0, + "loss": 0.3741, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.71875, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.3125, + "step": 26420 + }, + { + "epoch": 0.983789618655897, + "grad_norm": 7.203717583031877, + "learning_rate": 3.9923802703059616e-10, + "logits/chosen": -3.875, + "logits/rejected": -3.78125, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3748, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.5, + "step": 26430 + }, + { + "epoch": 0.9841618432562208, + "grad_norm": 7.372912886531599, + "learning_rate": 3.810978529493192e-10, + "logits/chosen": -3.828125, + "logits/rejected": -3.59375, + "logps/chosen": -964.0, + "logps/rejected": -1120.0, + "loss": 0.3724, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.84375, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.625, + "step": 26440 + }, + { + "epoch": 0.9845340678565446, + "grad_norm": 9.426056803322183, + "learning_rate": 3.633791195019886e-10, + "logits/chosen": -3.8125, + "logits/rejected": -3.734375, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.3893, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.78125, + "rewards/margins": 1.625, + "rewards/rejected": -9.4375, + "step": 26450 + }, + { + "epoch": 0.9849062924568684, + "grad_norm": 8.294701337525558, + "learning_rate": 3.4608185660378595e-10, + "logits/chosen": -3.84375, + "logits/rejected": -3.640625, + "logps/chosen": -944.0, + "logps/rejected": -1080.0, + "loss": 0.3694, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.625, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.4375, + "step": 26460 + }, + { + "epoch": 0.9852785170571923, + "grad_norm": 8.926083775976789, + "learning_rate": 3.292060934582952e-10, + "logits/chosen": -3.703125, + "logits/rejected": -3.765625, + "logps/chosen": -976.0, + "logps/rejected": -1128.0, + "loss": 0.4062, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.59375, + "rewards/rejected": -9.3125, + "step": 26470 + }, + { + "epoch": 0.9856507416575161, + "grad_norm": 7.703145819604227, + "learning_rate": 3.127518585575306e-10, + "logits/chosen": -3.75, + "logits/rejected": -3.625, + "logps/chosen": -968.0, + "logps/rejected": -1144.0, + "loss": 0.3828, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.71875, + "rewards/margins": 1.890625, + "rewards/rejected": -9.625, + "step": 26480 + }, + { + "epoch": 0.98602296625784, + "grad_norm": 8.101749726553084, + "learning_rate": 2.9671917968171476e-10, + "logits/chosen": -3.703125, + "logits/rejected": -3.59375, + "logps/chosen": -992.0, + "logps/rejected": -1128.0, + "loss": 0.379, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.96875, + "rewards/margins": 1.65625, + "rewards/rejected": -9.625, + "step": 26490 + }, + { + "epoch": 0.9863951908581639, + "grad_norm": 7.395431479810991, + "learning_rate": 2.8110808389944506e-10, + "logits/chosen": -3.9375, + "logits/rejected": -3.734375, + "logps/chosen": -964.0, + "logps/rejected": -1144.0, + "loss": 0.3849, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.9375, + "rewards/rejected": -9.625, + "step": 26500 + }, + { + "epoch": 0.9867674154584877, + "grad_norm": 7.100411645891299, + "learning_rate": 2.6591859756749934e-10, + "logits/chosen": -3.90625, + "logits/rejected": -3.828125, + "logps/chosen": -980.0, + "logps/rejected": -1120.0, + "loss": 0.4007, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.4375, + "step": 26510 + }, + { + "epoch": 0.9871396400588115, + "grad_norm": 9.680375208847861, + "learning_rate": 2.511507463307805e-10, + "logits/chosen": -3.78125, + "logits/rejected": -3.65625, + "logps/chosen": -984.0, + "logps/rejected": -1128.0, + "loss": 0.3839, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 1.734375, + "rewards/rejected": -9.5625, + "step": 26520 + }, + { + "epoch": 0.9875118646591353, + "grad_norm": 7.258127167075642, + "learning_rate": 2.3680455512242736e-10, + "logits/chosen": -3.71875, + "logits/rejected": -3.59375, + "logps/chosen": -976.0, + "logps/rejected": -1128.0, + "loss": 0.3927, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.78125, + "rewards/margins": 1.7421875, + "rewards/rejected": -9.5, + "step": 26530 + }, + { + "epoch": 0.9878840892594591, + "grad_norm": 7.101665376958755, + "learning_rate": 2.2288004816364836e-10, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -1000.0, + "logps/rejected": -1136.0, + "loss": 0.378, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.96875, + "rewards/margins": 1.5234375, + "rewards/rejected": -9.5, + "step": 26540 + }, + { + "epoch": 0.988256313859783, + "grad_norm": 6.759720674510336, + "learning_rate": 2.0937724896369358e-10, + "logits/chosen": -3.828125, + "logits/rejected": -3.671875, + "logps/chosen": -976.0, + "logps/rejected": -1136.0, + "loss": 0.3864, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.875, + "rewards/margins": 1.7265625, + "rewards/rejected": -9.625, + "step": 26550 + }, + { + "epoch": 0.9886285384601068, + "grad_norm": 8.087977294537376, + "learning_rate": 1.9629618031977159e-10, + "logits/chosen": -3.765625, + "logits/rejected": -3.640625, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.3668, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.71875, + "rewards/margins": 1.75, + "rewards/rejected": -9.4375, + "step": 26560 + }, + { + "epoch": 0.9890007630604306, + "grad_norm": 7.0346301508083755, + "learning_rate": 1.8363686431718817e-10, + "logits/chosen": -3.703125, + "logits/rejected": -3.578125, + "logps/chosen": -980.0, + "logps/rejected": -1120.0, + "loss": 0.368, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.9375, + "rewards/margins": 1.6796875, + "rewards/rejected": -9.5625, + "step": 26570 + }, + { + "epoch": 0.9893729876607545, + "grad_norm": 9.18932553593361, + "learning_rate": 1.713993223290966e-10, + "logits/chosen": -3.796875, + "logits/rejected": -3.546875, + "logps/chosen": -972.0, + "logps/rejected": -1144.0, + "loss": 0.3683, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.796875, + "rewards/rejected": -9.6875, + "step": 26580 + }, + { + "epoch": 0.9897452122610784, + "grad_norm": 8.17021118499696, + "learning_rate": 1.5958357501658082e-10, + "logits/chosen": -3.859375, + "logits/rejected": -3.515625, + "logps/chosen": -968.0, + "logps/rejected": -1136.0, + "loss": 0.3604, + "rewards/accuracies": 0.84375, + "rewards/chosen": -7.6875, + "rewards/margins": 1.8984375, + "rewards/rejected": -9.5625, + "step": 26590 + }, + { + "epoch": 0.9901174368614022, + "grad_norm": 7.8419687425859514, + "learning_rate": 1.4818964232859997e-10, + "logits/chosen": -3.84375, + "logits/rejected": -3.765625, + "logps/chosen": -932.0, + "logps/rejected": -1096.0, + "loss": 0.3609, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.59375, + "rewards/margins": 1.9140625, + "rewards/rejected": -9.5, + "step": 26600 + }, + { + "epoch": 0.990489661461726, + "grad_norm": 7.7097494221947125, + "learning_rate": 1.3721754350196068e-10, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -932.0, + "logps/rejected": -1088.0, + "loss": 0.3736, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.5625, + "rewards/margins": 1.7734375, + "rewards/rejected": -9.3125, + "step": 26610 + }, + { + "epoch": 0.9908618860620498, + "grad_norm": 7.307867888252128, + "learning_rate": 1.2666729706120593e-10, + "logits/chosen": -3.703125, + "logits/rejected": -3.59375, + "logps/chosen": -988.0, + "logps/rejected": -1104.0, + "loss": 0.3824, + "rewards/accuracies": 0.7562500238418579, + "rewards/chosen": -7.875, + "rewards/margins": 1.4765625, + "rewards/rejected": -9.375, + "step": 26620 + }, + { + "epoch": 0.9912341106623737, + "grad_norm": 8.737926345280744, + "learning_rate": 1.1653892081875393e-10, + "logits/chosen": -3.796875, + "logits/rejected": -3.546875, + "logps/chosen": -948.0, + "logps/rejected": -1072.0, + "loss": 0.4016, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.75, + "rewards/margins": 1.4765625, + "rewards/rejected": -9.1875, + "step": 26630 + }, + { + "epoch": 0.9916063352626975, + "grad_norm": 7.361966512705138, + "learning_rate": 1.0683243187467605e-10, + "logits/chosen": -3.75, + "logits/rejected": -3.578125, + "logps/chosen": -940.0, + "logps/rejected": -1112.0, + "loss": 0.3613, + "rewards/accuracies": 0.78125, + "rewards/chosen": -7.75, + "rewards/margins": 1.703125, + "rewards/rejected": -9.4375, + "step": 26640 + }, + { + "epoch": 0.9919785598630213, + "grad_norm": 8.367082026222384, + "learning_rate": 9.754784661680781e-11, + "logits/chosen": -3.84375, + "logits/rejected": -3.609375, + "logps/chosen": -948.0, + "logps/rejected": -1112.0, + "loss": 0.3808, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.5625, + "step": 26650 + }, + { + "epoch": 0.9923507844633452, + "grad_norm": 7.587400315305485, + "learning_rate": 8.86851807206379e-11, + "logits/chosen": -3.65625, + "logits/rejected": -3.484375, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.3781, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.78125, + "rewards/margins": 1.6171875, + "rewards/rejected": -9.4375, + "step": 26660 + }, + { + "epoch": 0.9927230090636691, + "grad_norm": 8.357062950161398, + "learning_rate": 8.024444914933592e-11, + "logits/chosen": -3.6875, + "logits/rejected": -3.5625, + "logps/chosen": -936.0, + "logps/rejected": -1112.0, + "loss": 0.3817, + "rewards/accuracies": 0.8500000238418579, + "rewards/chosen": -7.46875, + "rewards/margins": 2.03125, + "rewards/rejected": -9.5, + "step": 26670 + }, + { + "epoch": 0.9930952336639929, + "grad_norm": 6.956484332419937, + "learning_rate": 7.222566615369685e-11, + "logits/chosen": -3.703125, + "logits/rejected": -3.703125, + "logps/chosen": -956.0, + "logps/rejected": -1080.0, + "loss": 0.3831, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.4765625, + "rewards/rejected": -9.1875, + "step": 26680 + }, + { + "epoch": 0.9934674582643167, + "grad_norm": 7.987048267727548, + "learning_rate": 6.462884527208557e-11, + "logits/chosen": -3.875, + "logits/rejected": -3.71875, + "logps/chosen": -960.0, + "logps/rejected": -1096.0, + "loss": 0.3818, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5703125, + "rewards/rejected": -9.25, + "step": 26690 + }, + { + "epoch": 0.9938396828646405, + "grad_norm": 8.219012769301218, + "learning_rate": 5.745399933054784e-11, + "logits/chosen": -3.890625, + "logits/rejected": -3.65625, + "logps/chosen": -976.0, + "logps/rejected": -1112.0, + "loss": 0.3899, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.8125, + "rewards/margins": 1.578125, + "rewards/rejected": -9.375, + "step": 26700 + }, + { + "epoch": 0.9942119074649644, + "grad_norm": 7.202948773839784, + "learning_rate": 5.0701140442588333e-11, + "logits/chosen": -3.78125, + "logits/rejected": -3.546875, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3624, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.75, + "rewards/margins": 1.7578125, + "rewards/rejected": -9.5, + "step": 26710 + }, + { + "epoch": 0.9945841320652882, + "grad_norm": 10.050238710877242, + "learning_rate": 4.437028000933707e-11, + "logits/chosen": -3.859375, + "logits/rejected": -3.734375, + "logps/chosen": -972.0, + "logps/rejected": -1112.0, + "loss": 0.3961, + "rewards/accuracies": 0.8374999761581421, + "rewards/chosen": -7.71875, + "rewards/margins": 1.6484375, + "rewards/rejected": -9.375, + "step": 26720 + }, + { + "epoch": 0.994956356665612, + "grad_norm": 8.338915990686202, + "learning_rate": 3.846142871938296e-11, + "logits/chosen": -3.671875, + "logits/rejected": -3.625, + "logps/chosen": -948.0, + "logps/rejected": -1088.0, + "loss": 0.4126, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.6875, + "rewards/margins": 1.5, + "rewards/rejected": -9.1875, + "step": 26730 + }, + { + "epoch": 0.9953285812659358, + "grad_norm": 7.43525476756313, + "learning_rate": 3.2974596548884795e-11, + "logits/chosen": -3.765625, + "logits/rejected": -3.59375, + "logps/chosen": -968.0, + "logps/rejected": -1128.0, + "loss": 0.3608, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.6875, + "rewards/margins": 1.8359375, + "rewards/rejected": -9.5, + "step": 26740 + }, + { + "epoch": 0.9957008058662598, + "grad_norm": 7.504889509854151, + "learning_rate": 2.790979276143246e-11, + "logits/chosen": -3.875, + "logits/rejected": -3.703125, + "logps/chosen": -988.0, + "logps/rejected": -1128.0, + "loss": 0.3774, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.90625, + "rewards/margins": 1.578125, + "rewards/rejected": -9.5, + "step": 26750 + }, + { + "epoch": 0.9960730304665836, + "grad_norm": 7.8583811465473685, + "learning_rate": 2.3267025908130232e-11, + "logits/chosen": -3.75, + "logits/rejected": -3.609375, + "logps/chosen": -940.0, + "logps/rejected": -1120.0, + "loss": 0.389, + "rewards/accuracies": 0.862500011920929, + "rewards/chosen": -7.53125, + "rewards/margins": 1.9765625, + "rewards/rejected": -9.5, + "step": 26760 + }, + { + "epoch": 0.9964452550669074, + "grad_norm": 7.737852756401967, + "learning_rate": 1.9046303827569e-11, + "logits/chosen": -3.859375, + "logits/rejected": -3.59375, + "logps/chosen": -940.0, + "logps/rejected": -1104.0, + "loss": 0.366, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.59375, + "rewards/margins": 1.8828125, + "rewards/rejected": -9.5, + "step": 26770 + }, + { + "epoch": 0.9968174796672312, + "grad_norm": 7.547117337051925, + "learning_rate": 1.524763364565973e-11, + "logits/chosen": -3.84375, + "logits/rejected": -3.546875, + "logps/chosen": -972.0, + "logps/rejected": -1136.0, + "loss": 0.3758, + "rewards/accuracies": 0.8125, + "rewards/chosen": -7.84375, + "rewards/margins": 1.765625, + "rewards/rejected": -9.625, + "step": 26780 + }, + { + "epoch": 0.997189704267555, + "grad_norm": 7.564753887340131, + "learning_rate": 1.1871021775911039e-11, + "logits/chosen": -3.875, + "logits/rejected": -3.65625, + "logps/chosen": -984.0, + "logps/rejected": -1136.0, + "loss": 0.4028, + "rewards/accuracies": 0.831250011920929, + "rewards/chosen": -7.8125, + "rewards/margins": 1.8203125, + "rewards/rejected": -9.625, + "step": 26790 + }, + { + "epoch": 0.9975619288678789, + "grad_norm": 7.1182855851862055, + "learning_rate": 8.916473919151624e-12, + "logits/chosen": -3.8125, + "logits/rejected": -3.5625, + "logps/chosen": -952.0, + "logps/rejected": -1120.0, + "loss": 0.3697, + "rewards/accuracies": 0.856249988079071, + "rewards/chosen": -7.71875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.5, + "step": 26800 + }, + { + "epoch": 0.9979341534682027, + "grad_norm": 6.857767271478771, + "learning_rate": 6.38399506364129e-12, + "logits/chosen": -3.765625, + "logits/rejected": -3.578125, + "logps/chosen": -956.0, + "logps/rejected": -1128.0, + "loss": 0.3677, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.765625, + "rewards/rejected": -9.625, + "step": 26810 + }, + { + "epoch": 0.9983063780685265, + "grad_norm": 8.576975690718706, + "learning_rate": 4.27358948507095e-12, + "logits/chosen": -3.671875, + "logits/rejected": -3.6875, + "logps/chosen": -976.0, + "logps/rejected": -1096.0, + "loss": 0.3854, + "rewards/accuracies": 0.75, + "rewards/chosen": -7.90625, + "rewards/margins": 1.5625, + "rewards/rejected": -9.4375, + "step": 26820 + }, + { + "epoch": 0.9986786026688503, + "grad_norm": 7.790291258127137, + "learning_rate": 2.5852607465071118e-12, + "logits/chosen": -3.8125, + "logits/rejected": -3.671875, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3911, + "rewards/accuracies": 0.793749988079071, + "rewards/chosen": -7.875, + "rewards/margins": 1.5859375, + "rewards/rejected": -9.4375, + "step": 26830 + }, + { + "epoch": 0.9990508272691743, + "grad_norm": 8.0689377246478, + "learning_rate": 1.3190116984196365e-12, + "logits/chosen": -3.921875, + "logits/rejected": -3.75, + "logps/chosen": -968.0, + "logps/rejected": -1112.0, + "loss": 0.3842, + "rewards/accuracies": 0.7875000238418579, + "rewards/chosen": -7.84375, + "rewards/margins": 1.6640625, + "rewards/rejected": -9.5, + "step": 26840 + }, + { + "epoch": 0.9994230518694981, + "grad_norm": 9.268939312547884, + "learning_rate": 4.748444786539796e-13, + "logits/chosen": -3.828125, + "logits/rejected": -3.8125, + "logps/chosen": -984.0, + "logps/rejected": -1168.0, + "loss": 0.3913, + "rewards/accuracies": 0.8062499761581421, + "rewards/chosen": -7.96875, + "rewards/margins": 1.8125, + "rewards/rejected": -9.8125, + "step": 26850 + }, + { + "epoch": 0.9997952764698219, + "grad_norm": 8.988014038511007, + "learning_rate": 5.2760512486704765e-14, + "logits/chosen": -3.8125, + "logits/rejected": -3.625, + "logps/chosen": -952.0, + "logps/rejected": -1096.0, + "loss": 0.3867, + "rewards/accuracies": 0.8187500238418579, + "rewards/chosen": -7.59375, + "rewards/margins": 1.546875, + "rewards/rejected": -9.125, + "step": 26860 + }, + { + "epoch": 0.9999813887699838, + "step": 26865, + "total_flos": 0.0, + "train_loss": 0.0, + "train_runtime": 18.8042, + "train_samples_per_second": 182872.522, + "train_steps_per_second": 1428.667 + } + ], + "logging_steps": 10, + "max_steps": 26865, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 5000, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 8, + "trial_name": null, + "trial_params": null +}