{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9989835922753013, "eval_steps": 500, "global_step": 430, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002323217656454189, "grad_norm": 323.048828125, "learning_rate": 1.995348837209302e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.7421875, "logps/chosen": -130.0, "logps/rejected": -126.0, "loss": 22.125, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1 }, { "epoch": 0.004646435312908378, "grad_norm": 338.7125244140625, "learning_rate": 1.9906976744186046e-06, "logits/chosen": -0.75, "logits/rejected": -0.75, "logps/chosen": -129.0, "logps/rejected": -137.0, "loss": 22.3984, "rewards/accuracies": 0.21875, "rewards/chosen": 0.01251220703125, "rewards/margins": -0.01409912109375, "rewards/rejected": 0.026611328125, "step": 2 }, { "epoch": 0.0069696529693625674, "grad_norm": 324.7102355957031, "learning_rate": 1.9860465116279068e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.69921875, "logps/chosen": -134.0, "logps/rejected": -112.0, "loss": 22.25, "rewards/accuracies": 0.34375, "rewards/chosen": 0.0152587890625, "rewards/margins": -0.00311279296875, "rewards/rejected": 0.0184326171875, "step": 3 }, { "epoch": 0.009292870625816756, "grad_norm": 359.8957824707031, "learning_rate": 1.9813953488372093e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.7734375, "logps/chosen": -144.0, "logps/rejected": -121.0, "loss": 22.0312, "rewards/accuracies": 0.46875, "rewards/chosen": 0.0031280517578125, "rewards/margins": 0.01092529296875, "rewards/rejected": -0.0078125, "step": 4 }, { "epoch": 0.011616088282270945, "grad_norm": 337.0638122558594, "learning_rate": 1.9767441860465115e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.7890625, "logps/chosen": -122.0, "logps/rejected": -114.0, "loss": 21.7578, "rewards/accuracies": 0.46875, "rewards/chosen": 0.02734375, "rewards/margins": 0.02734375, "rewards/rejected": 0.0, "step": 5 }, { "epoch": 0.013939305938725135, "grad_norm": 325.502197265625, "learning_rate": 1.972093023255814e-06, "logits/chosen": -0.796875, "logits/rejected": -0.75390625, "logps/chosen": -123.0, "logps/rejected": -117.5, "loss": 21.9141, "rewards/accuracies": 0.5625, "rewards/chosen": 0.0218505859375, "rewards/margins": 0.0211181640625, "rewards/rejected": 0.000782012939453125, "step": 6 }, { "epoch": 0.016262523595179323, "grad_norm": 319.614990234375, "learning_rate": 1.967441860465116e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.7734375, "logps/chosen": -161.0, "logps/rejected": -127.5, "loss": 21.7227, "rewards/accuracies": 0.5, "rewards/chosen": 0.0203857421875, "rewards/margins": 0.0281982421875, "rewards/rejected": -0.0078125, "step": 7 }, { "epoch": 0.018585741251633512, "grad_norm": 339.0907287597656, "learning_rate": 1.9627906976744183e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.75390625, "logps/chosen": -152.0, "logps/rejected": -125.5, "loss": 21.5156, "rewards/accuracies": 0.4375, "rewards/chosen": 0.042236328125, "rewards/margins": 0.04296875, "rewards/rejected": -0.000782012939453125, "step": 8 }, { "epoch": 0.0209089589080877, "grad_norm": 317.0169982910156, "learning_rate": 1.958139534883721e-06, "logits/chosen": -0.64453125, "logits/rejected": -0.765625, "logps/chosen": -134.0, "logps/rejected": -116.5, "loss": 21.7969, "rewards/accuracies": 0.4375, "rewards/chosen": 0.03759765625, "rewards/margins": 0.03125, "rewards/rejected": 0.006256103515625, "step": 9 }, { "epoch": 0.02323217656454189, "grad_norm": 353.8077392578125, "learning_rate": 1.953488372093023e-06, "logits/chosen": -0.68359375, "logits/rejected": -0.703125, "logps/chosen": -149.0, "logps/rejected": -113.5, "loss": 21.8633, "rewards/accuracies": 0.5, "rewards/chosen": 0.035888671875, "rewards/margins": 0.026611328125, "rewards/rejected": 0.0093994140625, "step": 10 }, { "epoch": 0.02555539422099608, "grad_norm": 324.4909362792969, "learning_rate": 1.9488372093023256e-06, "logits/chosen": -0.765625, "logits/rejected": -0.765625, "logps/chosen": -135.0, "logps/rejected": -138.0, "loss": 22.5781, "rewards/accuracies": 0.375, "rewards/chosen": 0.026611328125, "rewards/margins": -0.0172119140625, "rewards/rejected": 0.043701171875, "step": 11 }, { "epoch": 0.02787861187745027, "grad_norm": 360.6048583984375, "learning_rate": 1.9441860465116278e-06, "logits/chosen": -0.70703125, "logits/rejected": -0.734375, "logps/chosen": -155.0, "logps/rejected": -116.0, "loss": 20.6895, "rewards/accuracies": 0.71875, "rewards/chosen": 0.07666015625, "rewards/margins": 0.10498046875, "rewards/rejected": -0.0281982421875, "step": 12 }, { "epoch": 0.03020182953390446, "grad_norm": 321.6941223144531, "learning_rate": 1.9395348837209303e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.765625, "logps/chosen": -125.0, "logps/rejected": -132.0, "loss": 20.8535, "rewards/accuracies": 0.5625, "rewards/chosen": 0.05712890625, "rewards/margins": 0.08740234375, "rewards/rejected": -0.030517578125, "step": 13 }, { "epoch": 0.03252504719035865, "grad_norm": 314.4052429199219, "learning_rate": 1.9348837209302325e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.796875, "logps/chosen": -114.0, "logps/rejected": -123.5, "loss": 21.2949, "rewards/accuracies": 0.59375, "rewards/chosen": 0.04541015625, "rewards/margins": 0.0673828125, "rewards/rejected": -0.02197265625, "step": 14 }, { "epoch": 0.03484826484681284, "grad_norm": 339.468017578125, "learning_rate": 1.930232558139535e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.75, "logps/chosen": -120.0, "logps/rejected": -132.0, "loss": 21.8496, "rewards/accuracies": 0.53125, "rewards/chosen": 0.020263671875, "rewards/margins": 0.0250244140625, "rewards/rejected": -0.00469970703125, "step": 15 }, { "epoch": 0.037171482503267024, "grad_norm": 370.9052429199219, "learning_rate": 1.925581395348837e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.79296875, "logps/chosen": -140.0, "logps/rejected": -131.0, "loss": 22.0898, "rewards/accuracies": 0.53125, "rewards/chosen": 0.015625, "rewards/margins": 0.0179443359375, "rewards/rejected": -0.002349853515625, "step": 16 }, { "epoch": 0.039494700159721216, "grad_norm": 337.88262939453125, "learning_rate": 1.9209302325581393e-06, "logits/chosen": -0.6875, "logits/rejected": -0.70703125, "logps/chosen": -142.0, "logps/rejected": -137.0, "loss": 21.0625, "rewards/accuracies": 0.59375, "rewards/chosen": 0.10791015625, "rewards/margins": 0.08984375, "rewards/rejected": 0.0179443359375, "step": 17 }, { "epoch": 0.0418179178161754, "grad_norm": 363.0306091308594, "learning_rate": 1.916279069767442e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.72265625, "logps/chosen": -135.0, "logps/rejected": -162.0, "loss": 22.3711, "rewards/accuracies": 0.46875, "rewards/chosen": 0.018798828125, "rewards/margins": -0.004730224609375, "rewards/rejected": 0.0234375, "step": 18 }, { "epoch": 0.04414113547262959, "grad_norm": 300.884521484375, "learning_rate": 1.911627906976744e-06, "logits/chosen": -0.78125, "logits/rejected": -0.7734375, "logps/chosen": -130.0, "logps/rejected": -115.0, "loss": 20.6758, "rewards/accuracies": 0.71875, "rewards/chosen": 0.055419921875, "rewards/margins": 0.109375, "rewards/rejected": -0.053955078125, "step": 19 }, { "epoch": 0.04646435312908378, "grad_norm": 330.6780090332031, "learning_rate": 1.9069767441860464e-06, "logits/chosen": -0.6953125, "logits/rejected": -0.68359375, "logps/chosen": -139.0, "logps/rejected": -113.5, "loss": 20.2715, "rewards/accuracies": 0.75, "rewards/chosen": 0.046875, "rewards/margins": 0.1376953125, "rewards/rejected": -0.0908203125, "step": 20 }, { "epoch": 0.04878757078553797, "grad_norm": 316.6097106933594, "learning_rate": 1.9023255813953487e-06, "logits/chosen": -0.7109375, "logits/rejected": -0.75, "logps/chosen": -129.0, "logps/rejected": -110.5, "loss": 19.916, "rewards/accuracies": 0.71875, "rewards/chosen": 0.076171875, "rewards/margins": 0.1591796875, "rewards/rejected": -0.0830078125, "step": 21 }, { "epoch": 0.05111078844199216, "grad_norm": 310.86370849609375, "learning_rate": 1.897674418604651e-06, "logits/chosen": -0.6484375, "logits/rejected": -0.69921875, "logps/chosen": -132.0, "logps/rejected": -128.0, "loss": 21.1484, "rewards/accuracies": 0.59375, "rewards/chosen": 0.03662109375, "rewards/margins": 0.0869140625, "rewards/rejected": -0.050048828125, "step": 22 }, { "epoch": 0.05343400609844635, "grad_norm": 442.0061950683594, "learning_rate": 1.8930232558139534e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.74609375, "logps/chosen": -108.0, "logps/rejected": -128.0, "loss": 20.5215, "rewards/accuracies": 0.5625, "rewards/chosen": 0.018798828125, "rewards/margins": 0.1298828125, "rewards/rejected": -0.11083984375, "step": 23 }, { "epoch": 0.05575722375490054, "grad_norm": 351.7835693359375, "learning_rate": 1.8883720930232556e-06, "logits/chosen": -0.7109375, "logits/rejected": -0.71875, "logps/chosen": -128.0, "logps/rejected": -119.0, "loss": 19.3867, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0849609375, "rewards/margins": 0.2158203125, "rewards/rejected": -0.130859375, "step": 24 }, { "epoch": 0.058080441411354725, "grad_norm": 332.74700927734375, "learning_rate": 1.8837209302325582e-06, "logits/chosen": -0.703125, "logits/rejected": -0.73046875, "logps/chosen": -138.0, "logps/rejected": -117.5, "loss": 19.75, "rewards/accuracies": 0.71875, "rewards/chosen": 0.046875, "rewards/margins": 0.181640625, "rewards/rejected": -0.134765625, "step": 25 }, { "epoch": 0.06040365906780892, "grad_norm": 334.2042541503906, "learning_rate": 1.8790697674418603e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.76953125, "logps/chosen": -143.0, "logps/rejected": -130.0, "loss": 19.8301, "rewards/accuracies": 0.625, "rewards/chosen": 0.0625, "rewards/margins": 0.1904296875, "rewards/rejected": -0.1279296875, "step": 26 }, { "epoch": 0.06272687672426311, "grad_norm": 328.3305969238281, "learning_rate": 1.8744186046511627e-06, "logits/chosen": -0.6796875, "logits/rejected": -0.6875, "logps/chosen": -136.0, "logps/rejected": -131.0, "loss": 20.0059, "rewards/accuracies": 0.59375, "rewards/chosen": 0.0654296875, "rewards/margins": 0.181640625, "rewards/rejected": -0.1162109375, "step": 27 }, { "epoch": 0.0650500943807173, "grad_norm": 310.84674072265625, "learning_rate": 1.869767441860465e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.7265625, "logps/chosen": -147.0, "logps/rejected": -118.0, "loss": 19.7676, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0625, "rewards/margins": 0.1826171875, "rewards/rejected": -0.11962890625, "step": 28 }, { "epoch": 0.06737331203717148, "grad_norm": 363.75628662109375, "learning_rate": 1.8651162790697674e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.7734375, "logps/chosen": -142.0, "logps/rejected": -128.0, "loss": 20.2852, "rewards/accuracies": 0.625, "rewards/chosen": 0.01165771484375, "rewards/margins": 0.1474609375, "rewards/rejected": -0.1357421875, "step": 29 }, { "epoch": 0.06969652969362568, "grad_norm": 331.91949462890625, "learning_rate": 1.8604651162790697e-06, "logits/chosen": -0.6875, "logits/rejected": -0.73828125, "logps/chosen": -140.0, "logps/rejected": -124.0, "loss": 20.332, "rewards/accuracies": 0.65625, "rewards/chosen": 0.046875, "rewards/margins": 0.169921875, "rewards/rejected": -0.12255859375, "step": 30 }, { "epoch": 0.07201974735007986, "grad_norm": 314.3414001464844, "learning_rate": 1.855813953488372e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.78515625, "logps/chosen": -124.0, "logps/rejected": -119.5, "loss": 20.3867, "rewards/accuracies": 0.65625, "rewards/chosen": -0.043701171875, "rewards/margins": 0.1552734375, "rewards/rejected": -0.1982421875, "step": 31 }, { "epoch": 0.07434296500653405, "grad_norm": 353.8963928222656, "learning_rate": 1.8511627906976744e-06, "logits/chosen": -0.70703125, "logits/rejected": -0.75390625, "logps/chosen": -126.0, "logps/rejected": -141.0, "loss": 20.543, "rewards/accuracies": 0.53125, "rewards/chosen": -0.021728515625, "rewards/margins": 0.1591796875, "rewards/rejected": -0.1806640625, "step": 32 }, { "epoch": 0.07666618266298823, "grad_norm": 315.1564636230469, "learning_rate": 1.8465116279069766e-06, "logits/chosen": -0.6875, "logits/rejected": -0.734375, "logps/chosen": -124.0, "logps/rejected": -111.0, "loss": 21.7266, "rewards/accuracies": 0.59375, "rewards/chosen": -0.0869140625, "rewards/margins": 0.07373046875, "rewards/rejected": -0.16015625, "step": 33 }, { "epoch": 0.07898940031944243, "grad_norm": 353.0196533203125, "learning_rate": 1.841860465116279e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.80078125, "logps/chosen": -148.0, "logps/rejected": -120.0, "loss": 19.3828, "rewards/accuracies": 0.6875, "rewards/chosen": -0.078125, "rewards/margins": 0.236328125, "rewards/rejected": -0.314453125, "step": 34 }, { "epoch": 0.08131261797589662, "grad_norm": 367.0079650878906, "learning_rate": 1.8372093023255813e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.77734375, "logps/chosen": -121.5, "logps/rejected": -131.0, "loss": 20.9941, "rewards/accuracies": 0.5625, "rewards/chosen": -0.07666015625, "rewards/margins": 0.1220703125, "rewards/rejected": -0.1982421875, "step": 35 }, { "epoch": 0.0836358356323508, "grad_norm": 301.0638732910156, "learning_rate": 1.8325581395348836e-06, "logits/chosen": -0.6953125, "logits/rejected": -0.71484375, "logps/chosen": -137.0, "logps/rejected": -124.0, "loss": 17.9121, "rewards/accuracies": 0.78125, "rewards/chosen": 0.004791259765625, "rewards/margins": 0.33203125, "rewards/rejected": -0.328125, "step": 36 }, { "epoch": 0.085959053288805, "grad_norm": 359.94842529296875, "learning_rate": 1.827906976744186e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.7109375, "logps/chosen": -139.0, "logps/rejected": -128.0, "loss": 21.6172, "rewards/accuracies": 0.53125, "rewards/chosen": -0.08203125, "rewards/margins": 0.0986328125, "rewards/rejected": -0.181640625, "step": 37 }, { "epoch": 0.08828227094525919, "grad_norm": 322.6696472167969, "learning_rate": 1.8232558139534884e-06, "logits/chosen": -0.78125, "logits/rejected": -0.78125, "logps/chosen": -137.0, "logps/rejected": -129.0, "loss": 20.4121, "rewards/accuracies": 0.6875, "rewards/chosen": -0.024169921875, "rewards/margins": 0.1884765625, "rewards/rejected": -0.212890625, "step": 38 }, { "epoch": 0.09060548860171337, "grad_norm": 308.0600280761719, "learning_rate": 1.8186046511627907e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.78515625, "logps/chosen": -122.5, "logps/rejected": -121.5, "loss": 19.002, "rewards/accuracies": 0.6875, "rewards/chosen": -0.06494140625, "rewards/margins": 0.267578125, "rewards/rejected": -0.33203125, "step": 39 }, { "epoch": 0.09292870625816756, "grad_norm": 324.52655029296875, "learning_rate": 1.8139534883720929e-06, "logits/chosen": -0.7109375, "logits/rejected": -0.7578125, "logps/chosen": -125.0, "logps/rejected": -105.0, "loss": 20.1504, "rewards/accuracies": 0.59375, "rewards/chosen": -0.044677734375, "rewards/margins": 0.1904296875, "rewards/rejected": -0.2353515625, "step": 40 }, { "epoch": 0.09525192391462176, "grad_norm": 336.1131286621094, "learning_rate": 1.8093023255813952e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.765625, "logps/chosen": -140.0, "logps/rejected": -116.0, "loss": 19.748, "rewards/accuracies": 0.65625, "rewards/chosen": -0.10546875, "rewards/margins": 0.234375, "rewards/rejected": -0.33984375, "step": 41 }, { "epoch": 0.09757514157107594, "grad_norm": 348.0433654785156, "learning_rate": 1.8046511627906976e-06, "logits/chosen": -0.734375, "logits/rejected": -0.76953125, "logps/chosen": -162.0, "logps/rejected": -124.0, "loss": 18.8906, "rewards/accuracies": 0.6875, "rewards/chosen": -0.1455078125, "rewards/margins": 0.294921875, "rewards/rejected": -0.44140625, "step": 42 }, { "epoch": 0.09989835922753013, "grad_norm": 327.6149597167969, "learning_rate": 1.8e-06, "logits/chosen": -0.6796875, "logits/rejected": -0.76953125, "logps/chosen": -148.0, "logps/rejected": -126.5, "loss": 17.3145, "rewards/accuracies": 0.78125, "rewards/chosen": -0.020263671875, "rewards/margins": 0.423828125, "rewards/rejected": -0.4453125, "step": 43 }, { "epoch": 0.10222157688398432, "grad_norm": 303.6740417480469, "learning_rate": 1.7953488372093023e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.73828125, "logps/chosen": -135.0, "logps/rejected": -121.0, "loss": 19.2715, "rewards/accuracies": 0.6875, "rewards/chosen": -0.11669921875, "rewards/margins": 0.271484375, "rewards/rejected": -0.388671875, "step": 44 }, { "epoch": 0.10454479454043851, "grad_norm": 333.5793762207031, "learning_rate": 1.7906976744186046e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.703125, "logps/chosen": -133.0, "logps/rejected": -121.5, "loss": 18.8203, "rewards/accuracies": 0.71875, "rewards/chosen": -0.057861328125, "rewards/margins": 0.318359375, "rewards/rejected": -0.376953125, "step": 45 }, { "epoch": 0.1068680121968927, "grad_norm": 318.89398193359375, "learning_rate": 1.7860465116279068e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.7734375, "logps/chosen": -142.0, "logps/rejected": -126.5, "loss": 17.5156, "rewards/accuracies": 0.71875, "rewards/chosen": -0.052978515625, "rewards/margins": 0.404296875, "rewards/rejected": -0.458984375, "step": 46 }, { "epoch": 0.10919122985334688, "grad_norm": 364.5682678222656, "learning_rate": 1.7813953488372093e-06, "logits/chosen": -0.765625, "logits/rejected": -0.70703125, "logps/chosen": -117.5, "logps/rejected": -150.0, "loss": 20.8301, "rewards/accuracies": 0.59375, "rewards/chosen": -0.1201171875, "rewards/margins": 0.208984375, "rewards/rejected": -0.328125, "step": 47 }, { "epoch": 0.11151444750980108, "grad_norm": 327.97412109375, "learning_rate": 1.7767441860465115e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.84765625, "logps/chosen": -144.0, "logps/rejected": -134.0, "loss": 19.6973, "rewards/accuracies": 0.6875, "rewards/chosen": -0.09912109375, "rewards/margins": 0.265625, "rewards/rejected": -0.365234375, "step": 48 }, { "epoch": 0.11383766516625526, "grad_norm": 345.9813232421875, "learning_rate": 1.7720930232558138e-06, "logits/chosen": -0.66015625, "logits/rejected": -0.7109375, "logps/chosen": -139.0, "logps/rejected": -133.0, "loss": 21.0566, "rewards/accuracies": 0.59375, "rewards/chosen": -0.10986328125, "rewards/margins": 0.1953125, "rewards/rejected": -0.3046875, "step": 49 }, { "epoch": 0.11616088282270945, "grad_norm": 336.94677734375, "learning_rate": 1.7674418604651162e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.7421875, "logps/chosen": -133.0, "logps/rejected": -111.5, "loss": 19.0391, "rewards/accuracies": 0.65625, "rewards/chosen": -0.138671875, "rewards/margins": 0.318359375, "rewards/rejected": -0.45703125, "step": 50 }, { "epoch": 0.11848410047916365, "grad_norm": 341.45440673828125, "learning_rate": 1.7627906976744185e-06, "logits/chosen": -0.734375, "logits/rejected": -0.74609375, "logps/chosen": -120.5, "logps/rejected": -145.0, "loss": 19.6602, "rewards/accuracies": 0.625, "rewards/chosen": -0.07958984375, "rewards/margins": 0.287109375, "rewards/rejected": -0.3671875, "step": 51 }, { "epoch": 0.12080731813561783, "grad_norm": 378.4522399902344, "learning_rate": 1.758139534883721e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.73046875, "logps/chosen": -136.0, "logps/rejected": -141.0, "loss": 21.7686, "rewards/accuracies": 0.53125, "rewards/chosen": -0.1962890625, "rewards/margins": 0.138671875, "rewards/rejected": -0.3359375, "step": 52 }, { "epoch": 0.12313053579207202, "grad_norm": 278.8151550292969, "learning_rate": 1.753488372093023e-06, "logits/chosen": -0.70703125, "logits/rejected": -0.7890625, "logps/chosen": -150.0, "logps/rejected": -126.5, "loss": 16.0195, "rewards/accuracies": 0.6875, "rewards/chosen": 0.06884765625, "rewards/margins": 0.55859375, "rewards/rejected": -0.490234375, "step": 53 }, { "epoch": 0.12545375344852622, "grad_norm": 336.42022705078125, "learning_rate": 1.7488372093023256e-06, "logits/chosen": -0.703125, "logits/rejected": -0.74609375, "logps/chosen": -139.0, "logps/rejected": -121.5, "loss": 19.0742, "rewards/accuracies": 0.65625, "rewards/chosen": -0.0966796875, "rewards/margins": 0.3359375, "rewards/rejected": -0.431640625, "step": 54 }, { "epoch": 0.1277769711049804, "grad_norm": 324.8966369628906, "learning_rate": 1.7441860465116278e-06, "logits/chosen": -0.75, "logits/rejected": -0.75, "logps/chosen": -132.0, "logps/rejected": -111.5, "loss": 19.2002, "rewards/accuracies": 0.71875, "rewards/chosen": -0.2138671875, "rewards/margins": 0.296875, "rewards/rejected": -0.51171875, "step": 55 }, { "epoch": 0.1301001887614346, "grad_norm": 357.81597900390625, "learning_rate": 1.7395348837209301e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.7890625, "logps/chosen": -133.0, "logps/rejected": -136.0, "loss": 19.1963, "rewards/accuracies": 0.53125, "rewards/chosen": -0.166015625, "rewards/margins": 0.3046875, "rewards/rejected": -0.470703125, "step": 56 }, { "epoch": 0.13242340641788877, "grad_norm": 359.42279052734375, "learning_rate": 1.7348837209302325e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.6796875, "logps/chosen": -123.0, "logps/rejected": -136.0, "loss": 20.8135, "rewards/accuracies": 0.5625, "rewards/chosen": -0.1484375, "rewards/margins": 0.21875, "rewards/rejected": -0.3671875, "step": 57 }, { "epoch": 0.13474662407434296, "grad_norm": 376.3425598144531, "learning_rate": 1.7302325581395348e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.73828125, "logps/chosen": -145.0, "logps/rejected": -142.0, "loss": 21.0859, "rewards/accuracies": 0.5625, "rewards/chosen": -0.126953125, "rewards/margins": 0.20703125, "rewards/rejected": -0.3359375, "step": 58 }, { "epoch": 0.13706984173079714, "grad_norm": 276.28466796875, "learning_rate": 1.7255813953488372e-06, "logits/chosen": -0.6953125, "logits/rejected": -0.7421875, "logps/chosen": -133.0, "logps/rejected": -132.0, "loss": 16.6836, "rewards/accuracies": 0.78125, "rewards/chosen": 0.05712890625, "rewards/margins": 0.515625, "rewards/rejected": -0.45703125, "step": 59 }, { "epoch": 0.13939305938725136, "grad_norm": 308.0601806640625, "learning_rate": 1.7209302325581393e-06, "logits/chosen": -0.7109375, "logits/rejected": -0.765625, "logps/chosen": -130.0, "logps/rejected": -129.0, "loss": 17.4619, "rewards/accuracies": 0.75, "rewards/chosen": 0.031494140625, "rewards/margins": 0.466796875, "rewards/rejected": -0.435546875, "step": 60 }, { "epoch": 0.14171627704370554, "grad_norm": 334.4534606933594, "learning_rate": 1.7162790697674419e-06, "logits/chosen": -0.734375, "logits/rejected": -0.7421875, "logps/chosen": -134.0, "logps/rejected": -116.0, "loss": 19.7373, "rewards/accuracies": 0.5625, "rewards/chosen": -0.09521484375, "rewards/margins": 0.333984375, "rewards/rejected": -0.4296875, "step": 61 }, { "epoch": 0.14403949470015973, "grad_norm": 324.9841613769531, "learning_rate": 1.711627906976744e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.74609375, "logps/chosen": -157.0, "logps/rejected": -122.0, "loss": 18.4209, "rewards/accuracies": 0.6875, "rewards/chosen": 0.004669189453125, "rewards/margins": 0.384765625, "rewards/rejected": -0.37890625, "step": 62 }, { "epoch": 0.1463627123566139, "grad_norm": 344.504638671875, "learning_rate": 1.7069767441860466e-06, "logits/chosen": -0.70703125, "logits/rejected": -0.7265625, "logps/chosen": -133.0, "logps/rejected": -115.5, "loss": 19.3184, "rewards/accuracies": 0.65625, "rewards/chosen": -0.158203125, "rewards/margins": 0.31640625, "rewards/rejected": -0.474609375, "step": 63 }, { "epoch": 0.1486859300130681, "grad_norm": 323.4111328125, "learning_rate": 1.7023255813953487e-06, "logits/chosen": -0.63671875, "logits/rejected": -0.73046875, "logps/chosen": -144.0, "logps/rejected": -118.0, "loss": 17.728, "rewards/accuracies": 0.71875, "rewards/chosen": -0.017578125, "rewards/margins": 0.484375, "rewards/rejected": -0.5, "step": 64 }, { "epoch": 0.15100914766952228, "grad_norm": 301.9679870605469, "learning_rate": 1.6976744186046509e-06, "logits/chosen": -0.65234375, "logits/rejected": -0.70703125, "logps/chosen": -135.0, "logps/rejected": -136.0, "loss": 16.2197, "rewards/accuracies": 0.75, "rewards/chosen": 0.01263427734375, "rewards/margins": 0.53125, "rewards/rejected": -0.51953125, "step": 65 }, { "epoch": 0.15333236532597647, "grad_norm": 370.5312194824219, "learning_rate": 1.6930232558139535e-06, "logits/chosen": -0.734375, "logits/rejected": -0.76171875, "logps/chosen": -119.5, "logps/rejected": -126.5, "loss": 20.4912, "rewards/accuracies": 0.59375, "rewards/chosen": -0.349609375, "rewards/margins": 0.1962890625, "rewards/rejected": -0.546875, "step": 66 }, { "epoch": 0.15565558298243068, "grad_norm": 341.2892150878906, "learning_rate": 1.6883720930232556e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.79296875, "logps/chosen": -119.0, "logps/rejected": -128.0, "loss": 19.6045, "rewards/accuracies": 0.625, "rewards/chosen": -0.1416015625, "rewards/margins": 0.330078125, "rewards/rejected": -0.47265625, "step": 67 }, { "epoch": 0.15797880063888486, "grad_norm": 331.32476806640625, "learning_rate": 1.6837209302325582e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.77734375, "logps/chosen": -141.0, "logps/rejected": -116.5, "loss": 17.0586, "rewards/accuracies": 0.6875, "rewards/chosen": -0.021728515625, "rewards/margins": 0.53125, "rewards/rejected": -0.55078125, "step": 68 }, { "epoch": 0.16030201829533905, "grad_norm": 348.9662780761719, "learning_rate": 1.6790697674418603e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.7265625, "logps/chosen": -138.0, "logps/rejected": -131.0, "loss": 18.208, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0615234375, "rewards/margins": 0.421875, "rewards/rejected": -0.484375, "step": 69 }, { "epoch": 0.16262523595179323, "grad_norm": 286.9308776855469, "learning_rate": 1.6744186046511629e-06, "logits/chosen": -0.67578125, "logits/rejected": -0.671875, "logps/chosen": -134.0, "logps/rejected": -119.0, "loss": 15.4043, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1142578125, "rewards/margins": 0.6640625, "rewards/rejected": -0.55078125, "step": 70 }, { "epoch": 0.16494845360824742, "grad_norm": 400.8143615722656, "learning_rate": 1.669767441860465e-06, "logits/chosen": -0.75, "logits/rejected": -0.765625, "logps/chosen": -122.0, "logps/rejected": -148.0, "loss": 20.6289, "rewards/accuracies": 0.6875, "rewards/chosen": -0.208984375, "rewards/margins": 0.2734375, "rewards/rejected": -0.482421875, "step": 71 }, { "epoch": 0.1672716712647016, "grad_norm": 307.0199890136719, "learning_rate": 1.6651162790697672e-06, "logits/chosen": -0.7109375, "logits/rejected": -0.703125, "logps/chosen": -133.0, "logps/rejected": -126.0, "loss": 17.0361, "rewards/accuracies": 0.75, "rewards/chosen": -0.014892578125, "rewards/margins": 0.466796875, "rewards/rejected": -0.48046875, "step": 72 }, { "epoch": 0.1695948889211558, "grad_norm": 394.55084228515625, "learning_rate": 1.6604651162790697e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.734375, "logps/chosen": -127.5, "logps/rejected": -128.0, "loss": 20.4941, "rewards/accuracies": 0.625, "rewards/chosen": -0.31640625, "rewards/margins": 0.23046875, "rewards/rejected": -0.546875, "step": 73 }, { "epoch": 0.17191810657761, "grad_norm": 406.731201171875, "learning_rate": 1.6558139534883719e-06, "logits/chosen": -0.68359375, "logits/rejected": -0.7109375, "logps/chosen": -120.0, "logps/rejected": -127.5, "loss": 19.4707, "rewards/accuracies": 0.65625, "rewards/chosen": -0.166015625, "rewards/margins": 0.328125, "rewards/rejected": -0.494140625, "step": 74 }, { "epoch": 0.1742413242340642, "grad_norm": 333.3077087402344, "learning_rate": 1.6511627906976744e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.7578125, "logps/chosen": -155.0, "logps/rejected": -124.0, "loss": 18.7402, "rewards/accuracies": 0.78125, "rewards/chosen": -0.2333984375, "rewards/margins": 0.294921875, "rewards/rejected": -0.52734375, "step": 75 }, { "epoch": 0.17656454189051837, "grad_norm": 345.686279296875, "learning_rate": 1.6465116279069766e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.78125, "logps/chosen": -130.0, "logps/rejected": -128.0, "loss": 20.583, "rewards/accuracies": 0.625, "rewards/chosen": -0.228515625, "rewards/margins": 0.287109375, "rewards/rejected": -0.515625, "step": 76 }, { "epoch": 0.17888775954697256, "grad_norm": 315.1790466308594, "learning_rate": 1.6418604651162792e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.7578125, "logps/chosen": -130.0, "logps/rejected": -108.5, "loss": 16.7363, "rewards/accuracies": 0.75, "rewards/chosen": -0.103515625, "rewards/margins": 0.50390625, "rewards/rejected": -0.60546875, "step": 77 }, { "epoch": 0.18121097720342674, "grad_norm": 279.80206298828125, "learning_rate": 1.6372093023255813e-06, "logits/chosen": -0.734375, "logits/rejected": -0.78125, "logps/chosen": -132.0, "logps/rejected": -108.0, "loss": 16.207, "rewards/accuracies": 0.75, "rewards/chosen": -0.07470703125, "rewards/margins": 0.55859375, "rewards/rejected": -0.6328125, "step": 78 }, { "epoch": 0.18353419485988093, "grad_norm": 381.6708679199219, "learning_rate": 1.6325581395348837e-06, "logits/chosen": -0.69140625, "logits/rejected": -0.69921875, "logps/chosen": -152.0, "logps/rejected": -150.0, "loss": 18.6279, "rewards/accuracies": 0.71875, "rewards/chosen": -0.10791015625, "rewards/margins": 0.419921875, "rewards/rejected": -0.52734375, "step": 79 }, { "epoch": 0.1858574125163351, "grad_norm": 309.5762634277344, "learning_rate": 1.627906976744186e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.7890625, "logps/chosen": -128.0, "logps/rejected": -127.0, "loss": 16.7793, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0576171875, "rewards/margins": 0.5078125, "rewards/rejected": -0.5625, "step": 80 }, { "epoch": 0.18818063017278933, "grad_norm": 357.2296142578125, "learning_rate": 1.6232558139534882e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.765625, "logps/chosen": -141.0, "logps/rejected": -158.0, "loss": 20.2842, "rewards/accuracies": 0.625, "rewards/chosen": -0.0771484375, "rewards/margins": 0.283203125, "rewards/rejected": -0.359375, "step": 81 }, { "epoch": 0.1905038478292435, "grad_norm": 361.9767761230469, "learning_rate": 1.6186046511627907e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.7421875, "logps/chosen": -153.0, "logps/rejected": -131.0, "loss": 20.2363, "rewards/accuracies": 0.625, "rewards/chosen": -0.0169677734375, "rewards/margins": 0.298828125, "rewards/rejected": -0.31640625, "step": 82 }, { "epoch": 0.1928270654856977, "grad_norm": 300.6635437011719, "learning_rate": 1.6139534883720929e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.765625, "logps/chosen": -138.0, "logps/rejected": -133.0, "loss": 18.0459, "rewards/accuracies": 0.65625, "rewards/chosen": -0.06494140625, "rewards/margins": 0.453125, "rewards/rejected": -0.51953125, "step": 83 }, { "epoch": 0.19515028314215188, "grad_norm": 317.6025390625, "learning_rate": 1.6093023255813954e-06, "logits/chosen": -0.734375, "logits/rejected": -0.765625, "logps/chosen": -123.5, "logps/rejected": -119.0, "loss": 18.7881, "rewards/accuracies": 0.75, "rewards/chosen": -0.166015625, "rewards/margins": 0.41015625, "rewards/rejected": -0.57421875, "step": 84 }, { "epoch": 0.19747350079860607, "grad_norm": 324.6422424316406, "learning_rate": 1.6046511627906976e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.78515625, "logps/chosen": -144.0, "logps/rejected": -126.0, "loss": 16.6187, "rewards/accuracies": 0.6875, "rewards/chosen": -0.134765625, "rewards/margins": 0.5234375, "rewards/rejected": -0.65625, "step": 85 }, { "epoch": 0.19979671845506025, "grad_norm": 442.3411865234375, "learning_rate": 1.6e-06, "logits/chosen": -0.71875, "logits/rejected": -0.703125, "logps/chosen": -122.0, "logps/rejected": -137.0, "loss": 23.7383, "rewards/accuracies": 0.5, "rewards/chosen": -0.1767578125, "rewards/margins": 0.1103515625, "rewards/rejected": -0.287109375, "step": 86 }, { "epoch": 0.20211993611151444, "grad_norm": 386.96435546875, "learning_rate": 1.5953488372093023e-06, "logits/chosen": -0.7421875, "logits/rejected": -0.75390625, "logps/chosen": -128.0, "logps/rejected": -140.0, "loss": 16.4014, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0020904541015625, "rewards/margins": 0.6015625, "rewards/rejected": -0.59765625, "step": 87 }, { "epoch": 0.20444315376796865, "grad_norm": 463.20635986328125, "learning_rate": 1.5906976744186044e-06, "logits/chosen": -0.8359375, "logits/rejected": -0.76171875, "logps/chosen": -123.0, "logps/rejected": -148.0, "loss": 22.9053, "rewards/accuracies": 0.59375, "rewards/chosen": -0.38671875, "rewards/margins": 0.11669921875, "rewards/rejected": -0.50390625, "step": 88 }, { "epoch": 0.20676637142442283, "grad_norm": 373.3138427734375, "learning_rate": 1.586046511627907e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.71484375, "logps/chosen": -137.0, "logps/rejected": -123.0, "loss": 17.3862, "rewards/accuracies": 0.65625, "rewards/chosen": -0.201171875, "rewards/margins": 0.546875, "rewards/rejected": -0.74609375, "step": 89 }, { "epoch": 0.20908958908087702, "grad_norm": 378.5066223144531, "learning_rate": 1.5813953488372091e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.75, "logps/chosen": -136.0, "logps/rejected": -119.5, "loss": 18.2598, "rewards/accuracies": 0.65625, "rewards/chosen": -0.208984375, "rewards/margins": 0.36328125, "rewards/rejected": -0.57421875, "step": 90 }, { "epoch": 0.2114128067373312, "grad_norm": 348.6402282714844, "learning_rate": 1.5767441860465117e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.7734375, "logps/chosen": -130.0, "logps/rejected": -132.0, "loss": 17.7559, "rewards/accuracies": 0.75, "rewards/chosen": -0.0556640625, "rewards/margins": 0.4453125, "rewards/rejected": -0.5, "step": 91 }, { "epoch": 0.2137360243937854, "grad_norm": 369.6512145996094, "learning_rate": 1.5720930232558138e-06, "logits/chosen": -0.70703125, "logits/rejected": -0.70703125, "logps/chosen": -150.0, "logps/rejected": -130.0, "loss": 20.6709, "rewards/accuracies": 0.59375, "rewards/chosen": 0.003204345703125, "rewards/margins": 0.2890625, "rewards/rejected": -0.28515625, "step": 92 }, { "epoch": 0.21605924205023957, "grad_norm": 352.605224609375, "learning_rate": 1.5674418604651162e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.71484375, "logps/chosen": -140.0, "logps/rejected": -115.5, "loss": 18.3926, "rewards/accuracies": 0.6875, "rewards/chosen": -0.1494140625, "rewards/margins": 0.435546875, "rewards/rejected": -0.5859375, "step": 93 }, { "epoch": 0.21838245970669376, "grad_norm": 486.412109375, "learning_rate": 1.5627906976744186e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.7578125, "logps/chosen": -131.0, "logps/rejected": -132.0, "loss": 19.9014, "rewards/accuracies": 0.59375, "rewards/chosen": -0.09521484375, "rewards/margins": 0.298828125, "rewards/rejected": -0.39453125, "step": 94 }, { "epoch": 0.22070567736314797, "grad_norm": 376.4161071777344, "learning_rate": 1.558139534883721e-06, "logits/chosen": -0.71484375, "logits/rejected": -0.74609375, "logps/chosen": -128.0, "logps/rejected": -123.5, "loss": 18.9131, "rewards/accuracies": 0.59375, "rewards/chosen": -0.1552734375, "rewards/margins": 0.38671875, "rewards/rejected": -0.54296875, "step": 95 }, { "epoch": 0.22302889501960216, "grad_norm": 396.44061279296875, "learning_rate": 1.5534883720930233e-06, "logits/chosen": -0.69921875, "logits/rejected": -0.69140625, "logps/chosen": -122.5, "logps/rejected": -139.0, "loss": 21.1982, "rewards/accuracies": 0.6875, "rewards/chosen": -0.263671875, "rewards/margins": 0.2119140625, "rewards/rejected": -0.4765625, "step": 96 }, { "epoch": 0.22535211267605634, "grad_norm": 340.9673156738281, "learning_rate": 1.5488372093023254e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.75, "logps/chosen": -127.5, "logps/rejected": -127.0, "loss": 19.959, "rewards/accuracies": 0.53125, "rewards/chosen": -0.1279296875, "rewards/margins": 0.296875, "rewards/rejected": -0.42578125, "step": 97 }, { "epoch": 0.22767533033251053, "grad_norm": 338.022216796875, "learning_rate": 1.5441860465116278e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.76953125, "logps/chosen": -137.0, "logps/rejected": -124.0, "loss": 18.5508, "rewards/accuracies": 0.6875, "rewards/chosen": -0.16015625, "rewards/margins": 0.390625, "rewards/rejected": -0.55078125, "step": 98 }, { "epoch": 0.2299985479889647, "grad_norm": 839.4739379882812, "learning_rate": 1.5395348837209301e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.75, "logps/chosen": -126.5, "logps/rejected": -124.5, "loss": 20.8574, "rewards/accuracies": 0.53125, "rewards/chosen": -0.2119140625, "rewards/margins": 0.185546875, "rewards/rejected": -0.3984375, "step": 99 }, { "epoch": 0.2323217656454189, "grad_norm": 341.3218078613281, "learning_rate": 1.5348837209302325e-06, "logits/chosen": -0.72265625, "logits/rejected": -0.78125, "logps/chosen": -114.0, "logps/rejected": -143.0, "loss": 16.5, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0233154296875, "rewards/margins": 0.57421875, "rewards/rejected": -0.55078125, "step": 100 }, { "epoch": 0.23464498330187308, "grad_norm": 346.95849609375, "learning_rate": 1.5302325581395348e-06, "logits/chosen": -0.71875, "logits/rejected": -0.75, "logps/chosen": -132.0, "logps/rejected": -124.5, "loss": 18.8315, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0247802734375, "rewards/margins": 0.48828125, "rewards/rejected": -0.515625, "step": 101 }, { "epoch": 0.2369682009583273, "grad_norm": 293.3309326171875, "learning_rate": 1.5255813953488372e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.734375, "logps/chosen": -134.0, "logps/rejected": -109.5, "loss": 16.605, "rewards/accuracies": 0.71875, "rewards/chosen": 0.00069427490234375, "rewards/margins": 0.55859375, "rewards/rejected": -0.55859375, "step": 102 }, { "epoch": 0.23929141861478148, "grad_norm": 308.8841857910156, "learning_rate": 1.5209302325581395e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.78515625, "logps/chosen": -129.0, "logps/rejected": -130.0, "loss": 17.4863, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0162353515625, "rewards/margins": 0.494140625, "rewards/rejected": -0.5078125, "step": 103 }, { "epoch": 0.24161463627123567, "grad_norm": 359.3336486816406, "learning_rate": 1.5162790697674417e-06, "logits/chosen": -0.6796875, "logits/rejected": -0.765625, "logps/chosen": -140.0, "logps/rejected": -135.0, "loss": 18.2041, "rewards/accuracies": 0.71875, "rewards/chosen": -0.039794921875, "rewards/margins": 0.462890625, "rewards/rejected": -0.50390625, "step": 104 }, { "epoch": 0.24393785392768985, "grad_norm": 357.3771667480469, "learning_rate": 1.511627906976744e-06, "logits/chosen": -0.63671875, "logits/rejected": -0.72265625, "logps/chosen": -138.0, "logps/rejected": -126.5, "loss": 19.3569, "rewards/accuracies": 0.625, "rewards/chosen": -0.034423828125, "rewards/margins": 0.37109375, "rewards/rejected": -0.404296875, "step": 105 }, { "epoch": 0.24626107158414404, "grad_norm": 306.6966552734375, "learning_rate": 1.5069767441860464e-06, "logits/chosen": -0.69140625, "logits/rejected": -0.75, "logps/chosen": -133.0, "logps/rejected": -116.5, "loss": 15.3809, "rewards/accuracies": 0.84375, "rewards/chosen": -0.01092529296875, "rewards/margins": 0.5859375, "rewards/rejected": -0.59765625, "step": 106 }, { "epoch": 0.24858428924059822, "grad_norm": 330.71868896484375, "learning_rate": 1.5023255813953488e-06, "logits/chosen": -0.71484375, "logits/rejected": -0.734375, "logps/chosen": -130.0, "logps/rejected": -133.0, "loss": 18.6147, "rewards/accuracies": 0.71875, "rewards/chosen": 0.00238037109375, "rewards/margins": 0.44921875, "rewards/rejected": -0.4453125, "step": 107 }, { "epoch": 0.25090750689705243, "grad_norm": 315.73272705078125, "learning_rate": 1.4976744186046511e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.80078125, "logps/chosen": -148.0, "logps/rejected": -137.0, "loss": 17.1006, "rewards/accuracies": 0.78125, "rewards/chosen": 0.025634765625, "rewards/margins": 0.486328125, "rewards/rejected": -0.4609375, "step": 108 }, { "epoch": 0.2532307245535066, "grad_norm": 322.492919921875, "learning_rate": 1.4930232558139535e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.78515625, "logps/chosen": -127.0, "logps/rejected": -115.0, "loss": 18.3628, "rewards/accuracies": 0.71875, "rewards/chosen": -0.00384521484375, "rewards/margins": 0.40625, "rewards/rejected": -0.41015625, "step": 109 }, { "epoch": 0.2555539422099608, "grad_norm": 309.7414855957031, "learning_rate": 1.4883720930232558e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.7109375, "logps/chosen": -135.0, "logps/rejected": -143.0, "loss": 15.1797, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1357421875, "rewards/margins": 0.6796875, "rewards/rejected": -0.546875, "step": 110 }, { "epoch": 0.25787715986641496, "grad_norm": 295.3927917480469, "learning_rate": 1.4837209302325582e-06, "logits/chosen": -0.671875, "logits/rejected": -0.71484375, "logps/chosen": -136.0, "logps/rejected": -107.0, "loss": 15.5156, "rewards/accuracies": 0.75, "rewards/chosen": 0.1982421875, "rewards/margins": 0.67578125, "rewards/rejected": -0.478515625, "step": 111 }, { "epoch": 0.2602003775228692, "grad_norm": 448.44561767578125, "learning_rate": 1.4790697674418603e-06, "logits/chosen": -0.75, "logits/rejected": -0.7890625, "logps/chosen": -123.0, "logps/rejected": -133.0, "loss": 20.8838, "rewards/accuracies": 0.59375, "rewards/chosen": -0.04150390625, "rewards/margins": 0.3046875, "rewards/rejected": -0.345703125, "step": 112 }, { "epoch": 0.2625235951793234, "grad_norm": 313.7855529785156, "learning_rate": 1.4744186046511627e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.78515625, "logps/chosen": -136.0, "logps/rejected": -122.5, "loss": 14.2803, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1044921875, "rewards/margins": 0.71484375, "rewards/rejected": -0.61328125, "step": 113 }, { "epoch": 0.26484681283577755, "grad_norm": 323.4468688964844, "learning_rate": 1.469767441860465e-06, "logits/chosen": -0.67578125, "logits/rejected": -0.73828125, "logps/chosen": -153.0, "logps/rejected": -110.5, "loss": 14.3198, "rewards/accuracies": 0.84375, "rewards/chosen": 0.08984375, "rewards/margins": 0.6796875, "rewards/rejected": -0.58984375, "step": 114 }, { "epoch": 0.26717003049223176, "grad_norm": 405.1533508300781, "learning_rate": 1.4651162790697674e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.7421875, "logps/chosen": -134.0, "logps/rejected": -142.0, "loss": 18.8086, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0260009765625, "rewards/margins": 0.40625, "rewards/rejected": -0.43359375, "step": 115 }, { "epoch": 0.2694932481486859, "grad_norm": 321.9844970703125, "learning_rate": 1.4604651162790697e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.76953125, "logps/chosen": -132.0, "logps/rejected": -130.0, "loss": 17.3525, "rewards/accuracies": 0.75, "rewards/chosen": 0.0093994140625, "rewards/margins": 0.48046875, "rewards/rejected": -0.470703125, "step": 116 }, { "epoch": 0.27181646580514013, "grad_norm": 314.1150207519531, "learning_rate": 1.455813953488372e-06, "logits/chosen": -0.6640625, "logits/rejected": -0.72265625, "logps/chosen": -138.0, "logps/rejected": -129.0, "loss": 15.6147, "rewards/accuracies": 0.75, "rewards/chosen": 0.09765625, "rewards/margins": 0.65625, "rewards/rejected": -0.55859375, "step": 117 }, { "epoch": 0.2741396834615943, "grad_norm": 352.8371276855469, "learning_rate": 1.4511627906976745e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.74609375, "logps/chosen": -124.5, "logps/rejected": -126.0, "loss": 16.1631, "rewards/accuracies": 0.75, "rewards/chosen": 0.0400390625, "rewards/margins": 0.54296875, "rewards/rejected": -0.50390625, "step": 118 }, { "epoch": 0.2764629011180485, "grad_norm": 332.5674133300781, "learning_rate": 1.4465116279069766e-06, "logits/chosen": -0.75, "logits/rejected": -0.76953125, "logps/chosen": -132.0, "logps/rejected": -138.0, "loss": 19.4419, "rewards/accuracies": 0.625, "rewards/chosen": -0.06494140625, "rewards/margins": 0.359375, "rewards/rejected": -0.423828125, "step": 119 }, { "epoch": 0.2787861187745027, "grad_norm": 315.2549133300781, "learning_rate": 1.441860465116279e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.76953125, "logps/chosen": -143.0, "logps/rejected": -118.0, "loss": 17.2822, "rewards/accuracies": 0.8125, "rewards/chosen": -0.099609375, "rewards/margins": 0.46875, "rewards/rejected": -0.56640625, "step": 120 }, { "epoch": 0.28110933643095687, "grad_norm": 478.6551818847656, "learning_rate": 1.4372093023255813e-06, "logits/chosen": -0.6953125, "logits/rejected": -0.7578125, "logps/chosen": -144.0, "logps/rejected": -128.0, "loss": 17.1152, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0625, "rewards/margins": 0.5625, "rewards/rejected": -0.498046875, "step": 121 }, { "epoch": 0.2834325540874111, "grad_norm": 391.9820251464844, "learning_rate": 1.4325581395348837e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.75390625, "logps/chosen": -129.0, "logps/rejected": -131.0, "loss": 20.3496, "rewards/accuracies": 0.59375, "rewards/chosen": -0.0390625, "rewards/margins": 0.3359375, "rewards/rejected": -0.376953125, "step": 122 }, { "epoch": 0.28575577174386524, "grad_norm": 303.6994934082031, "learning_rate": 1.427906976744186e-06, "logits/chosen": -0.67578125, "logits/rejected": -0.75390625, "logps/chosen": -143.0, "logps/rejected": -120.5, "loss": 13.2358, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1875, "rewards/margins": 0.890625, "rewards/rejected": -0.703125, "step": 123 }, { "epoch": 0.28807898940031945, "grad_norm": 446.9607238769531, "learning_rate": 1.4232558139534882e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.76171875, "logps/chosen": -130.0, "logps/rejected": -159.0, "loss": 21.2852, "rewards/accuracies": 0.625, "rewards/chosen": -0.197265625, "rewards/margins": 0.306640625, "rewards/rejected": -0.50390625, "step": 124 }, { "epoch": 0.2904022070567736, "grad_norm": 445.76715087890625, "learning_rate": 1.4186046511627907e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.79296875, "logps/chosen": -138.0, "logps/rejected": -137.0, "loss": 21.9111, "rewards/accuracies": 0.5625, "rewards/chosen": -0.10302734375, "rewards/margins": 0.1767578125, "rewards/rejected": -0.279296875, "step": 125 }, { "epoch": 0.2927254247132278, "grad_norm": 332.1394348144531, "learning_rate": 1.4139534883720929e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.75390625, "logps/chosen": -141.0, "logps/rejected": -117.5, "loss": 16.6499, "rewards/accuracies": 0.71875, "rewards/chosen": -0.02978515625, "rewards/margins": 0.6328125, "rewards/rejected": -0.6640625, "step": 126 }, { "epoch": 0.29504864236968203, "grad_norm": 344.578857421875, "learning_rate": 1.4093023255813954e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.75390625, "logps/chosen": -162.0, "logps/rejected": -116.0, "loss": 17.2349, "rewards/accuracies": 0.6875, "rewards/chosen": 0.14453125, "rewards/margins": 0.62109375, "rewards/rejected": -0.4765625, "step": 127 }, { "epoch": 0.2973718600261362, "grad_norm": 346.4666748046875, "learning_rate": 1.4046511627906976e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.73828125, "logps/chosen": -114.0, "logps/rejected": -124.5, "loss": 15.5078, "rewards/accuracies": 0.75, "rewards/chosen": 0.032958984375, "rewards/margins": 0.640625, "rewards/rejected": -0.60546875, "step": 128 }, { "epoch": 0.2996950776825904, "grad_norm": 299.059814453125, "learning_rate": 1.4e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.78125, "logps/chosen": -133.0, "logps/rejected": -117.0, "loss": 15.9556, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0213623046875, "rewards/margins": 0.66796875, "rewards/rejected": -0.6484375, "step": 129 }, { "epoch": 0.30201829533904456, "grad_norm": 381.7353820800781, "learning_rate": 1.3953488372093023e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.73046875, "logps/chosen": -136.0, "logps/rejected": -133.0, "loss": 17.2666, "rewards/accuracies": 0.65625, "rewards/chosen": -0.045166015625, "rewards/margins": 0.51171875, "rewards/rejected": -0.5546875, "step": 130 }, { "epoch": 0.3043415129954988, "grad_norm": 341.33587646484375, "learning_rate": 1.3906976744186044e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.79296875, "logps/chosen": -135.0, "logps/rejected": -133.0, "loss": 16.5908, "rewards/accuracies": 0.6875, "rewards/chosen": 0.034423828125, "rewards/margins": 0.60546875, "rewards/rejected": -0.5703125, "step": 131 }, { "epoch": 0.30666473065195293, "grad_norm": 344.2981872558594, "learning_rate": 1.386046511627907e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.75, "logps/chosen": -124.0, "logps/rejected": -125.5, "loss": 17.6572, "rewards/accuracies": 0.6875, "rewards/chosen": -0.1435546875, "rewards/margins": 0.455078125, "rewards/rejected": -0.59765625, "step": 132 }, { "epoch": 0.30898794830840715, "grad_norm": 348.2516784667969, "learning_rate": 1.3813953488372091e-06, "logits/chosen": -0.71875, "logits/rejected": -0.73046875, "logps/chosen": -135.0, "logps/rejected": -143.0, "loss": 16.5669, "rewards/accuracies": 0.625, "rewards/chosen": 0.02734375, "rewards/margins": 0.6875, "rewards/rejected": -0.66015625, "step": 133 }, { "epoch": 0.31131116596486136, "grad_norm": 362.1626892089844, "learning_rate": 1.3767441860465117e-06, "logits/chosen": -0.828125, "logits/rejected": -0.80859375, "logps/chosen": -127.0, "logps/rejected": -129.0, "loss": 18.2139, "rewards/accuracies": 0.78125, "rewards/chosen": 0.006195068359375, "rewards/margins": 0.5234375, "rewards/rejected": -0.515625, "step": 134 }, { "epoch": 0.3136343836213155, "grad_norm": 353.5246887207031, "learning_rate": 1.3720930232558139e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.7890625, "logps/chosen": -141.0, "logps/rejected": -121.5, "loss": 13.8765, "rewards/accuracies": 0.8125, "rewards/chosen": 0.166015625, "rewards/margins": 0.88671875, "rewards/rejected": -0.71875, "step": 135 }, { "epoch": 0.31595760127776973, "grad_norm": 372.60943603515625, "learning_rate": 1.3674418604651162e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.80859375, "logps/chosen": -140.0, "logps/rejected": -115.0, "loss": 17.5029, "rewards/accuracies": 0.625, "rewards/chosen": 0.1630859375, "rewards/margins": 0.55859375, "rewards/rejected": -0.39453125, "step": 136 }, { "epoch": 0.3182808189342239, "grad_norm": 321.0161437988281, "learning_rate": 1.3627906976744186e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.78125, "logps/chosen": -134.0, "logps/rejected": -121.5, "loss": 18.1797, "rewards/accuracies": 0.71875, "rewards/chosen": -0.123046875, "rewards/margins": 0.5, "rewards/rejected": -0.625, "step": 137 }, { "epoch": 0.3206040365906781, "grad_norm": 446.3941345214844, "learning_rate": 1.3581395348837207e-06, "logits/chosen": -0.78125, "logits/rejected": -0.78125, "logps/chosen": -124.5, "logps/rejected": -136.0, "loss": 20.2749, "rewards/accuracies": 0.625, "rewards/chosen": -0.13671875, "rewards/margins": 0.32421875, "rewards/rejected": -0.4609375, "step": 138 }, { "epoch": 0.32292725424713226, "grad_norm": 331.55670166015625, "learning_rate": 1.3534883720930233e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.73046875, "logps/chosen": -138.0, "logps/rejected": -128.0, "loss": 16.3931, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0022125244140625, "rewards/margins": 0.66015625, "rewards/rejected": -0.66015625, "step": 139 }, { "epoch": 0.32525047190358647, "grad_norm": 352.9888000488281, "learning_rate": 1.3488372093023254e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.81640625, "logps/chosen": -129.0, "logps/rejected": -132.0, "loss": 16.7803, "rewards/accuracies": 0.71875, "rewards/chosen": -0.029052734375, "rewards/margins": 0.60546875, "rewards/rejected": -0.6328125, "step": 140 }, { "epoch": 0.3275736895600407, "grad_norm": 406.76025390625, "learning_rate": 1.344186046511628e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.78515625, "logps/chosen": -159.0, "logps/rejected": -124.5, "loss": 20.5513, "rewards/accuracies": 0.65625, "rewards/chosen": -0.1513671875, "rewards/margins": 0.33984375, "rewards/rejected": -0.490234375, "step": 141 }, { "epoch": 0.32989690721649484, "grad_norm": 329.72747802734375, "learning_rate": 1.3395348837209301e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.765625, "logps/chosen": -131.0, "logps/rejected": -131.0, "loss": 15.2583, "rewards/accuracies": 0.78125, "rewards/chosen": 0.09716796875, "rewards/margins": 0.6796875, "rewards/rejected": -0.5859375, "step": 142 }, { "epoch": 0.33222012487294905, "grad_norm": 353.4764709472656, "learning_rate": 1.3348837209302327e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.8203125, "logps/chosen": -138.0, "logps/rejected": -126.0, "loss": 15.2578, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1416015625, "rewards/margins": 0.75390625, "rewards/rejected": -0.61328125, "step": 143 }, { "epoch": 0.3345433425294032, "grad_norm": 333.3570861816406, "learning_rate": 1.3302325581395348e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.83203125, "logps/chosen": -132.0, "logps/rejected": -125.0, "loss": 15.1777, "rewards/accuracies": 0.625, "rewards/chosen": 0.11669921875, "rewards/margins": 0.77734375, "rewards/rejected": -0.66015625, "step": 144 }, { "epoch": 0.3368665601858574, "grad_norm": 359.3620300292969, "learning_rate": 1.325581395348837e-06, "logits/chosen": -0.8203125, "logits/rejected": -0.7890625, "logps/chosen": -140.0, "logps/rejected": -154.0, "loss": 18.0942, "rewards/accuracies": 0.71875, "rewards/chosen": 0.04833984375, "rewards/margins": 0.494140625, "rewards/rejected": -0.4453125, "step": 145 }, { "epoch": 0.3391897778423116, "grad_norm": 364.3636169433594, "learning_rate": 1.3209302325581396e-06, "logits/chosen": -0.7265625, "logits/rejected": -0.76953125, "logps/chosen": -127.5, "logps/rejected": -113.5, "loss": 18.7627, "rewards/accuracies": 0.75, "rewards/chosen": -0.10791015625, "rewards/margins": 0.46484375, "rewards/rejected": -0.5703125, "step": 146 }, { "epoch": 0.3415129954987658, "grad_norm": 402.0943908691406, "learning_rate": 1.3162790697674417e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.69921875, "logps/chosen": -132.0, "logps/rejected": -137.0, "loss": 16.6462, "rewards/accuracies": 0.71875, "rewards/chosen": 0.04541015625, "rewards/margins": 0.6640625, "rewards/rejected": -0.6171875, "step": 147 }, { "epoch": 0.34383621315522, "grad_norm": 381.5396728515625, "learning_rate": 1.3116279069767443e-06, "logits/chosen": -0.80078125, "logits/rejected": -0.83984375, "logps/chosen": -128.0, "logps/rejected": -130.0, "loss": 17.2354, "rewards/accuracies": 0.75, "rewards/chosen": 0.05078125, "rewards/margins": 0.58984375, "rewards/rejected": -0.5390625, "step": 148 }, { "epoch": 0.34615943081167416, "grad_norm": 329.5745544433594, "learning_rate": 1.3069767441860464e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.7890625, "logps/chosen": -127.0, "logps/rejected": -129.0, "loss": 14.4468, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0140380859375, "rewards/margins": 0.7109375, "rewards/rejected": -0.6953125, "step": 149 }, { "epoch": 0.3484826484681284, "grad_norm": 300.583740234375, "learning_rate": 1.302325581395349e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.83984375, "logps/chosen": -116.5, "logps/rejected": -121.5, "loss": 14.4277, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0400390625, "rewards/margins": 0.77734375, "rewards/rejected": -0.73828125, "step": 150 }, { "epoch": 0.35080586612458253, "grad_norm": 334.9747619628906, "learning_rate": 1.2976744186046511e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.75, "logps/chosen": -137.0, "logps/rejected": -123.0, "loss": 14.1069, "rewards/accuracies": 0.8125, "rewards/chosen": 0.208984375, "rewards/margins": 0.8515625, "rewards/rejected": -0.64453125, "step": 151 }, { "epoch": 0.35312908378103675, "grad_norm": 321.225341796875, "learning_rate": 1.2930232558139533e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.77734375, "logps/chosen": -122.0, "logps/rejected": -124.5, "loss": 16.7876, "rewards/accuracies": 0.71875, "rewards/chosen": 0.16015625, "rewards/margins": 0.6640625, "rewards/rejected": -0.50390625, "step": 152 }, { "epoch": 0.3554523014374909, "grad_norm": 405.748291015625, "learning_rate": 1.2883720930232558e-06, "logits/chosen": -0.796875, "logits/rejected": -0.78515625, "logps/chosen": -121.5, "logps/rejected": -126.0, "loss": 20.0581, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0693359375, "rewards/margins": 0.361328125, "rewards/rejected": -0.291015625, "step": 153 }, { "epoch": 0.3577755190939451, "grad_norm": 368.13897705078125, "learning_rate": 1.283720930232558e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.7734375, "logps/chosen": -129.0, "logps/rejected": -126.0, "loss": 17.3945, "rewards/accuracies": 0.75, "rewards/chosen": -0.10205078125, "rewards/margins": 0.5234375, "rewards/rejected": -0.62890625, "step": 154 }, { "epoch": 0.36009873675039933, "grad_norm": 350.93634033203125, "learning_rate": 1.2790697674418605e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.8046875, "logps/chosen": -132.0, "logps/rejected": -117.0, "loss": 16.8164, "rewards/accuracies": 0.75, "rewards/chosen": 0.1787109375, "rewards/margins": 0.66796875, "rewards/rejected": -0.48828125, "step": 155 }, { "epoch": 0.3624219544068535, "grad_norm": 415.9078674316406, "learning_rate": 1.2744186046511627e-06, "logits/chosen": -0.75, "logits/rejected": -0.7734375, "logps/chosen": -116.5, "logps/rejected": -144.0, "loss": 18.9238, "rewards/accuracies": 0.625, "rewards/chosen": 0.09521484375, "rewards/margins": 0.455078125, "rewards/rejected": -0.361328125, "step": 156 }, { "epoch": 0.3647451720633077, "grad_norm": 312.6370849609375, "learning_rate": 1.269767441860465e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.79296875, "logps/chosen": -110.5, "logps/rejected": -138.0, "loss": 15.6787, "rewards/accuracies": 0.75, "rewards/chosen": 0.0986328125, "rewards/margins": 0.640625, "rewards/rejected": -0.54296875, "step": 157 }, { "epoch": 0.36706838971976186, "grad_norm": 382.05224609375, "learning_rate": 1.2651162790697674e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.7578125, "logps/chosen": -129.0, "logps/rejected": -137.0, "loss": 19.4893, "rewards/accuracies": 0.625, "rewards/chosen": 0.045654296875, "rewards/margins": 0.4375, "rewards/rejected": -0.392578125, "step": 158 }, { "epoch": 0.36939160737621607, "grad_norm": 310.7190856933594, "learning_rate": 1.2604651162790697e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.81640625, "logps/chosen": -135.0, "logps/rejected": -138.0, "loss": 13.9204, "rewards/accuracies": 0.78125, "rewards/chosen": 0.265625, "rewards/margins": 0.859375, "rewards/rejected": -0.58984375, "step": 159 }, { "epoch": 0.3717148250326702, "grad_norm": 389.124267578125, "learning_rate": 1.255813953488372e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.765625, "logps/chosen": -129.0, "logps/rejected": -152.0, "loss": 20.2124, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0064697265625, "rewards/margins": 0.3515625, "rewards/rejected": -0.34375, "step": 160 }, { "epoch": 0.37403804268912444, "grad_norm": 375.34124755859375, "learning_rate": 1.2511627906976742e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.79296875, "logps/chosen": -126.5, "logps/rejected": -134.0, "loss": 17.8145, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0242919921875, "rewards/margins": 0.51171875, "rewards/rejected": -0.48828125, "step": 161 }, { "epoch": 0.37636126034557865, "grad_norm": 379.35711669921875, "learning_rate": 1.2465116279069768e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.7578125, "logps/chosen": -127.0, "logps/rejected": -130.0, "loss": 19.0, "rewards/accuracies": 0.625, "rewards/chosen": -0.020263671875, "rewards/margins": 0.37890625, "rewards/rejected": -0.3984375, "step": 162 }, { "epoch": 0.3786844780020328, "grad_norm": 381.5658264160156, "learning_rate": 1.241860465116279e-06, "logits/chosen": -0.73046875, "logits/rejected": -0.7890625, "logps/chosen": -125.5, "logps/rejected": -128.0, "loss": 15.1387, "rewards/accuracies": 0.8125, "rewards/chosen": 0.115234375, "rewards/margins": 0.6796875, "rewards/rejected": -0.5625, "step": 163 }, { "epoch": 0.381007695658487, "grad_norm": 336.80560302734375, "learning_rate": 1.2372093023255813e-06, "logits/chosen": -0.78125, "logits/rejected": -0.7421875, "logps/chosen": -125.5, "logps/rejected": -128.0, "loss": 17.6543, "rewards/accuracies": 0.625, "rewards/chosen": 0.1962890625, "rewards/margins": 0.55859375, "rewards/rejected": -0.361328125, "step": 164 }, { "epoch": 0.3833309133149412, "grad_norm": 372.18060302734375, "learning_rate": 1.2325581395348837e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.7578125, "logps/chosen": -126.5, "logps/rejected": -122.5, "loss": 18.4209, "rewards/accuracies": 0.75, "rewards/chosen": -0.0205078125, "rewards/margins": 0.416015625, "rewards/rejected": -0.4375, "step": 165 }, { "epoch": 0.3856541309713954, "grad_norm": 344.254638671875, "learning_rate": 1.227906976744186e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.78515625, "logps/chosen": -127.5, "logps/rejected": -133.0, "loss": 15.5132, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2236328125, "rewards/margins": 0.671875, "rewards/rejected": -0.447265625, "step": 166 }, { "epoch": 0.38797734862784955, "grad_norm": 341.03778076171875, "learning_rate": 1.2232558139534884e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.74609375, "logps/chosen": -127.0, "logps/rejected": -126.5, "loss": 14.437, "rewards/accuracies": 0.8125, "rewards/chosen": 0.259765625, "rewards/margins": 0.7734375, "rewards/rejected": -0.51171875, "step": 167 }, { "epoch": 0.39030056628430376, "grad_norm": 390.4228515625, "learning_rate": 1.2186046511627905e-06, "logits/chosen": -0.8125, "logits/rejected": -0.81640625, "logps/chosen": -124.5, "logps/rejected": -143.0, "loss": 19.0215, "rewards/accuracies": 0.6875, "rewards/chosen": 0.02490234375, "rewards/margins": 0.443359375, "rewards/rejected": -0.41796875, "step": 168 }, { "epoch": 0.392623783940758, "grad_norm": 351.5334167480469, "learning_rate": 1.213953488372093e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.78515625, "logps/chosen": -115.5, "logps/rejected": -132.0, "loss": 15.6899, "rewards/accuracies": 0.6875, "rewards/chosen": 0.09765625, "rewards/margins": 0.69140625, "rewards/rejected": -0.59375, "step": 169 }, { "epoch": 0.39494700159721213, "grad_norm": 328.7664794921875, "learning_rate": 1.2093023255813952e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.79296875, "logps/chosen": -120.5, "logps/rejected": -121.5, "loss": 16.6416, "rewards/accuracies": 0.75, "rewards/chosen": 0.181640625, "rewards/margins": 0.56640625, "rewards/rejected": -0.384765625, "step": 170 }, { "epoch": 0.39727021925366635, "grad_norm": 341.4001159667969, "learning_rate": 1.2046511627906976e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.7734375, "logps/chosen": -134.0, "logps/rejected": -120.5, "loss": 15.8726, "rewards/accuracies": 0.6875, "rewards/chosen": 0.263671875, "rewards/margins": 0.734375, "rewards/rejected": -0.47265625, "step": 171 }, { "epoch": 0.3995934369101205, "grad_norm": 398.38494873046875, "learning_rate": 1.2e-06, "logits/chosen": -0.78125, "logits/rejected": -0.8125, "logps/chosen": -130.0, "logps/rejected": -123.5, "loss": 16.7817, "rewards/accuracies": 0.78125, "rewards/chosen": 0.06884765625, "rewards/margins": 0.5625, "rewards/rejected": -0.494140625, "step": 172 }, { "epoch": 0.4019166545665747, "grad_norm": 317.2485046386719, "learning_rate": 1.1953488372093023e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.796875, "logps/chosen": -133.0, "logps/rejected": -127.0, "loss": 15.2124, "rewards/accuracies": 0.71875, "rewards/chosen": 0.3125, "rewards/margins": 0.8046875, "rewards/rejected": -0.4921875, "step": 173 }, { "epoch": 0.4042398722230289, "grad_norm": 339.8619079589844, "learning_rate": 1.1906976744186047e-06, "logits/chosen": -0.796875, "logits/rejected": -0.78125, "logps/chosen": -129.0, "logps/rejected": -129.0, "loss": 15.6531, "rewards/accuracies": 0.78125, "rewards/chosen": 0.236328125, "rewards/margins": 0.703125, "rewards/rejected": -0.46875, "step": 174 }, { "epoch": 0.4065630898794831, "grad_norm": 367.23388671875, "learning_rate": 1.186046511627907e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.8125, "logps/chosen": -138.0, "logps/rejected": -121.0, "loss": 16.7554, "rewards/accuracies": 0.71875, "rewards/chosen": 0.130859375, "rewards/margins": 0.546875, "rewards/rejected": -0.4140625, "step": 175 }, { "epoch": 0.4088863075359373, "grad_norm": 408.7874755859375, "learning_rate": 1.1813953488372092e-06, "logits/chosen": -0.8046875, "logits/rejected": -0.8125, "logps/chosen": -138.0, "logps/rejected": -107.5, "loss": 15.5679, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2275390625, "rewards/margins": 0.69140625, "rewards/rejected": -0.462890625, "step": 176 }, { "epoch": 0.41120952519239146, "grad_norm": 373.4058532714844, "learning_rate": 1.1767441860465115e-06, "logits/chosen": -0.78125, "logits/rejected": -0.77734375, "logps/chosen": -122.0, "logps/rejected": -134.0, "loss": 16.6733, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1015625, "rewards/margins": 0.56640625, "rewards/rejected": -0.46484375, "step": 177 }, { "epoch": 0.41353274284884567, "grad_norm": 384.1882629394531, "learning_rate": 1.1720930232558139e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.796875, "logps/chosen": -120.5, "logps/rejected": -128.0, "loss": 18.0225, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0086669921875, "rewards/margins": 0.482421875, "rewards/rejected": -0.47265625, "step": 178 }, { "epoch": 0.4158559605052998, "grad_norm": 424.3437805175781, "learning_rate": 1.1674418604651162e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.7890625, "logps/chosen": -145.0, "logps/rejected": -166.0, "loss": 14.7715, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1630859375, "rewards/margins": 0.84765625, "rewards/rejected": -0.68359375, "step": 179 }, { "epoch": 0.41817917816175404, "grad_norm": 329.7294921875, "learning_rate": 1.1627906976744186e-06, "logits/chosen": -0.8515625, "logits/rejected": -0.8515625, "logps/chosen": -132.0, "logps/rejected": -124.5, "loss": 16.3423, "rewards/accuracies": 0.78125, "rewards/chosen": -0.057861328125, "rewards/margins": 0.58203125, "rewards/rejected": -0.640625, "step": 180 }, { "epoch": 0.4205023958182082, "grad_norm": 365.58685302734375, "learning_rate": 1.158139534883721e-06, "logits/chosen": -0.78125, "logits/rejected": -0.8203125, "logps/chosen": -121.0, "logps/rejected": -113.5, "loss": 18.0498, "rewards/accuracies": 0.65625, "rewards/chosen": 0.05859375, "rewards/margins": 0.48828125, "rewards/rejected": -0.427734375, "step": 181 }, { "epoch": 0.4228256134746624, "grad_norm": 369.9940185546875, "learning_rate": 1.1534883720930233e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.796875, "logps/chosen": -122.0, "logps/rejected": -144.0, "loss": 15.6062, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1943359375, "rewards/margins": 0.76171875, "rewards/rejected": -0.56640625, "step": 182 }, { "epoch": 0.4251488311311166, "grad_norm": 310.1455078125, "learning_rate": 1.1488372093023254e-06, "logits/chosen": -0.734375, "logits/rejected": -0.78125, "logps/chosen": -118.5, "logps/rejected": -112.5, "loss": 14.6064, "rewards/accuracies": 0.84375, "rewards/chosen": 0.07373046875, "rewards/margins": 0.73046875, "rewards/rejected": -0.65625, "step": 183 }, { "epoch": 0.4274720487875708, "grad_norm": 396.49993896484375, "learning_rate": 1.1441860465116278e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.83203125, "logps/chosen": -142.0, "logps/rejected": -133.0, "loss": 18.1318, "rewards/accuracies": 0.65625, "rewards/chosen": 0.078125, "rewards/margins": 0.55859375, "rewards/rejected": -0.48046875, "step": 184 }, { "epoch": 0.429795266444025, "grad_norm": 357.4013977050781, "learning_rate": 1.1395348837209301e-06, "logits/chosen": -0.75, "logits/rejected": -0.79296875, "logps/chosen": -154.0, "logps/rejected": -125.5, "loss": 16.7104, "rewards/accuracies": 0.78125, "rewards/chosen": -0.043701171875, "rewards/margins": 0.5859375, "rewards/rejected": -0.62890625, "step": 185 }, { "epoch": 0.43211848410047915, "grad_norm": 444.602783203125, "learning_rate": 1.1348837209302325e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.8203125, "logps/chosen": -128.0, "logps/rejected": -133.0, "loss": 18.6221, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0225830078125, "rewards/margins": 0.54296875, "rewards/rejected": -0.51953125, "step": 186 }, { "epoch": 0.43444170175693336, "grad_norm": 329.8465881347656, "learning_rate": 1.1302325581395349e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.8046875, "logps/chosen": -133.0, "logps/rejected": -129.0, "loss": 13.6592, "rewards/accuracies": 0.84375, "rewards/chosen": 0.142578125, "rewards/margins": 0.875, "rewards/rejected": -0.734375, "step": 187 }, { "epoch": 0.4367649194133875, "grad_norm": 460.20770263671875, "learning_rate": 1.1255813953488372e-06, "logits/chosen": -0.78125, "logits/rejected": -0.8046875, "logps/chosen": -132.0, "logps/rejected": -124.0, "loss": 19.8032, "rewards/accuracies": 0.75, "rewards/chosen": 0.0498046875, "rewards/margins": 0.51953125, "rewards/rejected": -0.46875, "step": 188 }, { "epoch": 0.43908813706984173, "grad_norm": 309.28607177734375, "learning_rate": 1.1209302325581396e-06, "logits/chosen": -0.8359375, "logits/rejected": -0.80859375, "logps/chosen": -129.0, "logps/rejected": -121.5, "loss": 12.8267, "rewards/accuracies": 0.75, "rewards/chosen": 0.279296875, "rewards/margins": 1.0, "rewards/rejected": -0.72265625, "step": 189 }, { "epoch": 0.44141135472629595, "grad_norm": 447.365966796875, "learning_rate": 1.1162790697674417e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.8359375, "logps/chosen": -141.0, "logps/rejected": -138.0, "loss": 16.2456, "rewards/accuracies": 0.65625, "rewards/chosen": 0.025146484375, "rewards/margins": 0.671875, "rewards/rejected": -0.64453125, "step": 190 }, { "epoch": 0.4437345723827501, "grad_norm": 417.4530944824219, "learning_rate": 1.1116279069767443e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.79296875, "logps/chosen": -140.0, "logps/rejected": -117.5, "loss": 18.4092, "rewards/accuracies": 0.71875, "rewards/chosen": -0.08154296875, "rewards/margins": 0.494140625, "rewards/rejected": -0.57421875, "step": 191 }, { "epoch": 0.4460577900392043, "grad_norm": 324.08355712890625, "learning_rate": 1.1069767441860464e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.8125, "logps/chosen": -144.0, "logps/rejected": -141.0, "loss": 13.7632, "rewards/accuracies": 0.75, "rewards/chosen": 0.310546875, "rewards/margins": 0.96484375, "rewards/rejected": -0.65625, "step": 192 }, { "epoch": 0.4483810076956585, "grad_norm": 342.5097961425781, "learning_rate": 1.1023255813953488e-06, "logits/chosen": -0.7734375, "logits/rejected": -0.80859375, "logps/chosen": -127.0, "logps/rejected": -104.5, "loss": 15.7559, "rewards/accuracies": 0.75, "rewards/chosen": 0.048583984375, "rewards/margins": 0.7578125, "rewards/rejected": -0.70703125, "step": 193 }, { "epoch": 0.4507042253521127, "grad_norm": 325.03057861328125, "learning_rate": 1.0976744186046511e-06, "logits/chosen": -0.828125, "logits/rejected": -0.8359375, "logps/chosen": -127.0, "logps/rejected": -119.0, "loss": 12.7759, "rewards/accuracies": 0.875, "rewards/chosen": 0.33203125, "rewards/margins": 0.953125, "rewards/rejected": -0.62109375, "step": 194 }, { "epoch": 0.45302744300856684, "grad_norm": 464.0077209472656, "learning_rate": 1.0930232558139535e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.8046875, "logps/chosen": -130.0, "logps/rejected": -124.0, "loss": 14.6401, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2734375, "rewards/margins": 0.99609375, "rewards/rejected": -0.72265625, "step": 195 }, { "epoch": 0.45535066066502106, "grad_norm": 362.340087890625, "learning_rate": 1.0883720930232558e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.77734375, "logps/chosen": -125.5, "logps/rejected": -147.0, "loss": 14.5552, "rewards/accuracies": 0.875, "rewards/chosen": 0.30078125, "rewards/margins": 0.7890625, "rewards/rejected": -0.490234375, "step": 196 }, { "epoch": 0.45767387832147527, "grad_norm": 348.3215026855469, "learning_rate": 1.083720930232558e-06, "logits/chosen": -0.73828125, "logits/rejected": -0.75390625, "logps/chosen": -127.0, "logps/rejected": -111.0, "loss": 16.4644, "rewards/accuracies": 0.75, "rewards/chosen": -0.0018310546875, "rewards/margins": 0.6640625, "rewards/rejected": -0.66796875, "step": 197 }, { "epoch": 0.4599970959779294, "grad_norm": 351.0652160644531, "learning_rate": 1.0790697674418605e-06, "logits/chosen": -0.8359375, "logits/rejected": -0.80078125, "logps/chosen": -141.0, "logps/rejected": -136.0, "loss": 14.1152, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10986328125, "rewards/margins": 0.859375, "rewards/rejected": -0.75, "step": 198 }, { "epoch": 0.46232031363438364, "grad_norm": 357.92828369140625, "learning_rate": 1.0744186046511627e-06, "logits/chosen": -0.734375, "logits/rejected": -0.8125, "logps/chosen": -133.0, "logps/rejected": -121.0, "loss": 13.2341, "rewards/accuracies": 0.8125, "rewards/chosen": 0.369140625, "rewards/margins": 0.94140625, "rewards/rejected": -0.57421875, "step": 199 }, { "epoch": 0.4646435312908378, "grad_norm": 343.2197265625, "learning_rate": 1.069767441860465e-06, "logits/chosen": -0.75390625, "logits/rejected": -0.78125, "logps/chosen": -139.0, "logps/rejected": -119.0, "loss": 14.146, "rewards/accuracies": 0.75, "rewards/chosen": 0.1943359375, "rewards/margins": 0.921875, "rewards/rejected": -0.73046875, "step": 200 }, { "epoch": 0.466966748947292, "grad_norm": 545.7833862304688, "learning_rate": 1.0651162790697674e-06, "logits/chosen": -0.74609375, "logits/rejected": -0.7578125, "logps/chosen": -122.5, "logps/rejected": -125.5, "loss": 21.0857, "rewards/accuracies": 0.53125, "rewards/chosen": 0.05810546875, "rewards/margins": 0.484375, "rewards/rejected": -0.427734375, "step": 201 }, { "epoch": 0.46928996660374617, "grad_norm": 369.3617248535156, "learning_rate": 1.0604651162790695e-06, "logits/chosen": -0.80859375, "logits/rejected": -0.80859375, "logps/chosen": -132.0, "logps/rejected": -120.0, "loss": 15.3125, "rewards/accuracies": 0.75, "rewards/chosen": 0.2080078125, "rewards/margins": 0.734375, "rewards/rejected": -0.52734375, "step": 202 }, { "epoch": 0.4716131842602004, "grad_norm": 366.6146545410156, "learning_rate": 1.0558139534883721e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.828125, "logps/chosen": -129.0, "logps/rejected": -122.0, "loss": 16.0518, "rewards/accuracies": 0.6875, "rewards/chosen": 0.08740234375, "rewards/margins": 0.6328125, "rewards/rejected": -0.546875, "step": 203 }, { "epoch": 0.4739364019166546, "grad_norm": 375.0671691894531, "learning_rate": 1.0511627906976743e-06, "logits/chosen": -0.77734375, "logits/rejected": -0.81640625, "logps/chosen": -148.0, "logps/rejected": -131.0, "loss": 17.3831, "rewards/accuracies": 0.6875, "rewards/chosen": 0.2275390625, "rewards/margins": 0.60546875, "rewards/rejected": -0.37890625, "step": 204 }, { "epoch": 0.47625961957310875, "grad_norm": 371.096435546875, "learning_rate": 1.0465116279069768e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.73828125, "logps/chosen": -107.5, "logps/rejected": -117.0, "loss": 17.873, "rewards/accuracies": 0.625, "rewards/chosen": 0.369140625, "rewards/margins": 0.5546875, "rewards/rejected": -0.1865234375, "step": 205 }, { "epoch": 0.47858283722956296, "grad_norm": 430.0856628417969, "learning_rate": 1.041860465116279e-06, "logits/chosen": -0.76171875, "logits/rejected": -0.72265625, "logps/chosen": -126.5, "logps/rejected": -139.0, "loss": 16.2949, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11328125, "rewards/margins": 0.734375, "rewards/rejected": -0.62109375, "step": 206 }, { "epoch": 0.4809060548860171, "grad_norm": 341.1052551269531, "learning_rate": 1.0372093023255815e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.8125, "logps/chosen": -135.0, "logps/rejected": -123.5, "loss": 13.1196, "rewards/accuracies": 0.875, "rewards/chosen": 0.1865234375, "rewards/margins": 0.91015625, "rewards/rejected": -0.72265625, "step": 207 }, { "epoch": 0.48322927254247133, "grad_norm": 346.2690734863281, "learning_rate": 1.0325581395348837e-06, "logits/chosen": -0.7890625, "logits/rejected": -0.796875, "logps/chosen": -140.0, "logps/rejected": -127.0, "loss": 15.2632, "rewards/accuracies": 0.75, "rewards/chosen": 0.27734375, "rewards/margins": 0.765625, "rewards/rejected": -0.48828125, "step": 208 }, { "epoch": 0.4855524901989255, "grad_norm": 368.310546875, "learning_rate": 1.0279069767441858e-06, "logits/chosen": -0.76953125, "logits/rejected": -0.80859375, "logps/chosen": -133.0, "logps/rejected": -129.0, "loss": 16.1709, "rewards/accuracies": 0.75, "rewards/chosen": 0.0908203125, "rewards/margins": 0.71484375, "rewards/rejected": -0.625, "step": 209 }, { "epoch": 0.4878757078553797, "grad_norm": 361.7778625488281, "learning_rate": 1.0232558139534884e-06, "logits/chosen": -0.8515625, "logits/rejected": -0.83203125, "logps/chosen": -140.0, "logps/rejected": -126.5, "loss": 16.666, "rewards/accuracies": 0.71875, "rewards/chosen": 0.216796875, "rewards/margins": 0.52734375, "rewards/rejected": -0.310546875, "step": 210 }, { "epoch": 0.4901989255118339, "grad_norm": 360.10772705078125, "learning_rate": 1.0186046511627905e-06, "logits/chosen": -0.78515625, "logits/rejected": -0.81640625, "logps/chosen": -127.0, "logps/rejected": -139.0, "loss": 14.7661, "rewards/accuracies": 0.8125, "rewards/chosen": 0.322265625, "rewards/margins": 0.7890625, "rewards/rejected": -0.466796875, "step": 211 }, { "epoch": 0.4925221431682881, "grad_norm": 329.1163635253906, "learning_rate": 1.013953488372093e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.77734375, "logps/chosen": -119.5, "logps/rejected": -133.0, "loss": 13.1077, "rewards/accuracies": 0.8125, "rewards/chosen": 0.33984375, "rewards/margins": 1.0078125, "rewards/rejected": -0.66796875, "step": 212 }, { "epoch": 0.4948453608247423, "grad_norm": 362.64532470703125, "learning_rate": 1.0093023255813952e-06, "logits/chosen": -0.7578125, "logits/rejected": -0.77734375, "logps/chosen": -134.0, "logps/rejected": -117.0, "loss": 12.6914, "rewards/accuracies": 0.75, "rewards/chosen": 0.4296875, "rewards/margins": 0.9921875, "rewards/rejected": -0.5625, "step": 213 }, { "epoch": 0.49716857848119644, "grad_norm": 330.487060546875, "learning_rate": 1.0046511627906978e-06, "logits/chosen": -0.79296875, "logits/rejected": -0.86328125, "logps/chosen": -127.5, "logps/rejected": -114.0, "loss": 12.9277, "rewards/accuracies": 0.75, "rewards/chosen": 0.43359375, "rewards/margins": 1.078125, "rewards/rejected": -0.64453125, "step": 214 }, { "epoch": 0.49949179613765066, "grad_norm": 339.9930725097656, "learning_rate": 1e-06, "logits/chosen": -0.828125, "logits/rejected": -0.83203125, "logps/chosen": -128.0, "logps/rejected": -141.0, "loss": 13.7705, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2294921875, "rewards/margins": 0.90234375, "rewards/rejected": -0.671875, "step": 215 }, { "epoch": 0.5018150137941049, "grad_norm": 376.1474609375, "learning_rate": 9.953488372093023e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.83203125, "logps/chosen": -124.0, "logps/rejected": -123.0, "loss": 15.8398, "rewards/accuracies": 0.75, "rewards/chosen": 0.2431640625, "rewards/margins": 0.73828125, "rewards/rejected": -0.49609375, "step": 216 }, { "epoch": 0.504138231450559, "grad_norm": 332.0564880371094, "learning_rate": 9.906976744186047e-07, "logits/chosen": -0.78515625, "logits/rejected": -0.8203125, "logps/chosen": -122.5, "logps/rejected": -115.5, "loss": 12.4272, "rewards/accuracies": 0.875, "rewards/chosen": 0.298828125, "rewards/margins": 1.015625, "rewards/rejected": -0.7109375, "step": 217 }, { "epoch": 0.5064614491070132, "grad_norm": 358.8477783203125, "learning_rate": 9.86046511627907e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.80859375, "logps/chosen": -123.0, "logps/rejected": -144.0, "loss": 15.3477, "rewards/accuracies": 0.78125, "rewards/chosen": 0.3203125, "rewards/margins": 0.73828125, "rewards/rejected": -0.41796875, "step": 218 }, { "epoch": 0.5087846667634675, "grad_norm": 329.1252746582031, "learning_rate": 9.813953488372092e-07, "logits/chosen": -0.81640625, "logits/rejected": -0.83984375, "logps/chosen": -124.0, "logps/rejected": -114.0, "loss": 14.4053, "rewards/accuracies": 0.875, "rewards/chosen": 0.1845703125, "rewards/margins": 0.76171875, "rewards/rejected": -0.578125, "step": 219 }, { "epoch": 0.5111078844199216, "grad_norm": 333.0457763671875, "learning_rate": 9.767441860465115e-07, "logits/chosen": -0.77734375, "logits/rejected": -0.8125, "logps/chosen": -136.0, "logps/rejected": -125.5, "loss": 14.3213, "rewards/accuracies": 0.75, "rewards/chosen": 0.34375, "rewards/margins": 0.88671875, "rewards/rejected": -0.54296875, "step": 220 }, { "epoch": 0.5134311020763758, "grad_norm": 371.3757019042969, "learning_rate": 9.720930232558139e-07, "logits/chosen": -0.76953125, "logits/rejected": -0.796875, "logps/chosen": -152.0, "logps/rejected": -116.0, "loss": 12.0801, "rewards/accuracies": 0.8125, "rewards/chosen": 0.361328125, "rewards/margins": 1.1328125, "rewards/rejected": -0.76953125, "step": 221 }, { "epoch": 0.5157543197328299, "grad_norm": 422.3089599609375, "learning_rate": 9.674418604651162e-07, "logits/chosen": -0.78515625, "logits/rejected": -0.87109375, "logps/chosen": -133.0, "logps/rejected": -114.5, "loss": 11.6069, "rewards/accuracies": 0.8125, "rewards/chosen": 0.43359375, "rewards/margins": 1.2265625, "rewards/rejected": -0.7890625, "step": 222 }, { "epoch": 0.5180775373892842, "grad_norm": 410.4743957519531, "learning_rate": 9.627906976744186e-07, "logits/chosen": -0.75390625, "logits/rejected": -0.75, "logps/chosen": -115.5, "logps/rejected": -145.0, "loss": 16.8779, "rewards/accuracies": 0.75, "rewards/chosen": 0.11767578125, "rewards/margins": 0.62109375, "rewards/rejected": -0.50390625, "step": 223 }, { "epoch": 0.5204007550457384, "grad_norm": 311.5373840332031, "learning_rate": 9.58139534883721e-07, "logits/chosen": -0.75390625, "logits/rejected": -0.80078125, "logps/chosen": -122.0, "logps/rejected": -131.0, "loss": 10.292, "rewards/accuracies": 0.90625, "rewards/chosen": 0.498046875, "rewards/margins": 1.2890625, "rewards/rejected": -0.7890625, "step": 224 }, { "epoch": 0.5227239727021925, "grad_norm": 366.3830261230469, "learning_rate": 9.534883720930232e-07, "logits/chosen": -0.77734375, "logits/rejected": -0.8125, "logps/chosen": -134.0, "logps/rejected": -132.0, "loss": 17.2888, "rewards/accuracies": 0.65625, "rewards/chosen": 0.2001953125, "rewards/margins": 0.69921875, "rewards/rejected": -0.5, "step": 225 }, { "epoch": 0.5250471903586468, "grad_norm": 361.7061767578125, "learning_rate": 9.488372093023255e-07, "logits/chosen": -0.796875, "logits/rejected": -0.8203125, "logps/chosen": -143.0, "logps/rejected": -133.0, "loss": 14.6245, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2236328125, "rewards/margins": 0.9140625, "rewards/rejected": -0.6875, "step": 226 }, { "epoch": 0.5273704080151009, "grad_norm": 289.1031494140625, "learning_rate": 9.441860465116278e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.86328125, "logps/chosen": -142.0, "logps/rejected": -120.5, "loss": 12.0532, "rewards/accuracies": 0.90625, "rewards/chosen": 0.357421875, "rewards/margins": 1.0546875, "rewards/rejected": -0.703125, "step": 227 }, { "epoch": 0.5296936256715551, "grad_norm": 355.6830749511719, "learning_rate": 9.395348837209302e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.81640625, "logps/chosen": -132.0, "logps/rejected": -143.0, "loss": 14.6467, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1650390625, "rewards/margins": 0.94140625, "rewards/rejected": -0.77734375, "step": 228 }, { "epoch": 0.5320168433280092, "grad_norm": 387.17864990234375, "learning_rate": 9.348837209302325e-07, "logits/chosen": -0.796875, "logits/rejected": -0.77734375, "logps/chosen": -139.0, "logps/rejected": -137.0, "loss": 15.71, "rewards/accuracies": 0.625, "rewards/chosen": 0.271484375, "rewards/margins": 0.796875, "rewards/rejected": -0.5234375, "step": 229 }, { "epoch": 0.5343400609844635, "grad_norm": 399.5079040527344, "learning_rate": 9.302325581395349e-07, "logits/chosen": -0.80078125, "logits/rejected": -0.8515625, "logps/chosen": -127.5, "logps/rejected": -132.0, "loss": 16.8394, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0732421875, "rewards/margins": 0.8046875, "rewards/rejected": -0.73046875, "step": 230 }, { "epoch": 0.5366632786409177, "grad_norm": 360.01348876953125, "learning_rate": 9.255813953488372e-07, "logits/chosen": -0.76171875, "logits/rejected": -0.78515625, "logps/chosen": -133.0, "logps/rejected": -126.0, "loss": 12.9294, "rewards/accuracies": 0.78125, "rewards/chosen": 0.201171875, "rewards/margins": 1.125, "rewards/rejected": -0.921875, "step": 231 }, { "epoch": 0.5389864962973718, "grad_norm": 427.7103271484375, "learning_rate": 9.209302325581395e-07, "logits/chosen": -0.796875, "logits/rejected": -0.81640625, "logps/chosen": -135.0, "logps/rejected": -137.0, "loss": 15.2183, "rewards/accuracies": 0.75, "rewards/chosen": 0.2294921875, "rewards/margins": 0.94140625, "rewards/rejected": -0.7109375, "step": 232 }, { "epoch": 0.5413097139538261, "grad_norm": 412.2069091796875, "learning_rate": 9.162790697674418e-07, "logits/chosen": -0.76171875, "logits/rejected": -0.82421875, "logps/chosen": -122.5, "logps/rejected": -118.5, "loss": 13.958, "rewards/accuracies": 0.78125, "rewards/chosen": 0.298828125, "rewards/margins": 0.9609375, "rewards/rejected": -0.6640625, "step": 233 }, { "epoch": 0.5436329316102803, "grad_norm": 363.20806884765625, "learning_rate": 9.116279069767442e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.828125, "logps/chosen": -124.0, "logps/rejected": -132.0, "loss": 14.4912, "rewards/accuracies": 0.8125, "rewards/chosen": 0.318359375, "rewards/margins": 0.8671875, "rewards/rejected": -0.55078125, "step": 234 }, { "epoch": 0.5459561492667344, "grad_norm": 347.8995056152344, "learning_rate": 9.069767441860464e-07, "logits/chosen": -0.7734375, "logits/rejected": -0.85546875, "logps/chosen": -152.0, "logps/rejected": -111.5, "loss": 13.7517, "rewards/accuracies": 0.875, "rewards/chosen": 0.24609375, "rewards/margins": 0.99609375, "rewards/rejected": -0.75, "step": 235 }, { "epoch": 0.5482793669231886, "grad_norm": 466.9878234863281, "learning_rate": 9.023255813953488e-07, "logits/chosen": -0.77734375, "logits/rejected": -0.80859375, "logps/chosen": -124.5, "logps/rejected": -126.0, "loss": 15.3323, "rewards/accuracies": 0.71875, "rewards/chosen": 0.30859375, "rewards/margins": 0.9609375, "rewards/rejected": -0.65234375, "step": 236 }, { "epoch": 0.5506025845796428, "grad_norm": 300.74114990234375, "learning_rate": 8.976744186046511e-07, "logits/chosen": -0.78515625, "logits/rejected": -0.7890625, "logps/chosen": -143.0, "logps/rejected": -122.5, "loss": 10.8423, "rewards/accuracies": 0.90625, "rewards/chosen": 0.34375, "rewards/margins": 1.21875, "rewards/rejected": -0.875, "step": 237 }, { "epoch": 0.552925802236097, "grad_norm": 392.69732666015625, "learning_rate": 8.930232558139534e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.8125, "logps/chosen": -136.0, "logps/rejected": -144.0, "loss": 13.8433, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1474609375, "rewards/margins": 0.86328125, "rewards/rejected": -0.71484375, "step": 238 }, { "epoch": 0.5552490198925512, "grad_norm": 417.43267822265625, "learning_rate": 8.883720930232557e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.78125, "logps/chosen": -136.0, "logps/rejected": -137.0, "loss": 17.3145, "rewards/accuracies": 0.71875, "rewards/chosen": 0.004486083984375, "rewards/margins": 0.6796875, "rewards/rejected": -0.67578125, "step": 239 }, { "epoch": 0.5575722375490054, "grad_norm": 454.0508728027344, "learning_rate": 8.837209302325581e-07, "logits/chosen": -0.828125, "logits/rejected": -0.81640625, "logps/chosen": -118.0, "logps/rejected": -134.0, "loss": 15.6741, "rewards/accuracies": 0.71875, "rewards/chosen": 0.265625, "rewards/margins": 0.890625, "rewards/rejected": -0.62890625, "step": 240 }, { "epoch": 0.5598954552054596, "grad_norm": 406.51776123046875, "learning_rate": 8.790697674418605e-07, "logits/chosen": -0.8046875, "logits/rejected": -0.8359375, "logps/chosen": -141.0, "logps/rejected": -124.0, "loss": 15.2039, "rewards/accuracies": 0.8125, "rewards/chosen": 0.34375, "rewards/margins": 0.92578125, "rewards/rejected": -0.58203125, "step": 241 }, { "epoch": 0.5622186728619137, "grad_norm": 351.84161376953125, "learning_rate": 8.744186046511628e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.8515625, "logps/chosen": -102.5, "logps/rejected": -129.0, "loss": 14.2102, "rewards/accuracies": 0.78125, "rewards/chosen": 0.236328125, "rewards/margins": 0.83984375, "rewards/rejected": -0.6015625, "step": 242 }, { "epoch": 0.5645418905183679, "grad_norm": 320.64697265625, "learning_rate": 8.697674418604651e-07, "logits/chosen": -0.79296875, "logits/rejected": -0.86328125, "logps/chosen": -117.0, "logps/rejected": -122.5, "loss": 13.1212, "rewards/accuracies": 0.8125, "rewards/chosen": 0.27734375, "rewards/margins": 1.03125, "rewards/rejected": -0.75390625, "step": 243 }, { "epoch": 0.5668651081748222, "grad_norm": 513.0429077148438, "learning_rate": 8.651162790697674e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.80859375, "logps/chosen": -142.0, "logps/rejected": -132.0, "loss": 16.1929, "rewards/accuracies": 0.6875, "rewards/chosen": 0.296875, "rewards/margins": 0.78515625, "rewards/rejected": -0.486328125, "step": 244 }, { "epoch": 0.5691883258312763, "grad_norm": 381.1427307128906, "learning_rate": 8.604651162790697e-07, "logits/chosen": -0.8125, "logits/rejected": -0.82421875, "logps/chosen": -136.0, "logps/rejected": -143.0, "loss": 13.3257, "rewards/accuracies": 0.75, "rewards/chosen": 0.29296875, "rewards/margins": 1.09375, "rewards/rejected": -0.796875, "step": 245 }, { "epoch": 0.5715115434877305, "grad_norm": 387.599609375, "learning_rate": 8.55813953488372e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.7890625, "logps/chosen": -137.0, "logps/rejected": -129.0, "loss": 15.1045, "rewards/accuracies": 0.75, "rewards/chosen": 0.32421875, "rewards/margins": 0.796875, "rewards/rejected": -0.474609375, "step": 246 }, { "epoch": 0.5738347611441847, "grad_norm": 390.8743896484375, "learning_rate": 8.511627906976744e-07, "logits/chosen": -0.80078125, "logits/rejected": -0.87109375, "logps/chosen": -117.0, "logps/rejected": -127.0, "loss": 13.1274, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2314453125, "rewards/margins": 1.03125, "rewards/rejected": -0.80078125, "step": 247 }, { "epoch": 0.5761579788006389, "grad_norm": 420.9767150878906, "learning_rate": 8.465116279069767e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.80859375, "logps/chosen": -124.5, "logps/rejected": -155.0, "loss": 16.0874, "rewards/accuracies": 0.75, "rewards/chosen": 0.08251953125, "rewards/margins": 0.59375, "rewards/rejected": -0.51171875, "step": 248 }, { "epoch": 0.5784811964570931, "grad_norm": 335.92889404296875, "learning_rate": 8.418604651162791e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.84375, "logps/chosen": -127.0, "logps/rejected": -120.0, "loss": 13.8997, "rewards/accuracies": 0.8125, "rewards/chosen": 0.216796875, "rewards/margins": 0.83203125, "rewards/rejected": -0.61328125, "step": 249 }, { "epoch": 0.5808044141135472, "grad_norm": 404.8393249511719, "learning_rate": 8.372093023255814e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.859375, "logps/chosen": -145.0, "logps/rejected": -122.5, "loss": 12.1406, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2080078125, "rewards/margins": 1.1171875, "rewards/rejected": -0.91015625, "step": 250 }, { "epoch": 0.5831276317700015, "grad_norm": 451.52215576171875, "learning_rate": 8.325581395348836e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.8046875, "logps/chosen": -130.0, "logps/rejected": -136.0, "loss": 16.7639, "rewards/accuracies": 0.65625, "rewards/chosen": 0.07666015625, "rewards/margins": 0.76953125, "rewards/rejected": -0.6953125, "step": 251 }, { "epoch": 0.5854508494264556, "grad_norm": 417.9267272949219, "learning_rate": 8.279069767441859e-07, "logits/chosen": -0.8125, "logits/rejected": -0.83203125, "logps/chosen": -137.0, "logps/rejected": -129.0, "loss": 15.8306, "rewards/accuracies": 0.75, "rewards/chosen": 0.126953125, "rewards/margins": 0.82421875, "rewards/rejected": -0.69921875, "step": 252 }, { "epoch": 0.5877740670829098, "grad_norm": 612.1698608398438, "learning_rate": 8.232558139534883e-07, "logits/chosen": -0.79296875, "logits/rejected": -0.8984375, "logps/chosen": -151.0, "logps/rejected": -116.5, "loss": 16.5623, "rewards/accuracies": 0.6875, "rewards/chosen": 0.095703125, "rewards/margins": 0.79296875, "rewards/rejected": -0.69921875, "step": 253 }, { "epoch": 0.5900972847393641, "grad_norm": 562.412841796875, "learning_rate": 8.186046511627906e-07, "logits/chosen": -0.796875, "logits/rejected": -0.8359375, "logps/chosen": -126.0, "logps/rejected": -136.0, "loss": 13.9282, "rewards/accuracies": 0.84375, "rewards/chosen": 0.341796875, "rewards/margins": 0.87890625, "rewards/rejected": -0.5390625, "step": 254 }, { "epoch": 0.5924205023958182, "grad_norm": 406.9609069824219, "learning_rate": 8.13953488372093e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.828125, "logps/chosen": -111.5, "logps/rejected": -125.0, "loss": 17.4863, "rewards/accuracies": 0.75, "rewards/chosen": 0.3359375, "rewards/margins": 0.68359375, "rewards/rejected": -0.349609375, "step": 255 }, { "epoch": 0.5947437200522724, "grad_norm": 319.95379638671875, "learning_rate": 8.093023255813954e-07, "logits/chosen": -0.81640625, "logits/rejected": -0.8515625, "logps/chosen": -127.5, "logps/rejected": -135.0, "loss": 12.2905, "rewards/accuracies": 0.875, "rewards/chosen": 0.3125, "rewards/margins": 1.1171875, "rewards/rejected": -0.8046875, "step": 256 }, { "epoch": 0.5970669377087265, "grad_norm": 390.3863830566406, "learning_rate": 8.046511627906977e-07, "logits/chosen": -0.8046875, "logits/rejected": -0.79296875, "logps/chosen": -140.0, "logps/rejected": -157.0, "loss": 12.9624, "rewards/accuracies": 0.8125, "rewards/chosen": 0.361328125, "rewards/margins": 1.078125, "rewards/rejected": -0.71484375, "step": 257 }, { "epoch": 0.5993901553651808, "grad_norm": 345.5944519042969, "learning_rate": 8e-07, "logits/chosen": -0.84375, "logits/rejected": -0.8515625, "logps/chosen": -123.5, "logps/rejected": -128.0, "loss": 12.6313, "rewards/accuracies": 0.8125, "rewards/chosen": 0.486328125, "rewards/margins": 1.046875, "rewards/rejected": -0.55859375, "step": 258 }, { "epoch": 0.601713373021635, "grad_norm": 388.45977783203125, "learning_rate": 7.953488372093022e-07, "logits/chosen": -0.80078125, "logits/rejected": -0.8046875, "logps/chosen": -128.0, "logps/rejected": -127.5, "loss": 18.2397, "rewards/accuracies": 0.65625, "rewards/chosen": 0.064453125, "rewards/margins": 0.671875, "rewards/rejected": -0.609375, "step": 259 }, { "epoch": 0.6040365906780891, "grad_norm": 361.9543151855469, "learning_rate": 7.906976744186046e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.87109375, "logps/chosen": -131.0, "logps/rejected": -127.5, "loss": 14.9993, "rewards/accuracies": 0.78125, "rewards/chosen": 0.33984375, "rewards/margins": 0.8984375, "rewards/rejected": -0.55859375, "step": 260 }, { "epoch": 0.6063598083345434, "grad_norm": 364.9945068359375, "learning_rate": 7.860465116279069e-07, "logits/chosen": -0.84375, "logits/rejected": -0.82421875, "logps/chosen": -136.0, "logps/rejected": -115.0, "loss": 14.9531, "rewards/accuracies": 0.75, "rewards/chosen": 0.1318359375, "rewards/margins": 0.94140625, "rewards/rejected": -0.80859375, "step": 261 }, { "epoch": 0.6086830259909976, "grad_norm": 347.11456298828125, "learning_rate": 7.813953488372093e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.8515625, "logps/chosen": -136.0, "logps/rejected": -148.0, "loss": 13.252, "rewards/accuracies": 0.71875, "rewards/chosen": 0.201171875, "rewards/margins": 1.0, "rewards/rejected": -0.796875, "step": 262 }, { "epoch": 0.6110062436474517, "grad_norm": 344.5708923339844, "learning_rate": 7.767441860465116e-07, "logits/chosen": -0.78515625, "logits/rejected": -0.80859375, "logps/chosen": -144.0, "logps/rejected": -136.0, "loss": 12.5537, "rewards/accuracies": 0.84375, "rewards/chosen": 0.40234375, "rewards/margins": 1.1171875, "rewards/rejected": -0.71484375, "step": 263 }, { "epoch": 0.6133294613039059, "grad_norm": 509.060546875, "learning_rate": 7.720930232558139e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.8515625, "logps/chosen": -124.5, "logps/rejected": -128.0, "loss": 19.3247, "rewards/accuracies": 0.65625, "rewards/chosen": -0.06396484375, "rewards/margins": 0.486328125, "rewards/rejected": -0.55078125, "step": 264 }, { "epoch": 0.6156526789603601, "grad_norm": 385.6347961425781, "learning_rate": 7.674418604651162e-07, "logits/chosen": -0.74609375, "logits/rejected": -0.81640625, "logps/chosen": -140.0, "logps/rejected": -129.0, "loss": 12.175, "rewards/accuracies": 0.8125, "rewards/chosen": 0.423828125, "rewards/margins": 1.1015625, "rewards/rejected": -0.67578125, "step": 265 }, { "epoch": 0.6179758966168143, "grad_norm": 498.9085693359375, "learning_rate": 7.627906976744186e-07, "logits/chosen": -0.7421875, "logits/rejected": -0.8125, "logps/chosen": -152.0, "logps/rejected": -114.5, "loss": 18.3779, "rewards/accuracies": 0.65625, "rewards/chosen": 0.36328125, "rewards/margins": 0.63671875, "rewards/rejected": -0.2734375, "step": 266 }, { "epoch": 0.6202991142732684, "grad_norm": 372.6788024902344, "learning_rate": 7.581395348837208e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.85546875, "logps/chosen": -156.0, "logps/rejected": -146.0, "loss": 13.3494, "rewards/accuracies": 0.78125, "rewards/chosen": 0.33984375, "rewards/margins": 0.93359375, "rewards/rejected": -0.59375, "step": 267 }, { "epoch": 0.6226223319297227, "grad_norm": 336.4404296875, "learning_rate": 7.534883720930232e-07, "logits/chosen": -0.84375, "logits/rejected": -0.84765625, "logps/chosen": -135.0, "logps/rejected": -130.0, "loss": 14.1318, "rewards/accuracies": 0.875, "rewards/chosen": 0.28125, "rewards/margins": 0.765625, "rewards/rejected": -0.482421875, "step": 268 }, { "epoch": 0.6249455495861769, "grad_norm": 320.9569091796875, "learning_rate": 7.488372093023256e-07, "logits/chosen": -0.81640625, "logits/rejected": -0.8359375, "logps/chosen": -117.0, "logps/rejected": -120.5, "loss": 13.8899, "rewards/accuracies": 0.75, "rewards/chosen": 0.349609375, "rewards/margins": 1.015625, "rewards/rejected": -0.66796875, "step": 269 }, { "epoch": 0.627268767242631, "grad_norm": 370.9262390136719, "learning_rate": 7.441860465116279e-07, "logits/chosen": -0.7734375, "logits/rejected": -0.84375, "logps/chosen": -144.0, "logps/rejected": -120.0, "loss": 15.52, "rewards/accuracies": 0.71875, "rewards/chosen": 0.345703125, "rewards/margins": 1.0390625, "rewards/rejected": -0.6953125, "step": 270 }, { "epoch": 0.6295919848990852, "grad_norm": 367.8063049316406, "learning_rate": 7.395348837209302e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.83203125, "logps/chosen": -137.0, "logps/rejected": -130.0, "loss": 12.3782, "rewards/accuracies": 0.8125, "rewards/chosen": 0.310546875, "rewards/margins": 1.1328125, "rewards/rejected": -0.82421875, "step": 271 }, { "epoch": 0.6319152025555395, "grad_norm": 301.8444519042969, "learning_rate": 7.348837209302325e-07, "logits/chosen": -0.796875, "logits/rejected": -0.84375, "logps/chosen": -142.0, "logps/rejected": -125.5, "loss": 11.4189, "rewards/accuracies": 0.90625, "rewards/chosen": 0.53515625, "rewards/margins": 1.171875, "rewards/rejected": -0.63671875, "step": 272 }, { "epoch": 0.6342384202119936, "grad_norm": 344.16143798828125, "learning_rate": 7.302325581395349e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.8671875, "logps/chosen": -129.0, "logps/rejected": -117.5, "loss": 13.3252, "rewards/accuracies": 0.78125, "rewards/chosen": 0.421875, "rewards/margins": 1.0703125, "rewards/rejected": -0.65234375, "step": 273 }, { "epoch": 0.6365616378684478, "grad_norm": 368.489013671875, "learning_rate": 7.255813953488372e-07, "logits/chosen": -0.79296875, "logits/rejected": -0.81640625, "logps/chosen": -127.5, "logps/rejected": -141.0, "loss": 12.7842, "rewards/accuracies": 0.875, "rewards/chosen": 0.34375, "rewards/margins": 0.96484375, "rewards/rejected": -0.62109375, "step": 274 }, { "epoch": 0.638884855524902, "grad_norm": 365.506103515625, "learning_rate": 7.209302325581395e-07, "logits/chosen": -0.765625, "logits/rejected": -0.8203125, "logps/chosen": -122.0, "logps/rejected": -139.0, "loss": 13.6389, "rewards/accuracies": 0.75, "rewards/chosen": 0.412109375, "rewards/margins": 1.1953125, "rewards/rejected": -0.7890625, "step": 275 }, { "epoch": 0.6412080731813562, "grad_norm": 352.22149658203125, "learning_rate": 7.162790697674418e-07, "logits/chosen": -0.83984375, "logits/rejected": -0.82421875, "logps/chosen": -133.0, "logps/rejected": -126.5, "loss": 15.0649, "rewards/accuracies": 0.6875, "rewards/chosen": 0.1982421875, "rewards/margins": 0.8203125, "rewards/rejected": -0.62109375, "step": 276 }, { "epoch": 0.6435312908378104, "grad_norm": 391.1148376464844, "learning_rate": 7.116279069767441e-07, "logits/chosen": -0.8046875, "logits/rejected": -0.89453125, "logps/chosen": -140.0, "logps/rejected": -119.0, "loss": 14.7524, "rewards/accuracies": 0.78125, "rewards/chosen": 0.310546875, "rewards/margins": 0.8671875, "rewards/rejected": -0.5546875, "step": 277 }, { "epoch": 0.6458545084942645, "grad_norm": 473.5135192871094, "learning_rate": 7.069767441860464e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.85546875, "logps/chosen": -145.0, "logps/rejected": -124.0, "loss": 17.1322, "rewards/accuracies": 0.625, "rewards/chosen": 0.279296875, "rewards/margins": 0.6875, "rewards/rejected": -0.41015625, "step": 278 }, { "epoch": 0.6481777261507188, "grad_norm": 492.3699035644531, "learning_rate": 7.023255813953488e-07, "logits/chosen": -0.796875, "logits/rejected": -0.8203125, "logps/chosen": -135.0, "logps/rejected": -127.5, "loss": 17.5245, "rewards/accuracies": 0.6875, "rewards/chosen": 0.1533203125, "rewards/margins": 0.84375, "rewards/rejected": -0.69140625, "step": 279 }, { "epoch": 0.6505009438071729, "grad_norm": 311.95196533203125, "learning_rate": 6.976744186046511e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.84765625, "logps/chosen": -118.5, "logps/rejected": -134.0, "loss": 10.3682, "rewards/accuracies": 0.875, "rewards/chosen": 0.408203125, "rewards/margins": 1.4921875, "rewards/rejected": -1.0859375, "step": 280 }, { "epoch": 0.6528241614636271, "grad_norm": 401.4697265625, "learning_rate": 6.930232558139535e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.828125, "logps/chosen": -123.0, "logps/rejected": -127.5, "loss": 15.7085, "rewards/accuracies": 0.8125, "rewards/chosen": 0.162109375, "rewards/margins": 0.6796875, "rewards/rejected": -0.515625, "step": 281 }, { "epoch": 0.6551473791200814, "grad_norm": 343.4604797363281, "learning_rate": 6.883720930232559e-07, "logits/chosen": -0.77734375, "logits/rejected": -0.82421875, "logps/chosen": -133.0, "logps/rejected": -128.0, "loss": 12.6093, "rewards/accuracies": 0.78125, "rewards/chosen": 0.43359375, "rewards/margins": 1.1328125, "rewards/rejected": -0.703125, "step": 282 }, { "epoch": 0.6574705967765355, "grad_norm": 415.1707763671875, "learning_rate": 6.837209302325581e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.921875, "logps/chosen": -143.0, "logps/rejected": -118.5, "loss": 15.4015, "rewards/accuracies": 0.75, "rewards/chosen": 0.2119140625, "rewards/margins": 0.8203125, "rewards/rejected": -0.60546875, "step": 283 }, { "epoch": 0.6597938144329897, "grad_norm": 355.2691955566406, "learning_rate": 6.790697674418604e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.8515625, "logps/chosen": -121.0, "logps/rejected": -129.0, "loss": 13.1781, "rewards/accuracies": 0.75, "rewards/chosen": 0.2001953125, "rewards/margins": 1.125, "rewards/rejected": -0.92578125, "step": 284 }, { "epoch": 0.6621170320894438, "grad_norm": 384.2412109375, "learning_rate": 6.744186046511627e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.9140625, "logps/chosen": -115.5, "logps/rejected": -141.0, "loss": 13.6726, "rewards/accuracies": 0.75, "rewards/chosen": 0.466796875, "rewards/margins": 1.2421875, "rewards/rejected": -0.77734375, "step": 285 }, { "epoch": 0.6644402497458981, "grad_norm": 376.3741760253906, "learning_rate": 6.697674418604651e-07, "logits/chosen": -0.8125, "logits/rejected": -0.83203125, "logps/chosen": -120.0, "logps/rejected": -140.0, "loss": 11.1071, "rewards/accuracies": 0.875, "rewards/chosen": 0.369140625, "rewards/margins": 1.265625, "rewards/rejected": -0.89453125, "step": 286 }, { "epoch": 0.6667634674023523, "grad_norm": 347.0726318359375, "learning_rate": 6.651162790697674e-07, "logits/chosen": -0.78125, "logits/rejected": -0.84375, "logps/chosen": -134.0, "logps/rejected": -124.0, "loss": 11.7656, "rewards/accuracies": 0.78125, "rewards/chosen": 0.369140625, "rewards/margins": 1.2578125, "rewards/rejected": -0.88671875, "step": 287 }, { "epoch": 0.6690866850588064, "grad_norm": 383.8744812011719, "learning_rate": 6.604651162790698e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.84765625, "logps/chosen": -120.0, "logps/rejected": -129.0, "loss": 12.8174, "rewards/accuracies": 0.875, "rewards/chosen": 0.193359375, "rewards/margins": 0.96875, "rewards/rejected": -0.77734375, "step": 288 }, { "epoch": 0.6714099027152607, "grad_norm": 527.3011474609375, "learning_rate": 6.558139534883721e-07, "logits/chosen": -0.8125, "logits/rejected": -0.78515625, "logps/chosen": -133.0, "logps/rejected": -143.0, "loss": 16.5997, "rewards/accuracies": 0.6875, "rewards/chosen": 0.10107421875, "rewards/margins": 1.015625, "rewards/rejected": -0.9140625, "step": 289 }, { "epoch": 0.6737331203717148, "grad_norm": 494.76416015625, "learning_rate": 6.511627906976745e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.83203125, "logps/chosen": -139.0, "logps/rejected": -143.0, "loss": 17.8811, "rewards/accuracies": 0.65625, "rewards/chosen": 0.154296875, "rewards/margins": 0.66796875, "rewards/rejected": -0.51171875, "step": 290 }, { "epoch": 0.676056338028169, "grad_norm": 327.0135192871094, "learning_rate": 6.465116279069766e-07, "logits/chosen": -0.8046875, "logits/rejected": -0.8515625, "logps/chosen": -118.5, "logps/rejected": -131.0, "loss": 12.48, "rewards/accuracies": 0.8125, "rewards/chosen": 0.61328125, "rewards/margins": 1.125, "rewards/rejected": -0.5078125, "step": 291 }, { "epoch": 0.6783795556846232, "grad_norm": 452.2313537597656, "learning_rate": 6.41860465116279e-07, "logits/chosen": -0.84375, "logits/rejected": -0.8671875, "logps/chosen": -131.0, "logps/rejected": -138.0, "loss": 15.7837, "rewards/accuracies": 0.78125, "rewards/chosen": 0.275390625, "rewards/margins": 0.7890625, "rewards/rejected": -0.515625, "step": 292 }, { "epoch": 0.6807027733410774, "grad_norm": 388.10711669921875, "learning_rate": 6.372093023255813e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.8359375, "logps/chosen": -134.0, "logps/rejected": -134.0, "loss": 14.0817, "rewards/accuracies": 0.71875, "rewards/chosen": 0.279296875, "rewards/margins": 1.0234375, "rewards/rejected": -0.74609375, "step": 293 }, { "epoch": 0.6830259909975316, "grad_norm": 385.43841552734375, "learning_rate": 6.325581395348837e-07, "logits/chosen": -0.8046875, "logits/rejected": -0.80078125, "logps/chosen": -138.0, "logps/rejected": -131.0, "loss": 13.6246, "rewards/accuracies": 0.75, "rewards/chosen": 0.373046875, "rewards/margins": 1.0859375, "rewards/rejected": -0.71484375, "step": 294 }, { "epoch": 0.6853492086539857, "grad_norm": 378.17828369140625, "learning_rate": 6.27906976744186e-07, "logits/chosen": -0.8125, "logits/rejected": -0.78515625, "logps/chosen": -139.0, "logps/rejected": -119.0, "loss": 14.5515, "rewards/accuracies": 0.78125, "rewards/chosen": 0.337890625, "rewards/margins": 0.9609375, "rewards/rejected": -0.62109375, "step": 295 }, { "epoch": 0.68767242631044, "grad_norm": 425.79541015625, "learning_rate": 6.232558139534884e-07, "logits/chosen": -0.8125, "logits/rejected": -0.8359375, "logps/chosen": -112.5, "logps/rejected": -127.5, "loss": 15.4453, "rewards/accuracies": 0.625, "rewards/chosen": 0.216796875, "rewards/margins": 0.85546875, "rewards/rejected": -0.63671875, "step": 296 }, { "epoch": 0.6899956439668942, "grad_norm": 355.3722229003906, "learning_rate": 6.186046511627907e-07, "logits/chosen": -0.91015625, "logits/rejected": -0.890625, "logps/chosen": -125.0, "logps/rejected": -112.5, "loss": 14.6904, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0966796875, "rewards/margins": 0.89453125, "rewards/rejected": -0.796875, "step": 297 }, { "epoch": 0.6923188616233483, "grad_norm": 446.3829345703125, "learning_rate": 6.13953488372093e-07, "logits/chosen": -0.81640625, "logits/rejected": -0.828125, "logps/chosen": -132.0, "logps/rejected": -121.0, "loss": 14.7679, "rewards/accuracies": 0.75, "rewards/chosen": 0.3671875, "rewards/margins": 1.046875, "rewards/rejected": -0.6796875, "step": 298 }, { "epoch": 0.6946420792798025, "grad_norm": 335.9494934082031, "learning_rate": 6.093023255813953e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.81640625, "logps/chosen": -116.5, "logps/rejected": -138.0, "loss": 13.0884, "rewards/accuracies": 0.8125, "rewards/chosen": 0.373046875, "rewards/margins": 1.140625, "rewards/rejected": -0.765625, "step": 299 }, { "epoch": 0.6969652969362568, "grad_norm": 363.8542785644531, "learning_rate": 6.046511627906976e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.828125, "logps/chosen": -136.0, "logps/rejected": -136.0, "loss": 13.2286, "rewards/accuracies": 0.71875, "rewards/chosen": 0.474609375, "rewards/margins": 1.109375, "rewards/rejected": -0.63671875, "step": 300 }, { "epoch": 0.6992885145927109, "grad_norm": 400.0084228515625, "learning_rate": 6e-07, "logits/chosen": -0.90234375, "logits/rejected": -0.859375, "logps/chosen": -117.5, "logps/rejected": -132.0, "loss": 15.1213, "rewards/accuracies": 0.71875, "rewards/chosen": 0.46484375, "rewards/margins": 0.9375, "rewards/rejected": -0.47265625, "step": 301 }, { "epoch": 0.7016117322491651, "grad_norm": 314.22222900390625, "learning_rate": 5.953488372093023e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.86328125, "logps/chosen": -126.0, "logps/rejected": -128.0, "loss": 10.8384, "rewards/accuracies": 0.9375, "rewards/chosen": 0.396484375, "rewards/margins": 1.359375, "rewards/rejected": -0.96484375, "step": 302 }, { "epoch": 0.7039349499056193, "grad_norm": 351.50970458984375, "learning_rate": 5.906976744186046e-07, "logits/chosen": -0.7734375, "logits/rejected": -0.81640625, "logps/chosen": -141.0, "logps/rejected": -124.0, "loss": 9.9349, "rewards/accuracies": 0.84375, "rewards/chosen": 0.671875, "rewards/margins": 1.640625, "rewards/rejected": -0.96875, "step": 303 }, { "epoch": 0.7062581675620735, "grad_norm": 476.5926513671875, "learning_rate": 5.860465116279069e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.80078125, "logps/chosen": -137.0, "logps/rejected": -168.0, "loss": 16.6069, "rewards/accuracies": 0.6875, "rewards/chosen": 0.1357421875, "rewards/margins": 0.91015625, "rewards/rejected": -0.7734375, "step": 304 }, { "epoch": 0.7085813852185276, "grad_norm": 353.9723815917969, "learning_rate": 5.813953488372093e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.84375, "logps/chosen": -136.0, "logps/rejected": -144.0, "loss": 11.542, "rewards/accuracies": 0.84375, "rewards/chosen": 0.5703125, "rewards/margins": 1.25, "rewards/rejected": -0.6796875, "step": 305 }, { "epoch": 0.7109046028749818, "grad_norm": 428.2142639160156, "learning_rate": 5.767441860465116e-07, "logits/chosen": -0.83984375, "logits/rejected": -0.82421875, "logps/chosen": -135.0, "logps/rejected": -138.0, "loss": 15.2681, "rewards/accuracies": 0.6875, "rewards/chosen": 0.26171875, "rewards/margins": 1.0390625, "rewards/rejected": -0.77734375, "step": 306 }, { "epoch": 0.7132278205314361, "grad_norm": 391.52825927734375, "learning_rate": 5.720930232558139e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.84375, "logps/chosen": -147.0, "logps/rejected": -122.5, "loss": 15.5105, "rewards/accuracies": 0.6875, "rewards/chosen": 0.42578125, "rewards/margins": 0.8984375, "rewards/rejected": -0.47265625, "step": 307 }, { "epoch": 0.7155510381878902, "grad_norm": 314.70806884765625, "learning_rate": 5.674418604651162e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.84765625, "logps/chosen": -125.0, "logps/rejected": -149.0, "loss": 12.5325, "rewards/accuracies": 0.75, "rewards/chosen": 0.3046875, "rewards/margins": 1.1953125, "rewards/rejected": -0.88671875, "step": 308 }, { "epoch": 0.7178742558443444, "grad_norm": 393.9562072753906, "learning_rate": 5.627906976744186e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.87890625, "logps/chosen": -131.0, "logps/rejected": -130.0, "loss": 13.47, "rewards/accuracies": 0.75, "rewards/chosen": 0.314453125, "rewards/margins": 1.0546875, "rewards/rejected": -0.7421875, "step": 309 }, { "epoch": 0.7201974735007987, "grad_norm": 400.5484313964844, "learning_rate": 5.581395348837209e-07, "logits/chosen": -0.81640625, "logits/rejected": -0.84765625, "logps/chosen": -113.0, "logps/rejected": -127.5, "loss": 13.4608, "rewards/accuracies": 0.8125, "rewards/chosen": 0.55078125, "rewards/margins": 1.1171875, "rewards/rejected": -0.5703125, "step": 310 }, { "epoch": 0.7225206911572528, "grad_norm": 422.0895080566406, "learning_rate": 5.534883720930232e-07, "logits/chosen": -0.91015625, "logits/rejected": -0.8671875, "logps/chosen": -132.0, "logps/rejected": -147.0, "loss": 13.0371, "rewards/accuracies": 0.84375, "rewards/chosen": 0.27734375, "rewards/margins": 1.0859375, "rewards/rejected": -0.8125, "step": 311 }, { "epoch": 0.724843908813707, "grad_norm": 412.68701171875, "learning_rate": 5.488372093023256e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.86328125, "logps/chosen": -134.0, "logps/rejected": -133.0, "loss": 14.7341, "rewards/accuracies": 0.78125, "rewards/chosen": 0.32421875, "rewards/margins": 0.8203125, "rewards/rejected": -0.49609375, "step": 312 }, { "epoch": 0.7271671264701611, "grad_norm": 419.086181640625, "learning_rate": 5.441860465116279e-07, "logits/chosen": -0.79296875, "logits/rejected": -0.796875, "logps/chosen": -127.0, "logps/rejected": -135.0, "loss": 16.5369, "rewards/accuracies": 0.75, "rewards/chosen": 0.306640625, "rewards/margins": 0.90625, "rewards/rejected": -0.6015625, "step": 313 }, { "epoch": 0.7294903441266154, "grad_norm": 337.012939453125, "learning_rate": 5.395348837209303e-07, "logits/chosen": -0.89453125, "logits/rejected": -0.8828125, "logps/chosen": -152.0, "logps/rejected": -117.0, "loss": 12.7517, "rewards/accuracies": 0.78125, "rewards/chosen": 0.59765625, "rewards/margins": 1.15625, "rewards/rejected": -0.55859375, "step": 314 }, { "epoch": 0.7318135617830696, "grad_norm": 365.5719909667969, "learning_rate": 5.348837209302325e-07, "logits/chosen": -0.79296875, "logits/rejected": -0.8203125, "logps/chosen": -154.0, "logps/rejected": -137.0, "loss": 11.0121, "rewards/accuracies": 0.90625, "rewards/chosen": 0.54296875, "rewards/margins": 1.5546875, "rewards/rejected": -1.015625, "step": 315 }, { "epoch": 0.7341367794395237, "grad_norm": 565.3271484375, "learning_rate": 5.302325581395348e-07, "logits/chosen": -0.8125, "logits/rejected": -0.82421875, "logps/chosen": -121.0, "logps/rejected": -139.0, "loss": 14.5569, "rewards/accuracies": 0.71875, "rewards/chosen": 0.4609375, "rewards/margins": 0.95703125, "rewards/rejected": -0.4921875, "step": 316 }, { "epoch": 0.736459997095978, "grad_norm": 336.31488037109375, "learning_rate": 5.255813953488371e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.83203125, "logps/chosen": -127.5, "logps/rejected": -126.5, "loss": 14.0077, "rewards/accuracies": 0.75, "rewards/chosen": 0.228515625, "rewards/margins": 1.1953125, "rewards/rejected": -0.96484375, "step": 317 }, { "epoch": 0.7387832147524321, "grad_norm": 331.0687561035156, "learning_rate": 5.209302325581395e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.85546875, "logps/chosen": -136.0, "logps/rejected": -130.0, "loss": 10.2217, "rewards/accuracies": 0.84375, "rewards/chosen": 0.5546875, "rewards/margins": 1.6015625, "rewards/rejected": -1.046875, "step": 318 }, { "epoch": 0.7411064324088863, "grad_norm": 337.7515869140625, "learning_rate": 5.162790697674418e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.85546875, "logps/chosen": -134.0, "logps/rejected": -141.0, "loss": 10.2466, "rewards/accuracies": 0.84375, "rewards/chosen": 0.6171875, "rewards/margins": 1.3828125, "rewards/rejected": -0.76953125, "step": 319 }, { "epoch": 0.7434296500653405, "grad_norm": 439.6629333496094, "learning_rate": 5.116279069767442e-07, "logits/chosen": -0.90625, "logits/rejected": -0.90625, "logps/chosen": -111.0, "logps/rejected": -143.0, "loss": 14.8419, "rewards/accuracies": 0.78125, "rewards/chosen": 0.275390625, "rewards/margins": 0.96875, "rewards/rejected": -0.6953125, "step": 320 }, { "epoch": 0.7457528677217947, "grad_norm": 315.7960510253906, "learning_rate": 5.069767441860466e-07, "logits/chosen": -0.78125, "logits/rejected": -0.80859375, "logps/chosen": -123.0, "logps/rejected": -134.0, "loss": 10.7461, "rewards/accuracies": 0.875, "rewards/chosen": 0.703125, "rewards/margins": 1.390625, "rewards/rejected": -0.68359375, "step": 321 }, { "epoch": 0.7480760853782489, "grad_norm": 443.8883361816406, "learning_rate": 5.023255813953489e-07, "logits/chosen": -0.84375, "logits/rejected": -0.8828125, "logps/chosen": -139.0, "logps/rejected": -133.0, "loss": 13.2231, "rewards/accuracies": 0.78125, "rewards/chosen": 0.306640625, "rewards/margins": 1.1328125, "rewards/rejected": -0.82421875, "step": 322 }, { "epoch": 0.750399303034703, "grad_norm": 381.8203430175781, "learning_rate": 4.976744186046512e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.84375, "logps/chosen": -136.0, "logps/rejected": -131.0, "loss": 14.0621, "rewards/accuracies": 0.75, "rewards/chosen": 0.412109375, "rewards/margins": 1.1640625, "rewards/rejected": -0.7578125, "step": 323 }, { "epoch": 0.7527225206911573, "grad_norm": 361.1136779785156, "learning_rate": 4.930232558139535e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.84765625, "logps/chosen": -132.0, "logps/rejected": -132.0, "loss": 13.6553, "rewards/accuracies": 0.78125, "rewards/chosen": 0.3203125, "rewards/margins": 1.2109375, "rewards/rejected": -0.88671875, "step": 324 }, { "epoch": 0.7550457383476115, "grad_norm": 307.30291748046875, "learning_rate": 4.883720930232558e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.8515625, "logps/chosen": -122.5, "logps/rejected": -140.0, "loss": 8.7594, "rewards/accuracies": 0.9375, "rewards/chosen": 0.55859375, "rewards/margins": 1.609375, "rewards/rejected": -1.046875, "step": 325 }, { "epoch": 0.7573689560040656, "grad_norm": 372.7316589355469, "learning_rate": 4.837209302325581e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.80859375, "logps/chosen": -133.0, "logps/rejected": -120.0, "loss": 12.6277, "rewards/accuracies": 0.84375, "rewards/chosen": 0.33984375, "rewards/margins": 1.1875, "rewards/rejected": -0.84375, "step": 326 }, { "epoch": 0.7596921736605198, "grad_norm": 349.4411926269531, "learning_rate": 4.790697674418605e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.8359375, "logps/chosen": -140.0, "logps/rejected": -130.0, "loss": 12.8553, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1787109375, "rewards/margins": 1.109375, "rewards/rejected": -0.92578125, "step": 327 }, { "epoch": 0.762015391316974, "grad_norm": 353.19378662109375, "learning_rate": 4.7441860465116277e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.859375, "logps/chosen": -133.0, "logps/rejected": -148.0, "loss": 12.5149, "rewards/accuracies": 0.8125, "rewards/chosen": 0.328125, "rewards/margins": 1.09375, "rewards/rejected": -0.76171875, "step": 328 }, { "epoch": 0.7643386089734282, "grad_norm": 523.6749267578125, "learning_rate": 4.697674418604651e-07, "logits/chosen": -0.88671875, "logits/rejected": -0.9140625, "logps/chosen": -133.0, "logps/rejected": -125.0, "loss": 16.2698, "rewards/accuracies": 0.6875, "rewards/chosen": 0.10595703125, "rewards/margins": 0.80859375, "rewards/rejected": -0.703125, "step": 329 }, { "epoch": 0.7666618266298824, "grad_norm": 528.6472778320312, "learning_rate": 4.6511627906976743e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.85546875, "logps/chosen": -134.0, "logps/rejected": -150.0, "loss": 14.6694, "rewards/accuracies": 0.71875, "rewards/chosen": 0.09033203125, "rewards/margins": 0.86328125, "rewards/rejected": -0.7734375, "step": 330 }, { "epoch": 0.7689850442863366, "grad_norm": 313.93438720703125, "learning_rate": 4.6046511627906973e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.8671875, "logps/chosen": -123.0, "logps/rejected": -122.0, "loss": 11.8145, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0341796875, "rewards/margins": 1.171875, "rewards/rejected": -1.140625, "step": 331 }, { "epoch": 0.7713082619427908, "grad_norm": 389.487548828125, "learning_rate": 4.558139534883721e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.85546875, "logps/chosen": -150.0, "logps/rejected": -122.5, "loss": 15.3645, "rewards/accuracies": 0.78125, "rewards/chosen": 0.36328125, "rewards/margins": 0.8359375, "rewards/rejected": -0.47265625, "step": 332 }, { "epoch": 0.7736314795992449, "grad_norm": 380.62176513671875, "learning_rate": 4.511627906976744e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.890625, "logps/chosen": -124.5, "logps/rejected": -129.0, "loss": 14.4519, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3125, "rewards/margins": 0.98828125, "rewards/rejected": -0.67578125, "step": 333 }, { "epoch": 0.7759546972556991, "grad_norm": 415.103271484375, "learning_rate": 4.465116279069767e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.85546875, "logps/chosen": -141.0, "logps/rejected": -150.0, "loss": 16.2168, "rewards/accuracies": 0.71875, "rewards/chosen": 0.310546875, "rewards/margins": 0.6953125, "rewards/rejected": -0.38671875, "step": 334 }, { "epoch": 0.7782779149121534, "grad_norm": 305.7278747558594, "learning_rate": 4.4186046511627905e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.84765625, "logps/chosen": -117.5, "logps/rejected": -136.0, "loss": 11.343, "rewards/accuracies": 0.90625, "rewards/chosen": 0.490234375, "rewards/margins": 1.1640625, "rewards/rejected": -0.671875, "step": 335 }, { "epoch": 0.7806011325686075, "grad_norm": 395.62188720703125, "learning_rate": 4.372093023255814e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.8359375, "logps/chosen": -132.0, "logps/rejected": -133.0, "loss": 13.4861, "rewards/accuracies": 0.84375, "rewards/chosen": 0.32421875, "rewards/margins": 1.0, "rewards/rejected": -0.67578125, "step": 336 }, { "epoch": 0.7829243502250617, "grad_norm": 344.2076721191406, "learning_rate": 4.325581395348837e-07, "logits/chosen": -0.765625, "logits/rejected": -0.83203125, "logps/chosen": -119.0, "logps/rejected": -123.0, "loss": 10.615, "rewards/accuracies": 0.84375, "rewards/chosen": 0.5703125, "rewards/margins": 1.4140625, "rewards/rejected": -0.84375, "step": 337 }, { "epoch": 0.785247567881516, "grad_norm": 415.8197937011719, "learning_rate": 4.27906976744186e-07, "logits/chosen": -0.81640625, "logits/rejected": -0.82421875, "logps/chosen": -124.5, "logps/rejected": -130.0, "loss": 13.9437, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2353515625, "rewards/margins": 1.1640625, "rewards/rejected": -0.92578125, "step": 338 }, { "epoch": 0.7875707855379701, "grad_norm": 395.5925598144531, "learning_rate": 4.2325581395348836e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.890625, "logps/chosen": -126.0, "logps/rejected": -125.0, "loss": 17.0851, "rewards/accuracies": 0.625, "rewards/chosen": 0.17578125, "rewards/margins": 0.609375, "rewards/rejected": -0.431640625, "step": 339 }, { "epoch": 0.7898940031944243, "grad_norm": 383.22491455078125, "learning_rate": 4.186046511627907e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.91015625, "logps/chosen": -120.0, "logps/rejected": -122.0, "loss": 14.2013, "rewards/accuracies": 0.84375, "rewards/chosen": 0.287109375, "rewards/margins": 0.9296875, "rewards/rejected": -0.64453125, "step": 340 }, { "epoch": 0.7922172208508784, "grad_norm": 465.37054443359375, "learning_rate": 4.1395348837209297e-07, "logits/chosen": -0.84375, "logits/rejected": -0.84765625, "logps/chosen": -122.0, "logps/rejected": -148.0, "loss": 14.8139, "rewards/accuracies": 0.6875, "rewards/chosen": 0.59375, "rewards/margins": 1.0859375, "rewards/rejected": -0.49609375, "step": 341 }, { "epoch": 0.7945404385073327, "grad_norm": 355.3705139160156, "learning_rate": 4.093023255813953e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.8359375, "logps/chosen": -138.0, "logps/rejected": -144.0, "loss": 12.0349, "rewards/accuracies": 0.8125, "rewards/chosen": 0.416015625, "rewards/margins": 1.28125, "rewards/rejected": -0.86328125, "step": 342 }, { "epoch": 0.7968636561637868, "grad_norm": 389.9146728515625, "learning_rate": 4.046511627906977e-07, "logits/chosen": -0.88671875, "logits/rejected": -0.8515625, "logps/chosen": -123.0, "logps/rejected": -119.5, "loss": 15.8198, "rewards/accuracies": 0.75, "rewards/chosen": 0.32421875, "rewards/margins": 0.921875, "rewards/rejected": -0.59375, "step": 343 }, { "epoch": 0.799186873820241, "grad_norm": 367.7712707519531, "learning_rate": 4e-07, "logits/chosen": -0.828125, "logits/rejected": -0.83984375, "logps/chosen": -143.0, "logps/rejected": -134.0, "loss": 12.8025, "rewards/accuracies": 0.8125, "rewards/chosen": 0.396484375, "rewards/margins": 1.15625, "rewards/rejected": -0.76171875, "step": 344 }, { "epoch": 0.8015100914766953, "grad_norm": 416.6552734375, "learning_rate": 3.953488372093023e-07, "logits/chosen": -0.8125, "logits/rejected": -0.86328125, "logps/chosen": -152.0, "logps/rejected": -128.0, "loss": 13.7512, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3671875, "rewards/margins": 1.046875, "rewards/rejected": -0.6796875, "step": 345 }, { "epoch": 0.8038333091331494, "grad_norm": 402.32452392578125, "learning_rate": 3.9069767441860464e-07, "logits/chosen": -0.84375, "logits/rejected": -0.8984375, "logps/chosen": -133.0, "logps/rejected": -126.0, "loss": 14.7258, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2138671875, "rewards/margins": 1.2265625, "rewards/rejected": -1.015625, "step": 346 }, { "epoch": 0.8061565267896036, "grad_norm": 414.1297607421875, "learning_rate": 3.8604651162790694e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.85546875, "logps/chosen": -129.0, "logps/rejected": -134.0, "loss": 12.463, "rewards/accuracies": 0.78125, "rewards/chosen": 0.54296875, "rewards/margins": 1.203125, "rewards/rejected": -0.65625, "step": 347 }, { "epoch": 0.8084797444460577, "grad_norm": 489.4559631347656, "learning_rate": 3.813953488372093e-07, "logits/chosen": -0.78515625, "logits/rejected": -0.75390625, "logps/chosen": -114.0, "logps/rejected": -150.0, "loss": 14.2197, "rewards/accuracies": 0.78125, "rewards/chosen": 0.24609375, "rewards/margins": 1.1328125, "rewards/rejected": -0.8828125, "step": 348 }, { "epoch": 0.810802962102512, "grad_norm": 359.0513610839844, "learning_rate": 3.767441860465116e-07, "logits/chosen": -0.828125, "logits/rejected": -0.890625, "logps/chosen": -122.5, "logps/rejected": -119.0, "loss": 12.5353, "rewards/accuracies": 0.84375, "rewards/chosen": 0.318359375, "rewards/margins": 1.2109375, "rewards/rejected": -0.890625, "step": 349 }, { "epoch": 0.8131261797589662, "grad_norm": 373.05609130859375, "learning_rate": 3.7209302325581396e-07, "logits/chosen": -0.90625, "logits/rejected": -0.8671875, "logps/chosen": -127.0, "logps/rejected": -129.0, "loss": 12.506, "rewards/accuracies": 0.8125, "rewards/chosen": 0.30859375, "rewards/margins": 1.2578125, "rewards/rejected": -0.953125, "step": 350 }, { "epoch": 0.8154493974154203, "grad_norm": 456.4620666503906, "learning_rate": 3.6744186046511626e-07, "logits/chosen": -0.875, "logits/rejected": -0.89453125, "logps/chosen": -137.0, "logps/rejected": -131.0, "loss": 14.227, "rewards/accuracies": 0.8125, "rewards/chosen": 0.357421875, "rewards/margins": 1.1796875, "rewards/rejected": -0.82421875, "step": 351 }, { "epoch": 0.8177726150718746, "grad_norm": 366.9906921386719, "learning_rate": 3.627906976744186e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.85546875, "logps/chosen": -136.0, "logps/rejected": -137.0, "loss": 13.6667, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1298828125, "rewards/margins": 1.0390625, "rewards/rejected": -0.9140625, "step": 352 }, { "epoch": 0.8200958327283288, "grad_norm": 344.71661376953125, "learning_rate": 3.581395348837209e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.875, "logps/chosen": -139.0, "logps/rejected": -122.5, "loss": 11.369, "rewards/accuracies": 0.78125, "rewards/chosen": 0.66796875, "rewards/margins": 1.3671875, "rewards/rejected": -0.703125, "step": 353 }, { "epoch": 0.8224190503847829, "grad_norm": 364.9308166503906, "learning_rate": 3.534883720930232e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.89453125, "logps/chosen": -120.0, "logps/rejected": -126.5, "loss": 14.8368, "rewards/accuracies": 0.6875, "rewards/chosen": 0.271484375, "rewards/margins": 0.96875, "rewards/rejected": -0.6953125, "step": 354 }, { "epoch": 0.8247422680412371, "grad_norm": 478.8648376464844, "learning_rate": 3.4883720930232557e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.86328125, "logps/chosen": -130.0, "logps/rejected": -120.5, "loss": 17.2244, "rewards/accuracies": 0.78125, "rewards/chosen": 0.30859375, "rewards/margins": 1.015625, "rewards/rejected": -0.7109375, "step": 355 }, { "epoch": 0.8270654856976913, "grad_norm": 376.8917236328125, "learning_rate": 3.4418604651162793e-07, "logits/chosen": -0.80859375, "logits/rejected": -0.86328125, "logps/chosen": -145.0, "logps/rejected": -120.5, "loss": 13.5175, "rewards/accuracies": 0.78125, "rewards/chosen": 0.412109375, "rewards/margins": 1.125, "rewards/rejected": -0.71484375, "step": 356 }, { "epoch": 0.8293887033541455, "grad_norm": 364.0615234375, "learning_rate": 3.395348837209302e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.875, "logps/chosen": -116.0, "logps/rejected": -121.5, "loss": 12.5255, "rewards/accuracies": 0.8125, "rewards/chosen": 0.55078125, "rewards/margins": 1.3359375, "rewards/rejected": -0.7890625, "step": 357 }, { "epoch": 0.8317119210105997, "grad_norm": 353.6752624511719, "learning_rate": 3.3488372093023253e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.875, "logps/chosen": -119.0, "logps/rejected": -117.0, "loss": 12.7742, "rewards/accuracies": 0.8125, "rewards/chosen": 0.423828125, "rewards/margins": 1.3203125, "rewards/rejected": -0.8984375, "step": 358 }, { "epoch": 0.8340351386670539, "grad_norm": 373.83966064453125, "learning_rate": 3.302325581395349e-07, "logits/chosen": -0.890625, "logits/rejected": -0.88671875, "logps/chosen": -127.5, "logps/rejected": -129.0, "loss": 13.6439, "rewards/accuracies": 0.84375, "rewards/chosen": 0.47265625, "rewards/margins": 1.1015625, "rewards/rejected": -0.625, "step": 359 }, { "epoch": 0.8363583563235081, "grad_norm": 372.99908447265625, "learning_rate": 3.2558139534883724e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.8515625, "logps/chosen": -120.5, "logps/rejected": -122.5, "loss": 10.6753, "rewards/accuracies": 0.84375, "rewards/chosen": 0.53515625, "rewards/margins": 1.625, "rewards/rejected": -1.0859375, "step": 360 }, { "epoch": 0.8386815739799622, "grad_norm": 441.1159973144531, "learning_rate": 3.209302325581395e-07, "logits/chosen": -0.8125, "logits/rejected": -0.8984375, "logps/chosen": -122.5, "logps/rejected": -133.0, "loss": 9.8108, "rewards/accuracies": 0.90625, "rewards/chosen": 0.6875, "rewards/margins": 1.5390625, "rewards/rejected": -0.8515625, "step": 361 }, { "epoch": 0.8410047916364164, "grad_norm": 469.9103088378906, "learning_rate": 3.1627906976744185e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.890625, "logps/chosen": -124.5, "logps/rejected": -121.5, "loss": 13.8306, "rewards/accuracies": 0.78125, "rewards/chosen": 0.341796875, "rewards/margins": 1.1640625, "rewards/rejected": -0.8203125, "step": 362 }, { "epoch": 0.8433280092928707, "grad_norm": 459.4384765625, "learning_rate": 3.116279069767442e-07, "logits/chosen": -0.80078125, "logits/rejected": -0.78125, "logps/chosen": -131.0, "logps/rejected": -132.0, "loss": 16.8385, "rewards/accuracies": 0.6875, "rewards/chosen": 0.287109375, "rewards/margins": 1.09375, "rewards/rejected": -0.8046875, "step": 363 }, { "epoch": 0.8456512269493248, "grad_norm": 475.96575927734375, "learning_rate": 3.069767441860465e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.84375, "logps/chosen": -124.5, "logps/rejected": -153.0, "loss": 14.3564, "rewards/accuracies": 0.8125, "rewards/chosen": 0.33203125, "rewards/margins": 0.953125, "rewards/rejected": -0.62109375, "step": 364 }, { "epoch": 0.847974444605779, "grad_norm": 376.33319091796875, "learning_rate": 3.023255813953488e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.859375, "logps/chosen": -126.0, "logps/rejected": -129.0, "loss": 13.5657, "rewards/accuracies": 0.75, "rewards/chosen": 0.302734375, "rewards/margins": 1.1953125, "rewards/rejected": -0.890625, "step": 365 }, { "epoch": 0.8502976622622332, "grad_norm": 366.171875, "learning_rate": 2.9767441860465116e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.88671875, "logps/chosen": -117.0, "logps/rejected": -124.0, "loss": 12.0715, "rewards/accuracies": 0.84375, "rewards/chosen": 0.53515625, "rewards/margins": 1.203125, "rewards/rejected": -0.66796875, "step": 366 }, { "epoch": 0.8526208799186874, "grad_norm": 388.7607116699219, "learning_rate": 2.9302325581395347e-07, "logits/chosen": -0.84375, "logits/rejected": -0.85546875, "logps/chosen": -136.0, "logps/rejected": -127.0, "loss": 12.8401, "rewards/accuracies": 0.8125, "rewards/chosen": 0.296875, "rewards/margins": 1.0703125, "rewards/rejected": -0.7734375, "step": 367 }, { "epoch": 0.8549440975751416, "grad_norm": 359.4689025878906, "learning_rate": 2.883720930232558e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.87890625, "logps/chosen": -123.0, "logps/rejected": -118.0, "loss": 12.6276, "rewards/accuracies": 0.78125, "rewards/chosen": 0.4921875, "rewards/margins": 1.2421875, "rewards/rejected": -0.75, "step": 368 }, { "epoch": 0.8572673152315957, "grad_norm": 436.34637451171875, "learning_rate": 2.837209302325581e-07, "logits/chosen": -0.859375, "logits/rejected": -0.88671875, "logps/chosen": -136.0, "logps/rejected": -119.5, "loss": 15.5687, "rewards/accuracies": 0.6875, "rewards/chosen": 0.2734375, "rewards/margins": 0.953125, "rewards/rejected": -0.6796875, "step": 369 }, { "epoch": 0.85959053288805, "grad_norm": 460.02642822265625, "learning_rate": 2.7906976744186043e-07, "logits/chosen": -0.921875, "logits/rejected": -0.92578125, "logps/chosen": -129.0, "logps/rejected": -126.5, "loss": 14.6654, "rewards/accuracies": 0.75, "rewards/chosen": 0.306640625, "rewards/margins": 1.1875, "rewards/rejected": -0.8828125, "step": 370 }, { "epoch": 0.8619137505445041, "grad_norm": 482.4629211425781, "learning_rate": 2.744186046511628e-07, "logits/chosen": -0.8828125, "logits/rejected": -0.8984375, "logps/chosen": -140.0, "logps/rejected": -137.0, "loss": 19.0223, "rewards/accuracies": 0.6875, "rewards/chosen": 0.2001953125, "rewards/margins": 0.64453125, "rewards/rejected": -0.443359375, "step": 371 }, { "epoch": 0.8642369682009583, "grad_norm": 430.52734375, "learning_rate": 2.6976744186046514e-07, "logits/chosen": -0.859375, "logits/rejected": -0.8515625, "logps/chosen": -112.5, "logps/rejected": -150.0, "loss": 15.3828, "rewards/accuracies": 0.78125, "rewards/chosen": 0.3515625, "rewards/margins": 0.8984375, "rewards/rejected": -0.546875, "step": 372 }, { "epoch": 0.8665601858574126, "grad_norm": 435.8709716796875, "learning_rate": 2.651162790697674e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.859375, "logps/chosen": -127.5, "logps/rejected": -132.0, "loss": 15.0752, "rewards/accuracies": 0.71875, "rewards/chosen": 0.27734375, "rewards/margins": 0.92578125, "rewards/rejected": -0.6484375, "step": 373 }, { "epoch": 0.8688834035138667, "grad_norm": 341.1181335449219, "learning_rate": 2.6046511627906974e-07, "logits/chosen": -0.875, "logits/rejected": -0.89453125, "logps/chosen": -127.0, "logps/rejected": -130.0, "loss": 10.693, "rewards/accuracies": 0.875, "rewards/chosen": 0.44140625, "rewards/margins": 1.4921875, "rewards/rejected": -1.046875, "step": 374 }, { "epoch": 0.8712066211703209, "grad_norm": 432.8375549316406, "learning_rate": 2.558139534883721e-07, "logits/chosen": -0.82421875, "logits/rejected": -0.87109375, "logps/chosen": -111.0, "logps/rejected": -132.0, "loss": 16.0132, "rewards/accuracies": 0.78125, "rewards/chosen": 0.3828125, "rewards/margins": 0.98828125, "rewards/rejected": -0.60546875, "step": 375 }, { "epoch": 0.873529838826775, "grad_norm": 496.7705993652344, "learning_rate": 2.5116279069767445e-07, "logits/chosen": -0.83203125, "logits/rejected": -0.85546875, "logps/chosen": -127.5, "logps/rejected": -125.5, "loss": 13.1619, "rewards/accuracies": 0.75, "rewards/chosen": 0.376953125, "rewards/margins": 1.4453125, "rewards/rejected": -1.0703125, "step": 376 }, { "epoch": 0.8758530564832293, "grad_norm": 475.2943420410156, "learning_rate": 2.4651162790697676e-07, "logits/chosen": -0.84765625, "logits/rejected": -0.90625, "logps/chosen": -128.0, "logps/rejected": -127.0, "loss": 17.3145, "rewards/accuracies": 0.625, "rewards/chosen": 0.31640625, "rewards/margins": 0.921875, "rewards/rejected": -0.60546875, "step": 377 }, { "epoch": 0.8781762741396835, "grad_norm": 360.33929443359375, "learning_rate": 2.4186046511627906e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.84765625, "logps/chosen": -127.0, "logps/rejected": -121.5, "loss": 12.2108, "rewards/accuracies": 0.78125, "rewards/chosen": 0.486328125, "rewards/margins": 1.15625, "rewards/rejected": -0.66796875, "step": 378 }, { "epoch": 0.8804994917961376, "grad_norm": 417.58416748046875, "learning_rate": 2.3720930232558139e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.8203125, "logps/chosen": -127.0, "logps/rejected": -114.0, "loss": 14.0455, "rewards/accuracies": 0.75, "rewards/chosen": 0.42578125, "rewards/margins": 1.125, "rewards/rejected": -0.69921875, "step": 379 }, { "epoch": 0.8828227094525919, "grad_norm": 360.6600036621094, "learning_rate": 2.3255813953488372e-07, "logits/chosen": -0.828125, "logits/rejected": -0.890625, "logps/chosen": -125.5, "logps/rejected": -129.0, "loss": 11.5916, "rewards/accuracies": 0.875, "rewards/chosen": 0.494140625, "rewards/margins": 1.3359375, "rewards/rejected": -0.84375, "step": 380 }, { "epoch": 0.885145927109046, "grad_norm": 603.400390625, "learning_rate": 2.2790697674418604e-07, "logits/chosen": -0.8359375, "logits/rejected": -0.8359375, "logps/chosen": -129.0, "logps/rejected": -137.0, "loss": 15.2494, "rewards/accuracies": 0.75, "rewards/chosen": 0.333984375, "rewards/margins": 1.0859375, "rewards/rejected": -0.74609375, "step": 381 }, { "epoch": 0.8874691447655002, "grad_norm": 387.8462829589844, "learning_rate": 2.2325581395348835e-07, "logits/chosen": -0.921875, "logits/rejected": -0.921875, "logps/chosen": -124.0, "logps/rejected": -139.0, "loss": 13.0447, "rewards/accuracies": 0.8125, "rewards/chosen": 0.349609375, "rewards/margins": 1.0234375, "rewards/rejected": -0.67578125, "step": 382 }, { "epoch": 0.8897923624219544, "grad_norm": 379.9131164550781, "learning_rate": 2.186046511627907e-07, "logits/chosen": -0.91015625, "logits/rejected": -0.9140625, "logps/chosen": -131.0, "logps/rejected": -128.0, "loss": 10.8182, "rewards/accuracies": 0.84375, "rewards/chosen": 0.39453125, "rewards/margins": 1.46875, "rewards/rejected": -1.0703125, "step": 383 }, { "epoch": 0.8921155800784086, "grad_norm": 429.8023681640625, "learning_rate": 2.13953488372093e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.90625, "logps/chosen": -115.5, "logps/rejected": -130.0, "loss": 16.3474, "rewards/accuracies": 0.71875, "rewards/chosen": 0.333984375, "rewards/margins": 0.90234375, "rewards/rejected": -0.56640625, "step": 384 }, { "epoch": 0.8944387977348628, "grad_norm": 399.4114685058594, "learning_rate": 2.0930232558139536e-07, "logits/chosen": -0.90625, "logits/rejected": -0.92578125, "logps/chosen": -123.0, "logps/rejected": -119.5, "loss": 15.1389, "rewards/accuracies": 0.8125, "rewards/chosen": 0.42578125, "rewards/margins": 0.92578125, "rewards/rejected": -0.5, "step": 385 }, { "epoch": 0.896762015391317, "grad_norm": 387.39788818359375, "learning_rate": 2.0465116279069766e-07, "logits/chosen": -0.91796875, "logits/rejected": -0.90234375, "logps/chosen": -133.0, "logps/rejected": -130.0, "loss": 12.6393, "rewards/accuracies": 0.78125, "rewards/chosen": 0.447265625, "rewards/margins": 1.3203125, "rewards/rejected": -0.87109375, "step": 386 }, { "epoch": 0.8990852330477712, "grad_norm": 433.6268310546875, "learning_rate": 2e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.87890625, "logps/chosen": -129.0, "logps/rejected": -147.0, "loss": 16.6982, "rewards/accuracies": 0.65625, "rewards/chosen": 0.263671875, "rewards/margins": 0.6171875, "rewards/rejected": -0.35546875, "step": 387 }, { "epoch": 0.9014084507042254, "grad_norm": 478.2352600097656, "learning_rate": 1.9534883720930232e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.85546875, "logps/chosen": -136.0, "logps/rejected": -142.0, "loss": 15.4782, "rewards/accuracies": 0.6875, "rewards/chosen": 0.373046875, "rewards/margins": 1.0390625, "rewards/rejected": -0.6640625, "step": 388 }, { "epoch": 0.9037316683606795, "grad_norm": 321.55224609375, "learning_rate": 1.9069767441860465e-07, "logits/chosen": -0.87109375, "logits/rejected": -0.9140625, "logps/chosen": -122.5, "logps/rejected": -119.5, "loss": 11.955, "rewards/accuracies": 0.8125, "rewards/chosen": 0.5703125, "rewards/margins": 1.2890625, "rewards/rejected": -0.71484375, "step": 389 }, { "epoch": 0.9060548860171337, "grad_norm": 389.5977478027344, "learning_rate": 1.8604651162790698e-07, "logits/chosen": -0.84375, "logits/rejected": -0.8359375, "logps/chosen": -143.0, "logps/rejected": -120.5, "loss": 12.9778, "rewards/accuracies": 0.6875, "rewards/chosen": 0.60546875, "rewards/margins": 1.234375, "rewards/rejected": -0.62890625, "step": 390 }, { "epoch": 0.908378103673588, "grad_norm": 358.9306640625, "learning_rate": 1.813953488372093e-07, "logits/chosen": -0.85546875, "logits/rejected": -0.86328125, "logps/chosen": -142.0, "logps/rejected": -113.5, "loss": 11.2094, "rewards/accuracies": 0.8125, "rewards/chosen": 0.4609375, "rewards/margins": 1.5078125, "rewards/rejected": -1.046875, "step": 391 }, { "epoch": 0.9107013213300421, "grad_norm": 554.0177612304688, "learning_rate": 1.767441860465116e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.921875, "logps/chosen": -130.0, "logps/rejected": -149.0, "loss": 20.13, "rewards/accuracies": 0.65625, "rewards/chosen": 0.267578125, "rewards/margins": 0.734375, "rewards/rejected": -0.46484375, "step": 392 }, { "epoch": 0.9130245389864963, "grad_norm": 366.87103271484375, "learning_rate": 1.7209302325581396e-07, "logits/chosen": -0.78125, "logits/rejected": -0.8125, "logps/chosen": -134.0, "logps/rejected": -138.0, "loss": 10.4358, "rewards/accuracies": 0.875, "rewards/chosen": 0.6328125, "rewards/margins": 1.53125, "rewards/rejected": -0.89453125, "step": 393 }, { "epoch": 0.9153477566429505, "grad_norm": 392.17437744140625, "learning_rate": 1.6744186046511627e-07, "logits/chosen": -0.84375, "logits/rejected": -0.87109375, "logps/chosen": -131.0, "logps/rejected": -128.0, "loss": 13.6418, "rewards/accuracies": 0.75, "rewards/chosen": 0.56640625, "rewards/margins": 1.3359375, "rewards/rejected": -0.765625, "step": 394 }, { "epoch": 0.9176709742994047, "grad_norm": 317.3909912109375, "learning_rate": 1.6279069767441862e-07, "logits/chosen": -0.859375, "logits/rejected": -0.86328125, "logps/chosen": -146.0, "logps/rejected": -119.0, "loss": 10.7445, "rewards/accuracies": 0.90625, "rewards/chosen": 0.41015625, "rewards/margins": 1.2734375, "rewards/rejected": -0.86328125, "step": 395 }, { "epoch": 0.9199941919558589, "grad_norm": 375.08453369140625, "learning_rate": 1.5813953488372092e-07, "logits/chosen": -0.8671875, "logits/rejected": -0.890625, "logps/chosen": -130.0, "logps/rejected": -123.5, "loss": 10.4174, "rewards/accuracies": 0.875, "rewards/chosen": 0.431640625, "rewards/margins": 1.5078125, "rewards/rejected": -1.078125, "step": 396 }, { "epoch": 0.922317409612313, "grad_norm": 379.6015319824219, "learning_rate": 1.5348837209302325e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.91015625, "logps/chosen": -116.0, "logps/rejected": -119.0, "loss": 13.0293, "rewards/accuracies": 0.84375, "rewards/chosen": 0.66796875, "rewards/margins": 1.0234375, "rewards/rejected": -0.353515625, "step": 397 }, { "epoch": 0.9246406272687673, "grad_norm": 399.4117431640625, "learning_rate": 1.4883720930232558e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.890625, "logps/chosen": -135.0, "logps/rejected": -121.5, "loss": 14.1611, "rewards/accuracies": 0.78125, "rewards/chosen": 0.6484375, "rewards/margins": 1.109375, "rewards/rejected": -0.4609375, "step": 398 }, { "epoch": 0.9269638449252214, "grad_norm": 325.7952880859375, "learning_rate": 1.441860465116279e-07, "logits/chosen": -0.875, "logits/rejected": -0.921875, "logps/chosen": -137.0, "logps/rejected": -125.5, "loss": 12.9187, "rewards/accuracies": 0.84375, "rewards/chosen": 0.54296875, "rewards/margins": 1.1171875, "rewards/rejected": -0.57421875, "step": 399 }, { "epoch": 0.9292870625816756, "grad_norm": 504.759033203125, "learning_rate": 1.3953488372093021e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.90234375, "logps/chosen": -137.0, "logps/rejected": -148.0, "loss": 13.8368, "rewards/accuracies": 0.78125, "rewards/chosen": 0.330078125, "rewards/margins": 1.1015625, "rewards/rejected": -0.7734375, "step": 400 }, { "epoch": 0.9316102802381299, "grad_norm": 399.3138122558594, "learning_rate": 1.3488372093023257e-07, "logits/chosen": -0.86328125, "logits/rejected": -0.90234375, "logps/chosen": -138.0, "logps/rejected": -117.5, "loss": 14.4127, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2490234375, "rewards/margins": 1.015625, "rewards/rejected": -0.765625, "step": 401 }, { "epoch": 0.933933497894584, "grad_norm": 487.4891357421875, "learning_rate": 1.3023255813953487e-07, "logits/chosen": -0.87890625, "logits/rejected": -0.87109375, "logps/chosen": -144.0, "logps/rejected": -145.0, "loss": 14.2865, "rewards/accuracies": 0.75, "rewards/chosen": 0.265625, "rewards/margins": 1.1328125, "rewards/rejected": -0.8671875, "step": 402 }, { "epoch": 0.9362567155510382, "grad_norm": 342.6651611328125, "learning_rate": 1.2558139534883723e-07, "logits/chosen": -0.828125, "logits/rejected": -0.859375, "logps/chosen": -133.0, "logps/rejected": -127.0, "loss": 11.4037, "rewards/accuracies": 0.875, "rewards/chosen": 0.470703125, "rewards/margins": 1.4609375, "rewards/rejected": -0.98828125, "step": 403 }, { "epoch": 0.9385799332074923, "grad_norm": 398.06939697265625, "learning_rate": 1.2093023255813953e-07, "logits/chosen": -0.90625, "logits/rejected": -0.8984375, "logps/chosen": -124.0, "logps/rejected": -126.0, "loss": 13.7546, "rewards/accuracies": 0.8125, "rewards/chosen": 0.265625, "rewards/margins": 1.015625, "rewards/rejected": -0.75, "step": 404 }, { "epoch": 0.9409031508639466, "grad_norm": 298.3856201171875, "learning_rate": 1.1627906976744186e-07, "logits/chosen": -0.8515625, "logits/rejected": -0.88671875, "logps/chosen": -122.0, "logps/rejected": -120.5, "loss": 11.0682, "rewards/accuracies": 0.875, "rewards/chosen": 0.388671875, "rewards/margins": 1.3671875, "rewards/rejected": -0.98046875, "step": 405 }, { "epoch": 0.9432263685204008, "grad_norm": 368.4793701171875, "learning_rate": 1.1162790697674417e-07, "logits/chosen": -0.796875, "logits/rejected": -0.81640625, "logps/chosen": -162.0, "logps/rejected": -133.0, "loss": 11.1848, "rewards/accuracies": 0.78125, "rewards/chosen": 0.65234375, "rewards/margins": 1.421875, "rewards/rejected": -0.76953125, "step": 406 }, { "epoch": 0.9455495861768549, "grad_norm": 294.15423583984375, "learning_rate": 1.069767441860465e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.83984375, "logps/chosen": -117.0, "logps/rejected": -121.0, "loss": 9.3992, "rewards/accuracies": 0.875, "rewards/chosen": 0.5, "rewards/margins": 1.4609375, "rewards/rejected": -0.96484375, "step": 407 }, { "epoch": 0.9478728038333092, "grad_norm": 366.13348388671875, "learning_rate": 1.0232558139534883e-07, "logits/chosen": -0.8203125, "logits/rejected": -0.8359375, "logps/chosen": -116.0, "logps/rejected": -122.0, "loss": 12.3627, "rewards/accuracies": 0.90625, "rewards/chosen": 0.61328125, "rewards/margins": 1.171875, "rewards/rejected": -0.55859375, "step": 408 }, { "epoch": 0.9501960214897633, "grad_norm": 424.2518310546875, "learning_rate": 9.767441860465116e-08, "logits/chosen": -0.83984375, "logits/rejected": -0.86328125, "logps/chosen": -129.0, "logps/rejected": -138.0, "loss": 13.1234, "rewards/accuracies": 0.78125, "rewards/chosen": 0.51171875, "rewards/margins": 1.078125, "rewards/rejected": -0.5625, "step": 409 }, { "epoch": 0.9525192391462175, "grad_norm": 398.58087158203125, "learning_rate": 9.302325581395349e-08, "logits/chosen": -0.8359375, "logits/rejected": -0.88671875, "logps/chosen": -120.0, "logps/rejected": -123.0, "loss": 13.4062, "rewards/accuracies": 0.78125, "rewards/chosen": 0.291015625, "rewards/margins": 1.203125, "rewards/rejected": -0.91796875, "step": 410 }, { "epoch": 0.9548424568026717, "grad_norm": 391.4315185546875, "learning_rate": 8.83720930232558e-08, "logits/chosen": -0.828125, "logits/rejected": -0.85546875, "logps/chosen": -128.0, "logps/rejected": -152.0, "loss": 15.4103, "rewards/accuracies": 0.71875, "rewards/chosen": 0.3671875, "rewards/margins": 0.828125, "rewards/rejected": -0.4609375, "step": 411 }, { "epoch": 0.9571656744591259, "grad_norm": 391.45184326171875, "learning_rate": 8.372093023255813e-08, "logits/chosen": -0.8359375, "logits/rejected": -0.88671875, "logps/chosen": -128.0, "logps/rejected": -125.0, "loss": 14.7136, "rewards/accuracies": 0.8125, "rewards/chosen": 0.419921875, "rewards/margins": 1.015625, "rewards/rejected": -0.59765625, "step": 412 }, { "epoch": 0.9594888921155801, "grad_norm": 330.07623291015625, "learning_rate": 7.906976744186046e-08, "logits/chosen": -0.875, "logits/rejected": -0.8828125, "logps/chosen": -122.5, "logps/rejected": -146.0, "loss": 12.1995, "rewards/accuracies": 0.84375, "rewards/chosen": 0.72265625, "rewards/margins": 1.1640625, "rewards/rejected": -0.443359375, "step": 413 }, { "epoch": 0.9618121097720342, "grad_norm": 374.36016845703125, "learning_rate": 7.441860465116279e-08, "logits/chosen": -0.88671875, "logits/rejected": -0.91015625, "logps/chosen": -123.5, "logps/rejected": -130.0, "loss": 11.3741, "rewards/accuracies": 0.875, "rewards/chosen": 0.63671875, "rewards/margins": 1.28125, "rewards/rejected": -0.6484375, "step": 414 }, { "epoch": 0.9641353274284885, "grad_norm": 351.6080322265625, "learning_rate": 6.976744186046511e-08, "logits/chosen": -0.8828125, "logits/rejected": -0.92578125, "logps/chosen": -123.5, "logps/rejected": -113.0, "loss": 15.8728, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2314453125, "rewards/margins": 0.84765625, "rewards/rejected": -0.6171875, "step": 415 }, { "epoch": 0.9664585450849427, "grad_norm": 364.0675048828125, "learning_rate": 6.511627906976744e-08, "logits/chosen": -0.87109375, "logits/rejected": -0.859375, "logps/chosen": -141.0, "logps/rejected": -130.0, "loss": 10.63, "rewards/accuracies": 0.875, "rewards/chosen": 0.45703125, "rewards/margins": 1.40625, "rewards/rejected": -0.9453125, "step": 416 }, { "epoch": 0.9687817627413968, "grad_norm": 329.6365051269531, "learning_rate": 6.046511627906976e-08, "logits/chosen": -0.85546875, "logits/rejected": -0.87109375, "logps/chosen": -150.0, "logps/rejected": -123.5, "loss": 9.7498, "rewards/accuracies": 0.875, "rewards/chosen": 0.70703125, "rewards/margins": 1.3671875, "rewards/rejected": -0.66015625, "step": 417 }, { "epoch": 0.971104980397851, "grad_norm": 351.0168151855469, "learning_rate": 5.5813953488372087e-08, "logits/chosen": -0.84375, "logits/rejected": -0.8671875, "logps/chosen": -143.0, "logps/rejected": -138.0, "loss": 11.6222, "rewards/accuracies": 0.875, "rewards/chosen": 0.67578125, "rewards/margins": 1.3125, "rewards/rejected": -0.63671875, "step": 418 }, { "epoch": 0.9734281980543052, "grad_norm": 338.6527099609375, "learning_rate": 5.1162790697674416e-08, "logits/chosen": -0.91015625, "logits/rejected": -0.94140625, "logps/chosen": -145.0, "logps/rejected": -125.5, "loss": 12.6106, "rewards/accuracies": 0.84375, "rewards/chosen": 0.443359375, "rewards/margins": 1.2265625, "rewards/rejected": -0.78125, "step": 419 }, { "epoch": 0.9757514157107594, "grad_norm": 476.017333984375, "learning_rate": 4.6511627906976744e-08, "logits/chosen": -0.8984375, "logits/rejected": -0.8984375, "logps/chosen": -127.0, "logps/rejected": -124.0, "loss": 11.9675, "rewards/accuracies": 0.90625, "rewards/chosen": 0.56640625, "rewards/margins": 1.125, "rewards/rejected": -0.55859375, "step": 420 }, { "epoch": 0.9780746333672136, "grad_norm": 597.4747314453125, "learning_rate": 4.1860465116279067e-08, "logits/chosen": -0.8828125, "logits/rejected": -0.890625, "logps/chosen": -135.0, "logps/rejected": -129.0, "loss": 20.6045, "rewards/accuracies": 0.65625, "rewards/chosen": 0.140625, "rewards/margins": 0.53515625, "rewards/rejected": -0.396484375, "step": 421 }, { "epoch": 0.9803978510236678, "grad_norm": 422.0390319824219, "learning_rate": 3.7209302325581396e-08, "logits/chosen": -0.84375, "logits/rejected": -0.86328125, "logps/chosen": -142.0, "logps/rejected": -131.0, "loss": 13.5287, "rewards/accuracies": 0.75, "rewards/chosen": -0.02783203125, "rewards/margins": 1.21875, "rewards/rejected": -1.2421875, "step": 422 }, { "epoch": 0.982721068680122, "grad_norm": 461.14935302734375, "learning_rate": 3.255813953488372e-08, "logits/chosen": -0.88671875, "logits/rejected": -0.87890625, "logps/chosen": -138.0, "logps/rejected": -143.0, "loss": 15.0398, "rewards/accuracies": 0.8125, "rewards/chosen": 0.042236328125, "rewards/margins": 0.84765625, "rewards/rejected": -0.8046875, "step": 423 }, { "epoch": 0.9850442863365761, "grad_norm": 412.094482421875, "learning_rate": 2.7906976744186043e-08, "logits/chosen": -0.85546875, "logits/rejected": -0.8515625, "logps/chosen": -130.0, "logps/rejected": -125.0, "loss": 13.0969, "rewards/accuracies": 0.8125, "rewards/chosen": 0.42578125, "rewards/margins": 1.1015625, "rewards/rejected": -0.67578125, "step": 424 }, { "epoch": 0.9873675039930303, "grad_norm": 348.2117614746094, "learning_rate": 2.3255813953488372e-08, "logits/chosen": -0.84765625, "logits/rejected": -0.8515625, "logps/chosen": -127.0, "logps/rejected": -145.0, "loss": 13.7319, "rewards/accuracies": 0.90625, "rewards/chosen": 0.44921875, "rewards/margins": 1.2734375, "rewards/rejected": -0.828125, "step": 425 }, { "epoch": 0.9896907216494846, "grad_norm": 383.5706787109375, "learning_rate": 1.8604651162790698e-08, "logits/chosen": -0.84375, "logits/rejected": -0.890625, "logps/chosen": -130.0, "logps/rejected": -137.0, "loss": 13.9442, "rewards/accuracies": 0.6875, "rewards/chosen": 0.484375, "rewards/margins": 1.0703125, "rewards/rejected": -0.5859375, "step": 426 }, { "epoch": 0.9920139393059387, "grad_norm": 368.6072082519531, "learning_rate": 1.3953488372093022e-08, "logits/chosen": -0.875, "logits/rejected": -0.88671875, "logps/chosen": -133.0, "logps/rejected": -137.0, "loss": 15.8562, "rewards/accuracies": 0.75, "rewards/chosen": 0.279296875, "rewards/margins": 1.0390625, "rewards/rejected": -0.7578125, "step": 427 }, { "epoch": 0.9943371569623929, "grad_norm": 555.5682983398438, "learning_rate": 9.302325581395349e-09, "logits/chosen": -0.8203125, "logits/rejected": -0.8359375, "logps/chosen": -117.0, "logps/rejected": -126.0, "loss": 15.7869, "rewards/accuracies": 0.78125, "rewards/chosen": 0.283203125, "rewards/margins": 1.09375, "rewards/rejected": -0.80859375, "step": 428 }, { "epoch": 0.9966603746188472, "grad_norm": 393.66015625, "learning_rate": 4.6511627906976744e-09, "logits/chosen": -0.84765625, "logits/rejected": -0.921875, "logps/chosen": -144.0, "logps/rejected": -130.0, "loss": 13.2079, "rewards/accuracies": 0.8125, "rewards/chosen": 0.44921875, "rewards/margins": 1.25, "rewards/rejected": -0.796875, "step": 429 }, { "epoch": 0.9989835922753013, "grad_norm": 407.5803527832031, "learning_rate": 0.0, "logits/chosen": -0.84375, "logits/rejected": -0.87109375, "logps/chosen": -111.5, "logps/rejected": -123.0, "loss": 14.8324, "rewards/accuracies": 0.6875, "rewards/chosen": 0.32421875, "rewards/margins": 0.99609375, "rewards/rejected": -0.671875, "step": 430 } ], "logging_steps": 1, "max_steps": 430, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }