Search-o1-MedQA-DPO / trainer_state.json
RAG-Gym's picture
Upload 8 files
85dc538 verified
Raw
History Blame Contribute Delete
197 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9989835922753013,
"eval_steps": 500,
"global_step": 430,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002323217656454189,
"grad_norm": 323.048828125,
"learning_rate": 1.995348837209302e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.7421875,
"logps/chosen": -130.0,
"logps/rejected": -126.0,
"loss": 22.125,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.004646435312908378,
"grad_norm": 338.7125244140625,
"learning_rate": 1.9906976744186046e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.75,
"logps/chosen": -129.0,
"logps/rejected": -137.0,
"loss": 22.3984,
"rewards/accuracies": 0.21875,
"rewards/chosen": 0.01251220703125,
"rewards/margins": -0.01409912109375,
"rewards/rejected": 0.026611328125,
"step": 2
},
{
"epoch": 0.0069696529693625674,
"grad_norm": 324.7102355957031,
"learning_rate": 1.9860465116279068e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.69921875,
"logps/chosen": -134.0,
"logps/rejected": -112.0,
"loss": 22.25,
"rewards/accuracies": 0.34375,
"rewards/chosen": 0.0152587890625,
"rewards/margins": -0.00311279296875,
"rewards/rejected": 0.0184326171875,
"step": 3
},
{
"epoch": 0.009292870625816756,
"grad_norm": 359.8957824707031,
"learning_rate": 1.9813953488372093e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.7734375,
"logps/chosen": -144.0,
"logps/rejected": -121.0,
"loss": 22.0312,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.0031280517578125,
"rewards/margins": 0.01092529296875,
"rewards/rejected": -0.0078125,
"step": 4
},
{
"epoch": 0.011616088282270945,
"grad_norm": 337.0638122558594,
"learning_rate": 1.9767441860465115e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.7890625,
"logps/chosen": -122.0,
"logps/rejected": -114.0,
"loss": 21.7578,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.02734375,
"rewards/margins": 0.02734375,
"rewards/rejected": 0.0,
"step": 5
},
{
"epoch": 0.013939305938725135,
"grad_norm": 325.502197265625,
"learning_rate": 1.972093023255814e-06,
"logits/chosen": -0.796875,
"logits/rejected": -0.75390625,
"logps/chosen": -123.0,
"logps/rejected": -117.5,
"loss": 21.9141,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.0218505859375,
"rewards/margins": 0.0211181640625,
"rewards/rejected": 0.000782012939453125,
"step": 6
},
{
"epoch": 0.016262523595179323,
"grad_norm": 319.614990234375,
"learning_rate": 1.967441860465116e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.7734375,
"logps/chosen": -161.0,
"logps/rejected": -127.5,
"loss": 21.7227,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0203857421875,
"rewards/margins": 0.0281982421875,
"rewards/rejected": -0.0078125,
"step": 7
},
{
"epoch": 0.018585741251633512,
"grad_norm": 339.0907287597656,
"learning_rate": 1.9627906976744183e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.75390625,
"logps/chosen": -152.0,
"logps/rejected": -125.5,
"loss": 21.5156,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.042236328125,
"rewards/margins": 0.04296875,
"rewards/rejected": -0.000782012939453125,
"step": 8
},
{
"epoch": 0.0209089589080877,
"grad_norm": 317.0169982910156,
"learning_rate": 1.958139534883721e-06,
"logits/chosen": -0.64453125,
"logits/rejected": -0.765625,
"logps/chosen": -134.0,
"logps/rejected": -116.5,
"loss": 21.7969,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.03759765625,
"rewards/margins": 0.03125,
"rewards/rejected": 0.006256103515625,
"step": 9
},
{
"epoch": 0.02323217656454189,
"grad_norm": 353.8077392578125,
"learning_rate": 1.953488372093023e-06,
"logits/chosen": -0.68359375,
"logits/rejected": -0.703125,
"logps/chosen": -149.0,
"logps/rejected": -113.5,
"loss": 21.8633,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.035888671875,
"rewards/margins": 0.026611328125,
"rewards/rejected": 0.0093994140625,
"step": 10
},
{
"epoch": 0.02555539422099608,
"grad_norm": 324.4909362792969,
"learning_rate": 1.9488372093023256e-06,
"logits/chosen": -0.765625,
"logits/rejected": -0.765625,
"logps/chosen": -135.0,
"logps/rejected": -138.0,
"loss": 22.5781,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.026611328125,
"rewards/margins": -0.0172119140625,
"rewards/rejected": 0.043701171875,
"step": 11
},
{
"epoch": 0.02787861187745027,
"grad_norm": 360.6048583984375,
"learning_rate": 1.9441860465116278e-06,
"logits/chosen": -0.70703125,
"logits/rejected": -0.734375,
"logps/chosen": -155.0,
"logps/rejected": -116.0,
"loss": 20.6895,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.07666015625,
"rewards/margins": 0.10498046875,
"rewards/rejected": -0.0281982421875,
"step": 12
},
{
"epoch": 0.03020182953390446,
"grad_norm": 321.6941223144531,
"learning_rate": 1.9395348837209303e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.765625,
"logps/chosen": -125.0,
"logps/rejected": -132.0,
"loss": 20.8535,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.05712890625,
"rewards/margins": 0.08740234375,
"rewards/rejected": -0.030517578125,
"step": 13
},
{
"epoch": 0.03252504719035865,
"grad_norm": 314.4052429199219,
"learning_rate": 1.9348837209302325e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.796875,
"logps/chosen": -114.0,
"logps/rejected": -123.5,
"loss": 21.2949,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.04541015625,
"rewards/margins": 0.0673828125,
"rewards/rejected": -0.02197265625,
"step": 14
},
{
"epoch": 0.03484826484681284,
"grad_norm": 339.468017578125,
"learning_rate": 1.930232558139535e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.75,
"logps/chosen": -120.0,
"logps/rejected": -132.0,
"loss": 21.8496,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.020263671875,
"rewards/margins": 0.0250244140625,
"rewards/rejected": -0.00469970703125,
"step": 15
},
{
"epoch": 0.037171482503267024,
"grad_norm": 370.9052429199219,
"learning_rate": 1.925581395348837e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.79296875,
"logps/chosen": -140.0,
"logps/rejected": -131.0,
"loss": 22.0898,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.015625,
"rewards/margins": 0.0179443359375,
"rewards/rejected": -0.002349853515625,
"step": 16
},
{
"epoch": 0.039494700159721216,
"grad_norm": 337.88262939453125,
"learning_rate": 1.9209302325581393e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.70703125,
"logps/chosen": -142.0,
"logps/rejected": -137.0,
"loss": 21.0625,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.10791015625,
"rewards/margins": 0.08984375,
"rewards/rejected": 0.0179443359375,
"step": 17
},
{
"epoch": 0.0418179178161754,
"grad_norm": 363.0306091308594,
"learning_rate": 1.916279069767442e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.72265625,
"logps/chosen": -135.0,
"logps/rejected": -162.0,
"loss": 22.3711,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.018798828125,
"rewards/margins": -0.004730224609375,
"rewards/rejected": 0.0234375,
"step": 18
},
{
"epoch": 0.04414113547262959,
"grad_norm": 300.884521484375,
"learning_rate": 1.911627906976744e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.7734375,
"logps/chosen": -130.0,
"logps/rejected": -115.0,
"loss": 20.6758,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.055419921875,
"rewards/margins": 0.109375,
"rewards/rejected": -0.053955078125,
"step": 19
},
{
"epoch": 0.04646435312908378,
"grad_norm": 330.6780090332031,
"learning_rate": 1.9069767441860464e-06,
"logits/chosen": -0.6953125,
"logits/rejected": -0.68359375,
"logps/chosen": -139.0,
"logps/rejected": -113.5,
"loss": 20.2715,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.046875,
"rewards/margins": 0.1376953125,
"rewards/rejected": -0.0908203125,
"step": 20
},
{
"epoch": 0.04878757078553797,
"grad_norm": 316.6097106933594,
"learning_rate": 1.9023255813953487e-06,
"logits/chosen": -0.7109375,
"logits/rejected": -0.75,
"logps/chosen": -129.0,
"logps/rejected": -110.5,
"loss": 19.916,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.076171875,
"rewards/margins": 0.1591796875,
"rewards/rejected": -0.0830078125,
"step": 21
},
{
"epoch": 0.05111078844199216,
"grad_norm": 310.86370849609375,
"learning_rate": 1.897674418604651e-06,
"logits/chosen": -0.6484375,
"logits/rejected": -0.69921875,
"logps/chosen": -132.0,
"logps/rejected": -128.0,
"loss": 21.1484,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.03662109375,
"rewards/margins": 0.0869140625,
"rewards/rejected": -0.050048828125,
"step": 22
},
{
"epoch": 0.05343400609844635,
"grad_norm": 442.0061950683594,
"learning_rate": 1.8930232558139534e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.74609375,
"logps/chosen": -108.0,
"logps/rejected": -128.0,
"loss": 20.5215,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.018798828125,
"rewards/margins": 0.1298828125,
"rewards/rejected": -0.11083984375,
"step": 23
},
{
"epoch": 0.05575722375490054,
"grad_norm": 351.7835693359375,
"learning_rate": 1.8883720930232556e-06,
"logits/chosen": -0.7109375,
"logits/rejected": -0.71875,
"logps/chosen": -128.0,
"logps/rejected": -119.0,
"loss": 19.3867,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0849609375,
"rewards/margins": 0.2158203125,
"rewards/rejected": -0.130859375,
"step": 24
},
{
"epoch": 0.058080441411354725,
"grad_norm": 332.74700927734375,
"learning_rate": 1.8837209302325582e-06,
"logits/chosen": -0.703125,
"logits/rejected": -0.73046875,
"logps/chosen": -138.0,
"logps/rejected": -117.5,
"loss": 19.75,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.046875,
"rewards/margins": 0.181640625,
"rewards/rejected": -0.134765625,
"step": 25
},
{
"epoch": 0.06040365906780892,
"grad_norm": 334.2042541503906,
"learning_rate": 1.8790697674418603e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.76953125,
"logps/chosen": -143.0,
"logps/rejected": -130.0,
"loss": 19.8301,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0625,
"rewards/margins": 0.1904296875,
"rewards/rejected": -0.1279296875,
"step": 26
},
{
"epoch": 0.06272687672426311,
"grad_norm": 328.3305969238281,
"learning_rate": 1.8744186046511627e-06,
"logits/chosen": -0.6796875,
"logits/rejected": -0.6875,
"logps/chosen": -136.0,
"logps/rejected": -131.0,
"loss": 20.0059,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.0654296875,
"rewards/margins": 0.181640625,
"rewards/rejected": -0.1162109375,
"step": 27
},
{
"epoch": 0.0650500943807173,
"grad_norm": 310.84674072265625,
"learning_rate": 1.869767441860465e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.7265625,
"logps/chosen": -147.0,
"logps/rejected": -118.0,
"loss": 19.7676,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0625,
"rewards/margins": 0.1826171875,
"rewards/rejected": -0.11962890625,
"step": 28
},
{
"epoch": 0.06737331203717148,
"grad_norm": 363.75628662109375,
"learning_rate": 1.8651162790697674e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.7734375,
"logps/chosen": -142.0,
"logps/rejected": -128.0,
"loss": 20.2852,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.01165771484375,
"rewards/margins": 0.1474609375,
"rewards/rejected": -0.1357421875,
"step": 29
},
{
"epoch": 0.06969652969362568,
"grad_norm": 331.91949462890625,
"learning_rate": 1.8604651162790697e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.73828125,
"logps/chosen": -140.0,
"logps/rejected": -124.0,
"loss": 20.332,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.046875,
"rewards/margins": 0.169921875,
"rewards/rejected": -0.12255859375,
"step": 30
},
{
"epoch": 0.07201974735007986,
"grad_norm": 314.3414001464844,
"learning_rate": 1.855813953488372e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.78515625,
"logps/chosen": -124.0,
"logps/rejected": -119.5,
"loss": 20.3867,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.043701171875,
"rewards/margins": 0.1552734375,
"rewards/rejected": -0.1982421875,
"step": 31
},
{
"epoch": 0.07434296500653405,
"grad_norm": 353.8963928222656,
"learning_rate": 1.8511627906976744e-06,
"logits/chosen": -0.70703125,
"logits/rejected": -0.75390625,
"logps/chosen": -126.0,
"logps/rejected": -141.0,
"loss": 20.543,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.021728515625,
"rewards/margins": 0.1591796875,
"rewards/rejected": -0.1806640625,
"step": 32
},
{
"epoch": 0.07666618266298823,
"grad_norm": 315.1564636230469,
"learning_rate": 1.8465116279069766e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.734375,
"logps/chosen": -124.0,
"logps/rejected": -111.0,
"loss": 21.7266,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.0869140625,
"rewards/margins": 0.07373046875,
"rewards/rejected": -0.16015625,
"step": 33
},
{
"epoch": 0.07898940031944243,
"grad_norm": 353.0196533203125,
"learning_rate": 1.841860465116279e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.80078125,
"logps/chosen": -148.0,
"logps/rejected": -120.0,
"loss": 19.3828,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.078125,
"rewards/margins": 0.236328125,
"rewards/rejected": -0.314453125,
"step": 34
},
{
"epoch": 0.08131261797589662,
"grad_norm": 367.0079650878906,
"learning_rate": 1.8372093023255813e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.77734375,
"logps/chosen": -121.5,
"logps/rejected": -131.0,
"loss": 20.9941,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.07666015625,
"rewards/margins": 0.1220703125,
"rewards/rejected": -0.1982421875,
"step": 35
},
{
"epoch": 0.0836358356323508,
"grad_norm": 301.0638732910156,
"learning_rate": 1.8325581395348836e-06,
"logits/chosen": -0.6953125,
"logits/rejected": -0.71484375,
"logps/chosen": -137.0,
"logps/rejected": -124.0,
"loss": 17.9121,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.004791259765625,
"rewards/margins": 0.33203125,
"rewards/rejected": -0.328125,
"step": 36
},
{
"epoch": 0.085959053288805,
"grad_norm": 359.94842529296875,
"learning_rate": 1.827906976744186e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.7109375,
"logps/chosen": -139.0,
"logps/rejected": -128.0,
"loss": 21.6172,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.08203125,
"rewards/margins": 0.0986328125,
"rewards/rejected": -0.181640625,
"step": 37
},
{
"epoch": 0.08828227094525919,
"grad_norm": 322.6696472167969,
"learning_rate": 1.8232558139534884e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.78125,
"logps/chosen": -137.0,
"logps/rejected": -129.0,
"loss": 20.4121,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.024169921875,
"rewards/margins": 0.1884765625,
"rewards/rejected": -0.212890625,
"step": 38
},
{
"epoch": 0.09060548860171337,
"grad_norm": 308.0600280761719,
"learning_rate": 1.8186046511627907e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.78515625,
"logps/chosen": -122.5,
"logps/rejected": -121.5,
"loss": 19.002,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.06494140625,
"rewards/margins": 0.267578125,
"rewards/rejected": -0.33203125,
"step": 39
},
{
"epoch": 0.09292870625816756,
"grad_norm": 324.52655029296875,
"learning_rate": 1.8139534883720929e-06,
"logits/chosen": -0.7109375,
"logits/rejected": -0.7578125,
"logps/chosen": -125.0,
"logps/rejected": -105.0,
"loss": 20.1504,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.044677734375,
"rewards/margins": 0.1904296875,
"rewards/rejected": -0.2353515625,
"step": 40
},
{
"epoch": 0.09525192391462176,
"grad_norm": 336.1131286621094,
"learning_rate": 1.8093023255813952e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.765625,
"logps/chosen": -140.0,
"logps/rejected": -116.0,
"loss": 19.748,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.10546875,
"rewards/margins": 0.234375,
"rewards/rejected": -0.33984375,
"step": 41
},
{
"epoch": 0.09757514157107594,
"grad_norm": 348.0433654785156,
"learning_rate": 1.8046511627906976e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.76953125,
"logps/chosen": -162.0,
"logps/rejected": -124.0,
"loss": 18.8906,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1455078125,
"rewards/margins": 0.294921875,
"rewards/rejected": -0.44140625,
"step": 42
},
{
"epoch": 0.09989835922753013,
"grad_norm": 327.6149597167969,
"learning_rate": 1.8e-06,
"logits/chosen": -0.6796875,
"logits/rejected": -0.76953125,
"logps/chosen": -148.0,
"logps/rejected": -126.5,
"loss": 17.3145,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.020263671875,
"rewards/margins": 0.423828125,
"rewards/rejected": -0.4453125,
"step": 43
},
{
"epoch": 0.10222157688398432,
"grad_norm": 303.6740417480469,
"learning_rate": 1.7953488372093023e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.73828125,
"logps/chosen": -135.0,
"logps/rejected": -121.0,
"loss": 19.2715,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.11669921875,
"rewards/margins": 0.271484375,
"rewards/rejected": -0.388671875,
"step": 44
},
{
"epoch": 0.10454479454043851,
"grad_norm": 333.5793762207031,
"learning_rate": 1.7906976744186046e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.703125,
"logps/chosen": -133.0,
"logps/rejected": -121.5,
"loss": 18.8203,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.057861328125,
"rewards/margins": 0.318359375,
"rewards/rejected": -0.376953125,
"step": 45
},
{
"epoch": 0.1068680121968927,
"grad_norm": 318.89398193359375,
"learning_rate": 1.7860465116279068e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.7734375,
"logps/chosen": -142.0,
"logps/rejected": -126.5,
"loss": 17.5156,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.052978515625,
"rewards/margins": 0.404296875,
"rewards/rejected": -0.458984375,
"step": 46
},
{
"epoch": 0.10919122985334688,
"grad_norm": 364.5682678222656,
"learning_rate": 1.7813953488372093e-06,
"logits/chosen": -0.765625,
"logits/rejected": -0.70703125,
"logps/chosen": -117.5,
"logps/rejected": -150.0,
"loss": 20.8301,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.1201171875,
"rewards/margins": 0.208984375,
"rewards/rejected": -0.328125,
"step": 47
},
{
"epoch": 0.11151444750980108,
"grad_norm": 327.97412109375,
"learning_rate": 1.7767441860465115e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.84765625,
"logps/chosen": -144.0,
"logps/rejected": -134.0,
"loss": 19.6973,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.09912109375,
"rewards/margins": 0.265625,
"rewards/rejected": -0.365234375,
"step": 48
},
{
"epoch": 0.11383766516625526,
"grad_norm": 345.9813232421875,
"learning_rate": 1.7720930232558138e-06,
"logits/chosen": -0.66015625,
"logits/rejected": -0.7109375,
"logps/chosen": -139.0,
"logps/rejected": -133.0,
"loss": 21.0566,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.10986328125,
"rewards/margins": 0.1953125,
"rewards/rejected": -0.3046875,
"step": 49
},
{
"epoch": 0.11616088282270945,
"grad_norm": 336.94677734375,
"learning_rate": 1.7674418604651162e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.7421875,
"logps/chosen": -133.0,
"logps/rejected": -111.5,
"loss": 19.0391,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.138671875,
"rewards/margins": 0.318359375,
"rewards/rejected": -0.45703125,
"step": 50
},
{
"epoch": 0.11848410047916365,
"grad_norm": 341.45440673828125,
"learning_rate": 1.7627906976744185e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.74609375,
"logps/chosen": -120.5,
"logps/rejected": -145.0,
"loss": 19.6602,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.07958984375,
"rewards/margins": 0.287109375,
"rewards/rejected": -0.3671875,
"step": 51
},
{
"epoch": 0.12080731813561783,
"grad_norm": 378.4522399902344,
"learning_rate": 1.758139534883721e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.73046875,
"logps/chosen": -136.0,
"logps/rejected": -141.0,
"loss": 21.7686,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.1962890625,
"rewards/margins": 0.138671875,
"rewards/rejected": -0.3359375,
"step": 52
},
{
"epoch": 0.12313053579207202,
"grad_norm": 278.8151550292969,
"learning_rate": 1.753488372093023e-06,
"logits/chosen": -0.70703125,
"logits/rejected": -0.7890625,
"logps/chosen": -150.0,
"logps/rejected": -126.5,
"loss": 16.0195,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.06884765625,
"rewards/margins": 0.55859375,
"rewards/rejected": -0.490234375,
"step": 53
},
{
"epoch": 0.12545375344852622,
"grad_norm": 336.42022705078125,
"learning_rate": 1.7488372093023256e-06,
"logits/chosen": -0.703125,
"logits/rejected": -0.74609375,
"logps/chosen": -139.0,
"logps/rejected": -121.5,
"loss": 19.0742,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.0966796875,
"rewards/margins": 0.3359375,
"rewards/rejected": -0.431640625,
"step": 54
},
{
"epoch": 0.1277769711049804,
"grad_norm": 324.8966369628906,
"learning_rate": 1.7441860465116278e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.75,
"logps/chosen": -132.0,
"logps/rejected": -111.5,
"loss": 19.2002,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.2138671875,
"rewards/margins": 0.296875,
"rewards/rejected": -0.51171875,
"step": 55
},
{
"epoch": 0.1301001887614346,
"grad_norm": 357.81597900390625,
"learning_rate": 1.7395348837209301e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.7890625,
"logps/chosen": -133.0,
"logps/rejected": -136.0,
"loss": 19.1963,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.166015625,
"rewards/margins": 0.3046875,
"rewards/rejected": -0.470703125,
"step": 56
},
{
"epoch": 0.13242340641788877,
"grad_norm": 359.42279052734375,
"learning_rate": 1.7348837209302325e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.6796875,
"logps/chosen": -123.0,
"logps/rejected": -136.0,
"loss": 20.8135,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.1484375,
"rewards/margins": 0.21875,
"rewards/rejected": -0.3671875,
"step": 57
},
{
"epoch": 0.13474662407434296,
"grad_norm": 376.3425598144531,
"learning_rate": 1.7302325581395348e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.73828125,
"logps/chosen": -145.0,
"logps/rejected": -142.0,
"loss": 21.0859,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.126953125,
"rewards/margins": 0.20703125,
"rewards/rejected": -0.3359375,
"step": 58
},
{
"epoch": 0.13706984173079714,
"grad_norm": 276.28466796875,
"learning_rate": 1.7255813953488372e-06,
"logits/chosen": -0.6953125,
"logits/rejected": -0.7421875,
"logps/chosen": -133.0,
"logps/rejected": -132.0,
"loss": 16.6836,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.05712890625,
"rewards/margins": 0.515625,
"rewards/rejected": -0.45703125,
"step": 59
},
{
"epoch": 0.13939305938725136,
"grad_norm": 308.0601806640625,
"learning_rate": 1.7209302325581393e-06,
"logits/chosen": -0.7109375,
"logits/rejected": -0.765625,
"logps/chosen": -130.0,
"logps/rejected": -129.0,
"loss": 17.4619,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.031494140625,
"rewards/margins": 0.466796875,
"rewards/rejected": -0.435546875,
"step": 60
},
{
"epoch": 0.14171627704370554,
"grad_norm": 334.4534606933594,
"learning_rate": 1.7162790697674419e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.7421875,
"logps/chosen": -134.0,
"logps/rejected": -116.0,
"loss": 19.7373,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.09521484375,
"rewards/margins": 0.333984375,
"rewards/rejected": -0.4296875,
"step": 61
},
{
"epoch": 0.14403949470015973,
"grad_norm": 324.9841613769531,
"learning_rate": 1.711627906976744e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.74609375,
"logps/chosen": -157.0,
"logps/rejected": -122.0,
"loss": 18.4209,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.004669189453125,
"rewards/margins": 0.384765625,
"rewards/rejected": -0.37890625,
"step": 62
},
{
"epoch": 0.1463627123566139,
"grad_norm": 344.504638671875,
"learning_rate": 1.7069767441860466e-06,
"logits/chosen": -0.70703125,
"logits/rejected": -0.7265625,
"logps/chosen": -133.0,
"logps/rejected": -115.5,
"loss": 19.3184,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.158203125,
"rewards/margins": 0.31640625,
"rewards/rejected": -0.474609375,
"step": 63
},
{
"epoch": 0.1486859300130681,
"grad_norm": 323.4111328125,
"learning_rate": 1.7023255813953487e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.73046875,
"logps/chosen": -144.0,
"logps/rejected": -118.0,
"loss": 17.728,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.017578125,
"rewards/margins": 0.484375,
"rewards/rejected": -0.5,
"step": 64
},
{
"epoch": 0.15100914766952228,
"grad_norm": 301.9679870605469,
"learning_rate": 1.6976744186046509e-06,
"logits/chosen": -0.65234375,
"logits/rejected": -0.70703125,
"logps/chosen": -135.0,
"logps/rejected": -136.0,
"loss": 16.2197,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.01263427734375,
"rewards/margins": 0.53125,
"rewards/rejected": -0.51953125,
"step": 65
},
{
"epoch": 0.15333236532597647,
"grad_norm": 370.5312194824219,
"learning_rate": 1.6930232558139535e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.76171875,
"logps/chosen": -119.5,
"logps/rejected": -126.5,
"loss": 20.4912,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.349609375,
"rewards/margins": 0.1962890625,
"rewards/rejected": -0.546875,
"step": 66
},
{
"epoch": 0.15565558298243068,
"grad_norm": 341.2892150878906,
"learning_rate": 1.6883720930232556e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.79296875,
"logps/chosen": -119.0,
"logps/rejected": -128.0,
"loss": 19.6045,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.1416015625,
"rewards/margins": 0.330078125,
"rewards/rejected": -0.47265625,
"step": 67
},
{
"epoch": 0.15797880063888486,
"grad_norm": 331.32476806640625,
"learning_rate": 1.6837209302325582e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.77734375,
"logps/chosen": -141.0,
"logps/rejected": -116.5,
"loss": 17.0586,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.021728515625,
"rewards/margins": 0.53125,
"rewards/rejected": -0.55078125,
"step": 68
},
{
"epoch": 0.16030201829533905,
"grad_norm": 348.9662780761719,
"learning_rate": 1.6790697674418603e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.7265625,
"logps/chosen": -138.0,
"logps/rejected": -131.0,
"loss": 18.208,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0615234375,
"rewards/margins": 0.421875,
"rewards/rejected": -0.484375,
"step": 69
},
{
"epoch": 0.16262523595179323,
"grad_norm": 286.9308776855469,
"learning_rate": 1.6744186046511629e-06,
"logits/chosen": -0.67578125,
"logits/rejected": -0.671875,
"logps/chosen": -134.0,
"logps/rejected": -119.0,
"loss": 15.4043,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1142578125,
"rewards/margins": 0.6640625,
"rewards/rejected": -0.55078125,
"step": 70
},
{
"epoch": 0.16494845360824742,
"grad_norm": 400.8143615722656,
"learning_rate": 1.669767441860465e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.765625,
"logps/chosen": -122.0,
"logps/rejected": -148.0,
"loss": 20.6289,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.208984375,
"rewards/margins": 0.2734375,
"rewards/rejected": -0.482421875,
"step": 71
},
{
"epoch": 0.1672716712647016,
"grad_norm": 307.0199890136719,
"learning_rate": 1.6651162790697672e-06,
"logits/chosen": -0.7109375,
"logits/rejected": -0.703125,
"logps/chosen": -133.0,
"logps/rejected": -126.0,
"loss": 17.0361,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.014892578125,
"rewards/margins": 0.466796875,
"rewards/rejected": -0.48046875,
"step": 72
},
{
"epoch": 0.1695948889211558,
"grad_norm": 394.55084228515625,
"learning_rate": 1.6604651162790697e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.734375,
"logps/chosen": -127.5,
"logps/rejected": -128.0,
"loss": 20.4941,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.31640625,
"rewards/margins": 0.23046875,
"rewards/rejected": -0.546875,
"step": 73
},
{
"epoch": 0.17191810657761,
"grad_norm": 406.731201171875,
"learning_rate": 1.6558139534883719e-06,
"logits/chosen": -0.68359375,
"logits/rejected": -0.7109375,
"logps/chosen": -120.0,
"logps/rejected": -127.5,
"loss": 19.4707,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.166015625,
"rewards/margins": 0.328125,
"rewards/rejected": -0.494140625,
"step": 74
},
{
"epoch": 0.1742413242340642,
"grad_norm": 333.3077087402344,
"learning_rate": 1.6511627906976744e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.7578125,
"logps/chosen": -155.0,
"logps/rejected": -124.0,
"loss": 18.7402,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.2333984375,
"rewards/margins": 0.294921875,
"rewards/rejected": -0.52734375,
"step": 75
},
{
"epoch": 0.17656454189051837,
"grad_norm": 345.686279296875,
"learning_rate": 1.6465116279069766e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.78125,
"logps/chosen": -130.0,
"logps/rejected": -128.0,
"loss": 20.583,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.228515625,
"rewards/margins": 0.287109375,
"rewards/rejected": -0.515625,
"step": 76
},
{
"epoch": 0.17888775954697256,
"grad_norm": 315.1790466308594,
"learning_rate": 1.6418604651162792e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.7578125,
"logps/chosen": -130.0,
"logps/rejected": -108.5,
"loss": 16.7363,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.103515625,
"rewards/margins": 0.50390625,
"rewards/rejected": -0.60546875,
"step": 77
},
{
"epoch": 0.18121097720342674,
"grad_norm": 279.80206298828125,
"learning_rate": 1.6372093023255813e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.78125,
"logps/chosen": -132.0,
"logps/rejected": -108.0,
"loss": 16.207,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.07470703125,
"rewards/margins": 0.55859375,
"rewards/rejected": -0.6328125,
"step": 78
},
{
"epoch": 0.18353419485988093,
"grad_norm": 381.6708679199219,
"learning_rate": 1.6325581395348837e-06,
"logits/chosen": -0.69140625,
"logits/rejected": -0.69921875,
"logps/chosen": -152.0,
"logps/rejected": -150.0,
"loss": 18.6279,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.10791015625,
"rewards/margins": 0.419921875,
"rewards/rejected": -0.52734375,
"step": 79
},
{
"epoch": 0.1858574125163351,
"grad_norm": 309.5762634277344,
"learning_rate": 1.627906976744186e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.7890625,
"logps/chosen": -128.0,
"logps/rejected": -127.0,
"loss": 16.7793,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0576171875,
"rewards/margins": 0.5078125,
"rewards/rejected": -0.5625,
"step": 80
},
{
"epoch": 0.18818063017278933,
"grad_norm": 357.2296142578125,
"learning_rate": 1.6232558139534882e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.765625,
"logps/chosen": -141.0,
"logps/rejected": -158.0,
"loss": 20.2842,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0771484375,
"rewards/margins": 0.283203125,
"rewards/rejected": -0.359375,
"step": 81
},
{
"epoch": 0.1905038478292435,
"grad_norm": 361.9767761230469,
"learning_rate": 1.6186046511627907e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.7421875,
"logps/chosen": -153.0,
"logps/rejected": -131.0,
"loss": 20.2363,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0169677734375,
"rewards/margins": 0.298828125,
"rewards/rejected": -0.31640625,
"step": 82
},
{
"epoch": 0.1928270654856977,
"grad_norm": 300.6635437011719,
"learning_rate": 1.6139534883720929e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.765625,
"logps/chosen": -138.0,
"logps/rejected": -133.0,
"loss": 18.0459,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.06494140625,
"rewards/margins": 0.453125,
"rewards/rejected": -0.51953125,
"step": 83
},
{
"epoch": 0.19515028314215188,
"grad_norm": 317.6025390625,
"learning_rate": 1.6093023255813954e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.765625,
"logps/chosen": -123.5,
"logps/rejected": -119.0,
"loss": 18.7881,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.166015625,
"rewards/margins": 0.41015625,
"rewards/rejected": -0.57421875,
"step": 84
},
{
"epoch": 0.19747350079860607,
"grad_norm": 324.6422424316406,
"learning_rate": 1.6046511627906976e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.78515625,
"logps/chosen": -144.0,
"logps/rejected": -126.0,
"loss": 16.6187,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.134765625,
"rewards/margins": 0.5234375,
"rewards/rejected": -0.65625,
"step": 85
},
{
"epoch": 0.19979671845506025,
"grad_norm": 442.3411865234375,
"learning_rate": 1.6e-06,
"logits/chosen": -0.71875,
"logits/rejected": -0.703125,
"logps/chosen": -122.0,
"logps/rejected": -137.0,
"loss": 23.7383,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.1767578125,
"rewards/margins": 0.1103515625,
"rewards/rejected": -0.287109375,
"step": 86
},
{
"epoch": 0.20211993611151444,
"grad_norm": 386.96435546875,
"learning_rate": 1.5953488372093023e-06,
"logits/chosen": -0.7421875,
"logits/rejected": -0.75390625,
"logps/chosen": -128.0,
"logps/rejected": -140.0,
"loss": 16.4014,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0020904541015625,
"rewards/margins": 0.6015625,
"rewards/rejected": -0.59765625,
"step": 87
},
{
"epoch": 0.20444315376796865,
"grad_norm": 463.20635986328125,
"learning_rate": 1.5906976744186044e-06,
"logits/chosen": -0.8359375,
"logits/rejected": -0.76171875,
"logps/chosen": -123.0,
"logps/rejected": -148.0,
"loss": 22.9053,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.38671875,
"rewards/margins": 0.11669921875,
"rewards/rejected": -0.50390625,
"step": 88
},
{
"epoch": 0.20676637142442283,
"grad_norm": 373.3138427734375,
"learning_rate": 1.586046511627907e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.71484375,
"logps/chosen": -137.0,
"logps/rejected": -123.0,
"loss": 17.3862,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.201171875,
"rewards/margins": 0.546875,
"rewards/rejected": -0.74609375,
"step": 89
},
{
"epoch": 0.20908958908087702,
"grad_norm": 378.5066223144531,
"learning_rate": 1.5813953488372091e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.75,
"logps/chosen": -136.0,
"logps/rejected": -119.5,
"loss": 18.2598,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.208984375,
"rewards/margins": 0.36328125,
"rewards/rejected": -0.57421875,
"step": 90
},
{
"epoch": 0.2114128067373312,
"grad_norm": 348.6402282714844,
"learning_rate": 1.5767441860465117e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.7734375,
"logps/chosen": -130.0,
"logps/rejected": -132.0,
"loss": 17.7559,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0556640625,
"rewards/margins": 0.4453125,
"rewards/rejected": -0.5,
"step": 91
},
{
"epoch": 0.2137360243937854,
"grad_norm": 369.6512145996094,
"learning_rate": 1.5720930232558138e-06,
"logits/chosen": -0.70703125,
"logits/rejected": -0.70703125,
"logps/chosen": -150.0,
"logps/rejected": -130.0,
"loss": 20.6709,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.003204345703125,
"rewards/margins": 0.2890625,
"rewards/rejected": -0.28515625,
"step": 92
},
{
"epoch": 0.21605924205023957,
"grad_norm": 352.605224609375,
"learning_rate": 1.5674418604651162e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.71484375,
"logps/chosen": -140.0,
"logps/rejected": -115.5,
"loss": 18.3926,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1494140625,
"rewards/margins": 0.435546875,
"rewards/rejected": -0.5859375,
"step": 93
},
{
"epoch": 0.21838245970669376,
"grad_norm": 486.412109375,
"learning_rate": 1.5627906976744186e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.7578125,
"logps/chosen": -131.0,
"logps/rejected": -132.0,
"loss": 19.9014,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.09521484375,
"rewards/margins": 0.298828125,
"rewards/rejected": -0.39453125,
"step": 94
},
{
"epoch": 0.22070567736314797,
"grad_norm": 376.4161071777344,
"learning_rate": 1.558139534883721e-06,
"logits/chosen": -0.71484375,
"logits/rejected": -0.74609375,
"logps/chosen": -128.0,
"logps/rejected": -123.5,
"loss": 18.9131,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.1552734375,
"rewards/margins": 0.38671875,
"rewards/rejected": -0.54296875,
"step": 95
},
{
"epoch": 0.22302889501960216,
"grad_norm": 396.44061279296875,
"learning_rate": 1.5534883720930233e-06,
"logits/chosen": -0.69921875,
"logits/rejected": -0.69140625,
"logps/chosen": -122.5,
"logps/rejected": -139.0,
"loss": 21.1982,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.263671875,
"rewards/margins": 0.2119140625,
"rewards/rejected": -0.4765625,
"step": 96
},
{
"epoch": 0.22535211267605634,
"grad_norm": 340.9673156738281,
"learning_rate": 1.5488372093023254e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.75,
"logps/chosen": -127.5,
"logps/rejected": -127.0,
"loss": 19.959,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.1279296875,
"rewards/margins": 0.296875,
"rewards/rejected": -0.42578125,
"step": 97
},
{
"epoch": 0.22767533033251053,
"grad_norm": 338.022216796875,
"learning_rate": 1.5441860465116278e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.76953125,
"logps/chosen": -137.0,
"logps/rejected": -124.0,
"loss": 18.5508,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.16015625,
"rewards/margins": 0.390625,
"rewards/rejected": -0.55078125,
"step": 98
},
{
"epoch": 0.2299985479889647,
"grad_norm": 839.4739379882812,
"learning_rate": 1.5395348837209301e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.75,
"logps/chosen": -126.5,
"logps/rejected": -124.5,
"loss": 20.8574,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.2119140625,
"rewards/margins": 0.185546875,
"rewards/rejected": -0.3984375,
"step": 99
},
{
"epoch": 0.2323217656454189,
"grad_norm": 341.3218078613281,
"learning_rate": 1.5348837209302325e-06,
"logits/chosen": -0.72265625,
"logits/rejected": -0.78125,
"logps/chosen": -114.0,
"logps/rejected": -143.0,
"loss": 16.5,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0233154296875,
"rewards/margins": 0.57421875,
"rewards/rejected": -0.55078125,
"step": 100
},
{
"epoch": 0.23464498330187308,
"grad_norm": 346.95849609375,
"learning_rate": 1.5302325581395348e-06,
"logits/chosen": -0.71875,
"logits/rejected": -0.75,
"logps/chosen": -132.0,
"logps/rejected": -124.5,
"loss": 18.8315,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0247802734375,
"rewards/margins": 0.48828125,
"rewards/rejected": -0.515625,
"step": 101
},
{
"epoch": 0.2369682009583273,
"grad_norm": 293.3309326171875,
"learning_rate": 1.5255813953488372e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.734375,
"logps/chosen": -134.0,
"logps/rejected": -109.5,
"loss": 16.605,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.00069427490234375,
"rewards/margins": 0.55859375,
"rewards/rejected": -0.55859375,
"step": 102
},
{
"epoch": 0.23929141861478148,
"grad_norm": 308.8841857910156,
"learning_rate": 1.5209302325581395e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.78515625,
"logps/chosen": -129.0,
"logps/rejected": -130.0,
"loss": 17.4863,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0162353515625,
"rewards/margins": 0.494140625,
"rewards/rejected": -0.5078125,
"step": 103
},
{
"epoch": 0.24161463627123567,
"grad_norm": 359.3336486816406,
"learning_rate": 1.5162790697674417e-06,
"logits/chosen": -0.6796875,
"logits/rejected": -0.765625,
"logps/chosen": -140.0,
"logps/rejected": -135.0,
"loss": 18.2041,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.039794921875,
"rewards/margins": 0.462890625,
"rewards/rejected": -0.50390625,
"step": 104
},
{
"epoch": 0.24393785392768985,
"grad_norm": 357.3771667480469,
"learning_rate": 1.511627906976744e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.72265625,
"logps/chosen": -138.0,
"logps/rejected": -126.5,
"loss": 19.3569,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.034423828125,
"rewards/margins": 0.37109375,
"rewards/rejected": -0.404296875,
"step": 105
},
{
"epoch": 0.24626107158414404,
"grad_norm": 306.6966552734375,
"learning_rate": 1.5069767441860464e-06,
"logits/chosen": -0.69140625,
"logits/rejected": -0.75,
"logps/chosen": -133.0,
"logps/rejected": -116.5,
"loss": 15.3809,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.01092529296875,
"rewards/margins": 0.5859375,
"rewards/rejected": -0.59765625,
"step": 106
},
{
"epoch": 0.24858428924059822,
"grad_norm": 330.71868896484375,
"learning_rate": 1.5023255813953488e-06,
"logits/chosen": -0.71484375,
"logits/rejected": -0.734375,
"logps/chosen": -130.0,
"logps/rejected": -133.0,
"loss": 18.6147,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.00238037109375,
"rewards/margins": 0.44921875,
"rewards/rejected": -0.4453125,
"step": 107
},
{
"epoch": 0.25090750689705243,
"grad_norm": 315.73272705078125,
"learning_rate": 1.4976744186046511e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.80078125,
"logps/chosen": -148.0,
"logps/rejected": -137.0,
"loss": 17.1006,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.025634765625,
"rewards/margins": 0.486328125,
"rewards/rejected": -0.4609375,
"step": 108
},
{
"epoch": 0.2532307245535066,
"grad_norm": 322.492919921875,
"learning_rate": 1.4930232558139535e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.78515625,
"logps/chosen": -127.0,
"logps/rejected": -115.0,
"loss": 18.3628,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.00384521484375,
"rewards/margins": 0.40625,
"rewards/rejected": -0.41015625,
"step": 109
},
{
"epoch": 0.2555539422099608,
"grad_norm": 309.7414855957031,
"learning_rate": 1.4883720930232558e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.7109375,
"logps/chosen": -135.0,
"logps/rejected": -143.0,
"loss": 15.1797,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1357421875,
"rewards/margins": 0.6796875,
"rewards/rejected": -0.546875,
"step": 110
},
{
"epoch": 0.25787715986641496,
"grad_norm": 295.3927917480469,
"learning_rate": 1.4837209302325582e-06,
"logits/chosen": -0.671875,
"logits/rejected": -0.71484375,
"logps/chosen": -136.0,
"logps/rejected": -107.0,
"loss": 15.5156,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1982421875,
"rewards/margins": 0.67578125,
"rewards/rejected": -0.478515625,
"step": 111
},
{
"epoch": 0.2602003775228692,
"grad_norm": 448.44561767578125,
"learning_rate": 1.4790697674418603e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.7890625,
"logps/chosen": -123.0,
"logps/rejected": -133.0,
"loss": 20.8838,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.04150390625,
"rewards/margins": 0.3046875,
"rewards/rejected": -0.345703125,
"step": 112
},
{
"epoch": 0.2625235951793234,
"grad_norm": 313.7855529785156,
"learning_rate": 1.4744186046511627e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.78515625,
"logps/chosen": -136.0,
"logps/rejected": -122.5,
"loss": 14.2803,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1044921875,
"rewards/margins": 0.71484375,
"rewards/rejected": -0.61328125,
"step": 113
},
{
"epoch": 0.26484681283577755,
"grad_norm": 323.4468688964844,
"learning_rate": 1.469767441860465e-06,
"logits/chosen": -0.67578125,
"logits/rejected": -0.73828125,
"logps/chosen": -153.0,
"logps/rejected": -110.5,
"loss": 14.3198,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08984375,
"rewards/margins": 0.6796875,
"rewards/rejected": -0.58984375,
"step": 114
},
{
"epoch": 0.26717003049223176,
"grad_norm": 405.1533508300781,
"learning_rate": 1.4651162790697674e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.7421875,
"logps/chosen": -134.0,
"logps/rejected": -142.0,
"loss": 18.8086,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0260009765625,
"rewards/margins": 0.40625,
"rewards/rejected": -0.43359375,
"step": 115
},
{
"epoch": 0.2694932481486859,
"grad_norm": 321.9844970703125,
"learning_rate": 1.4604651162790697e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.76953125,
"logps/chosen": -132.0,
"logps/rejected": -130.0,
"loss": 17.3525,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0093994140625,
"rewards/margins": 0.48046875,
"rewards/rejected": -0.470703125,
"step": 116
},
{
"epoch": 0.27181646580514013,
"grad_norm": 314.1150207519531,
"learning_rate": 1.455813953488372e-06,
"logits/chosen": -0.6640625,
"logits/rejected": -0.72265625,
"logps/chosen": -138.0,
"logps/rejected": -129.0,
"loss": 15.6147,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09765625,
"rewards/margins": 0.65625,
"rewards/rejected": -0.55859375,
"step": 117
},
{
"epoch": 0.2741396834615943,
"grad_norm": 352.8371276855469,
"learning_rate": 1.4511627906976745e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.74609375,
"logps/chosen": -124.5,
"logps/rejected": -126.0,
"loss": 16.1631,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0400390625,
"rewards/margins": 0.54296875,
"rewards/rejected": -0.50390625,
"step": 118
},
{
"epoch": 0.2764629011180485,
"grad_norm": 332.5674133300781,
"learning_rate": 1.4465116279069766e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.76953125,
"logps/chosen": -132.0,
"logps/rejected": -138.0,
"loss": 19.4419,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.06494140625,
"rewards/margins": 0.359375,
"rewards/rejected": -0.423828125,
"step": 119
},
{
"epoch": 0.2787861187745027,
"grad_norm": 315.2549133300781,
"learning_rate": 1.441860465116279e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.76953125,
"logps/chosen": -143.0,
"logps/rejected": -118.0,
"loss": 17.2822,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.099609375,
"rewards/margins": 0.46875,
"rewards/rejected": -0.56640625,
"step": 120
},
{
"epoch": 0.28110933643095687,
"grad_norm": 478.6551818847656,
"learning_rate": 1.4372093023255813e-06,
"logits/chosen": -0.6953125,
"logits/rejected": -0.7578125,
"logps/chosen": -144.0,
"logps/rejected": -128.0,
"loss": 17.1152,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0625,
"rewards/margins": 0.5625,
"rewards/rejected": -0.498046875,
"step": 121
},
{
"epoch": 0.2834325540874111,
"grad_norm": 391.9820251464844,
"learning_rate": 1.4325581395348837e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.75390625,
"logps/chosen": -129.0,
"logps/rejected": -131.0,
"loss": 20.3496,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.0390625,
"rewards/margins": 0.3359375,
"rewards/rejected": -0.376953125,
"step": 122
},
{
"epoch": 0.28575577174386524,
"grad_norm": 303.6994934082031,
"learning_rate": 1.427906976744186e-06,
"logits/chosen": -0.67578125,
"logits/rejected": -0.75390625,
"logps/chosen": -143.0,
"logps/rejected": -120.5,
"loss": 13.2358,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1875,
"rewards/margins": 0.890625,
"rewards/rejected": -0.703125,
"step": 123
},
{
"epoch": 0.28807898940031945,
"grad_norm": 446.9607238769531,
"learning_rate": 1.4232558139534882e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.76171875,
"logps/chosen": -130.0,
"logps/rejected": -159.0,
"loss": 21.2852,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.197265625,
"rewards/margins": 0.306640625,
"rewards/rejected": -0.50390625,
"step": 124
},
{
"epoch": 0.2904022070567736,
"grad_norm": 445.76715087890625,
"learning_rate": 1.4186046511627907e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.79296875,
"logps/chosen": -138.0,
"logps/rejected": -137.0,
"loss": 21.9111,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.10302734375,
"rewards/margins": 0.1767578125,
"rewards/rejected": -0.279296875,
"step": 125
},
{
"epoch": 0.2927254247132278,
"grad_norm": 332.1394348144531,
"learning_rate": 1.4139534883720929e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.75390625,
"logps/chosen": -141.0,
"logps/rejected": -117.5,
"loss": 16.6499,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.02978515625,
"rewards/margins": 0.6328125,
"rewards/rejected": -0.6640625,
"step": 126
},
{
"epoch": 0.29504864236968203,
"grad_norm": 344.578857421875,
"learning_rate": 1.4093023255813954e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.75390625,
"logps/chosen": -162.0,
"logps/rejected": -116.0,
"loss": 17.2349,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.14453125,
"rewards/margins": 0.62109375,
"rewards/rejected": -0.4765625,
"step": 127
},
{
"epoch": 0.2973718600261362,
"grad_norm": 346.4666748046875,
"learning_rate": 1.4046511627906976e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.73828125,
"logps/chosen": -114.0,
"logps/rejected": -124.5,
"loss": 15.5078,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.032958984375,
"rewards/margins": 0.640625,
"rewards/rejected": -0.60546875,
"step": 128
},
{
"epoch": 0.2996950776825904,
"grad_norm": 299.059814453125,
"learning_rate": 1.4e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.78125,
"logps/chosen": -133.0,
"logps/rejected": -117.0,
"loss": 15.9556,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0213623046875,
"rewards/margins": 0.66796875,
"rewards/rejected": -0.6484375,
"step": 129
},
{
"epoch": 0.30201829533904456,
"grad_norm": 381.7353820800781,
"learning_rate": 1.3953488372093023e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.73046875,
"logps/chosen": -136.0,
"logps/rejected": -133.0,
"loss": 17.2666,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.045166015625,
"rewards/margins": 0.51171875,
"rewards/rejected": -0.5546875,
"step": 130
},
{
"epoch": 0.3043415129954988,
"grad_norm": 341.33587646484375,
"learning_rate": 1.3906976744186044e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.79296875,
"logps/chosen": -135.0,
"logps/rejected": -133.0,
"loss": 16.5908,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.034423828125,
"rewards/margins": 0.60546875,
"rewards/rejected": -0.5703125,
"step": 131
},
{
"epoch": 0.30666473065195293,
"grad_norm": 344.2981872558594,
"learning_rate": 1.386046511627907e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.75,
"logps/chosen": -124.0,
"logps/rejected": -125.5,
"loss": 17.6572,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1435546875,
"rewards/margins": 0.455078125,
"rewards/rejected": -0.59765625,
"step": 132
},
{
"epoch": 0.30898794830840715,
"grad_norm": 348.2516784667969,
"learning_rate": 1.3813953488372091e-06,
"logits/chosen": -0.71875,
"logits/rejected": -0.73046875,
"logps/chosen": -135.0,
"logps/rejected": -143.0,
"loss": 16.5669,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02734375,
"rewards/margins": 0.6875,
"rewards/rejected": -0.66015625,
"step": 133
},
{
"epoch": 0.31131116596486136,
"grad_norm": 362.1626892089844,
"learning_rate": 1.3767441860465117e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.80859375,
"logps/chosen": -127.0,
"logps/rejected": -129.0,
"loss": 18.2139,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.006195068359375,
"rewards/margins": 0.5234375,
"rewards/rejected": -0.515625,
"step": 134
},
{
"epoch": 0.3136343836213155,
"grad_norm": 353.5246887207031,
"learning_rate": 1.3720930232558139e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.7890625,
"logps/chosen": -141.0,
"logps/rejected": -121.5,
"loss": 13.8765,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.166015625,
"rewards/margins": 0.88671875,
"rewards/rejected": -0.71875,
"step": 135
},
{
"epoch": 0.31595760127776973,
"grad_norm": 372.60943603515625,
"learning_rate": 1.3674418604651162e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.80859375,
"logps/chosen": -140.0,
"logps/rejected": -115.0,
"loss": 17.5029,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1630859375,
"rewards/margins": 0.55859375,
"rewards/rejected": -0.39453125,
"step": 136
},
{
"epoch": 0.3182808189342239,
"grad_norm": 321.0161437988281,
"learning_rate": 1.3627906976744186e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.78125,
"logps/chosen": -134.0,
"logps/rejected": -121.5,
"loss": 18.1797,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.123046875,
"rewards/margins": 0.5,
"rewards/rejected": -0.625,
"step": 137
},
{
"epoch": 0.3206040365906781,
"grad_norm": 446.3941345214844,
"learning_rate": 1.3581395348837207e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.78125,
"logps/chosen": -124.5,
"logps/rejected": -136.0,
"loss": 20.2749,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.13671875,
"rewards/margins": 0.32421875,
"rewards/rejected": -0.4609375,
"step": 138
},
{
"epoch": 0.32292725424713226,
"grad_norm": 331.55670166015625,
"learning_rate": 1.3534883720930233e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.73046875,
"logps/chosen": -138.0,
"logps/rejected": -128.0,
"loss": 16.3931,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0022125244140625,
"rewards/margins": 0.66015625,
"rewards/rejected": -0.66015625,
"step": 139
},
{
"epoch": 0.32525047190358647,
"grad_norm": 352.9888000488281,
"learning_rate": 1.3488372093023254e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.81640625,
"logps/chosen": -129.0,
"logps/rejected": -132.0,
"loss": 16.7803,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.029052734375,
"rewards/margins": 0.60546875,
"rewards/rejected": -0.6328125,
"step": 140
},
{
"epoch": 0.3275736895600407,
"grad_norm": 406.76025390625,
"learning_rate": 1.344186046511628e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.78515625,
"logps/chosen": -159.0,
"logps/rejected": -124.5,
"loss": 20.5513,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1513671875,
"rewards/margins": 0.33984375,
"rewards/rejected": -0.490234375,
"step": 141
},
{
"epoch": 0.32989690721649484,
"grad_norm": 329.72747802734375,
"learning_rate": 1.3395348837209301e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.765625,
"logps/chosen": -131.0,
"logps/rejected": -131.0,
"loss": 15.2583,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.09716796875,
"rewards/margins": 0.6796875,
"rewards/rejected": -0.5859375,
"step": 142
},
{
"epoch": 0.33222012487294905,
"grad_norm": 353.4764709472656,
"learning_rate": 1.3348837209302327e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.8203125,
"logps/chosen": -138.0,
"logps/rejected": -126.0,
"loss": 15.2578,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1416015625,
"rewards/margins": 0.75390625,
"rewards/rejected": -0.61328125,
"step": 143
},
{
"epoch": 0.3345433425294032,
"grad_norm": 333.3570861816406,
"learning_rate": 1.3302325581395348e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.83203125,
"logps/chosen": -132.0,
"logps/rejected": -125.0,
"loss": 15.1777,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.11669921875,
"rewards/margins": 0.77734375,
"rewards/rejected": -0.66015625,
"step": 144
},
{
"epoch": 0.3368665601858574,
"grad_norm": 359.3620300292969,
"learning_rate": 1.325581395348837e-06,
"logits/chosen": -0.8203125,
"logits/rejected": -0.7890625,
"logps/chosen": -140.0,
"logps/rejected": -154.0,
"loss": 18.0942,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.04833984375,
"rewards/margins": 0.494140625,
"rewards/rejected": -0.4453125,
"step": 145
},
{
"epoch": 0.3391897778423116,
"grad_norm": 364.3636169433594,
"learning_rate": 1.3209302325581396e-06,
"logits/chosen": -0.7265625,
"logits/rejected": -0.76953125,
"logps/chosen": -127.5,
"logps/rejected": -113.5,
"loss": 18.7627,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.10791015625,
"rewards/margins": 0.46484375,
"rewards/rejected": -0.5703125,
"step": 146
},
{
"epoch": 0.3415129954987658,
"grad_norm": 402.0943908691406,
"learning_rate": 1.3162790697674417e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.69921875,
"logps/chosen": -132.0,
"logps/rejected": -137.0,
"loss": 16.6462,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.04541015625,
"rewards/margins": 0.6640625,
"rewards/rejected": -0.6171875,
"step": 147
},
{
"epoch": 0.34383621315522,
"grad_norm": 381.5396728515625,
"learning_rate": 1.3116279069767443e-06,
"logits/chosen": -0.80078125,
"logits/rejected": -0.83984375,
"logps/chosen": -128.0,
"logps/rejected": -130.0,
"loss": 17.2354,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.05078125,
"rewards/margins": 0.58984375,
"rewards/rejected": -0.5390625,
"step": 148
},
{
"epoch": 0.34615943081167416,
"grad_norm": 329.5745544433594,
"learning_rate": 1.3069767441860464e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.7890625,
"logps/chosen": -127.0,
"logps/rejected": -129.0,
"loss": 14.4468,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0140380859375,
"rewards/margins": 0.7109375,
"rewards/rejected": -0.6953125,
"step": 149
},
{
"epoch": 0.3484826484681284,
"grad_norm": 300.583740234375,
"learning_rate": 1.302325581395349e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.83984375,
"logps/chosen": -116.5,
"logps/rejected": -121.5,
"loss": 14.4277,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0400390625,
"rewards/margins": 0.77734375,
"rewards/rejected": -0.73828125,
"step": 150
},
{
"epoch": 0.35080586612458253,
"grad_norm": 334.9747619628906,
"learning_rate": 1.2976744186046511e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.75,
"logps/chosen": -137.0,
"logps/rejected": -123.0,
"loss": 14.1069,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.208984375,
"rewards/margins": 0.8515625,
"rewards/rejected": -0.64453125,
"step": 151
},
{
"epoch": 0.35312908378103675,
"grad_norm": 321.225341796875,
"learning_rate": 1.2930232558139533e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.77734375,
"logps/chosen": -122.0,
"logps/rejected": -124.5,
"loss": 16.7876,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.16015625,
"rewards/margins": 0.6640625,
"rewards/rejected": -0.50390625,
"step": 152
},
{
"epoch": 0.3554523014374909,
"grad_norm": 405.748291015625,
"learning_rate": 1.2883720930232558e-06,
"logits/chosen": -0.796875,
"logits/rejected": -0.78515625,
"logps/chosen": -121.5,
"logps/rejected": -126.0,
"loss": 20.0581,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0693359375,
"rewards/margins": 0.361328125,
"rewards/rejected": -0.291015625,
"step": 153
},
{
"epoch": 0.3577755190939451,
"grad_norm": 368.13897705078125,
"learning_rate": 1.283720930232558e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.7734375,
"logps/chosen": -129.0,
"logps/rejected": -126.0,
"loss": 17.3945,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.10205078125,
"rewards/margins": 0.5234375,
"rewards/rejected": -0.62890625,
"step": 154
},
{
"epoch": 0.36009873675039933,
"grad_norm": 350.93634033203125,
"learning_rate": 1.2790697674418605e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.8046875,
"logps/chosen": -132.0,
"logps/rejected": -117.0,
"loss": 16.8164,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1787109375,
"rewards/margins": 0.66796875,
"rewards/rejected": -0.48828125,
"step": 155
},
{
"epoch": 0.3624219544068535,
"grad_norm": 415.9078674316406,
"learning_rate": 1.2744186046511627e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.7734375,
"logps/chosen": -116.5,
"logps/rejected": -144.0,
"loss": 18.9238,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.09521484375,
"rewards/margins": 0.455078125,
"rewards/rejected": -0.361328125,
"step": 156
},
{
"epoch": 0.3647451720633077,
"grad_norm": 312.6370849609375,
"learning_rate": 1.269767441860465e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.79296875,
"logps/chosen": -110.5,
"logps/rejected": -138.0,
"loss": 15.6787,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0986328125,
"rewards/margins": 0.640625,
"rewards/rejected": -0.54296875,
"step": 157
},
{
"epoch": 0.36706838971976186,
"grad_norm": 382.05224609375,
"learning_rate": 1.2651162790697674e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.7578125,
"logps/chosen": -129.0,
"logps/rejected": -137.0,
"loss": 19.4893,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.045654296875,
"rewards/margins": 0.4375,
"rewards/rejected": -0.392578125,
"step": 158
},
{
"epoch": 0.36939160737621607,
"grad_norm": 310.7190856933594,
"learning_rate": 1.2604651162790697e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.81640625,
"logps/chosen": -135.0,
"logps/rejected": -138.0,
"loss": 13.9204,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.265625,
"rewards/margins": 0.859375,
"rewards/rejected": -0.58984375,
"step": 159
},
{
"epoch": 0.3717148250326702,
"grad_norm": 389.124267578125,
"learning_rate": 1.255813953488372e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.765625,
"logps/chosen": -129.0,
"logps/rejected": -152.0,
"loss": 20.2124,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0064697265625,
"rewards/margins": 0.3515625,
"rewards/rejected": -0.34375,
"step": 160
},
{
"epoch": 0.37403804268912444,
"grad_norm": 375.34124755859375,
"learning_rate": 1.2511627906976742e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.79296875,
"logps/chosen": -126.5,
"logps/rejected": -134.0,
"loss": 17.8145,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0242919921875,
"rewards/margins": 0.51171875,
"rewards/rejected": -0.48828125,
"step": 161
},
{
"epoch": 0.37636126034557865,
"grad_norm": 379.35711669921875,
"learning_rate": 1.2465116279069768e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.7578125,
"logps/chosen": -127.0,
"logps/rejected": -130.0,
"loss": 19.0,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.020263671875,
"rewards/margins": 0.37890625,
"rewards/rejected": -0.3984375,
"step": 162
},
{
"epoch": 0.3786844780020328,
"grad_norm": 381.5658264160156,
"learning_rate": 1.241860465116279e-06,
"logits/chosen": -0.73046875,
"logits/rejected": -0.7890625,
"logps/chosen": -125.5,
"logps/rejected": -128.0,
"loss": 15.1387,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.115234375,
"rewards/margins": 0.6796875,
"rewards/rejected": -0.5625,
"step": 163
},
{
"epoch": 0.381007695658487,
"grad_norm": 336.80560302734375,
"learning_rate": 1.2372093023255813e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.7421875,
"logps/chosen": -125.5,
"logps/rejected": -128.0,
"loss": 17.6543,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1962890625,
"rewards/margins": 0.55859375,
"rewards/rejected": -0.361328125,
"step": 164
},
{
"epoch": 0.3833309133149412,
"grad_norm": 372.18060302734375,
"learning_rate": 1.2325581395348837e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.7578125,
"logps/chosen": -126.5,
"logps/rejected": -122.5,
"loss": 18.4209,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0205078125,
"rewards/margins": 0.416015625,
"rewards/rejected": -0.4375,
"step": 165
},
{
"epoch": 0.3856541309713954,
"grad_norm": 344.254638671875,
"learning_rate": 1.227906976744186e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.78515625,
"logps/chosen": -127.5,
"logps/rejected": -133.0,
"loss": 15.5132,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2236328125,
"rewards/margins": 0.671875,
"rewards/rejected": -0.447265625,
"step": 166
},
{
"epoch": 0.38797734862784955,
"grad_norm": 341.03778076171875,
"learning_rate": 1.2232558139534884e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.74609375,
"logps/chosen": -127.0,
"logps/rejected": -126.5,
"loss": 14.437,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.259765625,
"rewards/margins": 0.7734375,
"rewards/rejected": -0.51171875,
"step": 167
},
{
"epoch": 0.39030056628430376,
"grad_norm": 390.4228515625,
"learning_rate": 1.2186046511627905e-06,
"logits/chosen": -0.8125,
"logits/rejected": -0.81640625,
"logps/chosen": -124.5,
"logps/rejected": -143.0,
"loss": 19.0215,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.02490234375,
"rewards/margins": 0.443359375,
"rewards/rejected": -0.41796875,
"step": 168
},
{
"epoch": 0.392623783940758,
"grad_norm": 351.5334167480469,
"learning_rate": 1.213953488372093e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.78515625,
"logps/chosen": -115.5,
"logps/rejected": -132.0,
"loss": 15.6899,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09765625,
"rewards/margins": 0.69140625,
"rewards/rejected": -0.59375,
"step": 169
},
{
"epoch": 0.39494700159721213,
"grad_norm": 328.7664794921875,
"learning_rate": 1.2093023255813952e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.79296875,
"logps/chosen": -120.5,
"logps/rejected": -121.5,
"loss": 16.6416,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.181640625,
"rewards/margins": 0.56640625,
"rewards/rejected": -0.384765625,
"step": 170
},
{
"epoch": 0.39727021925366635,
"grad_norm": 341.4001159667969,
"learning_rate": 1.2046511627906976e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.7734375,
"logps/chosen": -134.0,
"logps/rejected": -120.5,
"loss": 15.8726,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.263671875,
"rewards/margins": 0.734375,
"rewards/rejected": -0.47265625,
"step": 171
},
{
"epoch": 0.3995934369101205,
"grad_norm": 398.38494873046875,
"learning_rate": 1.2e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.8125,
"logps/chosen": -130.0,
"logps/rejected": -123.5,
"loss": 16.7817,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.06884765625,
"rewards/margins": 0.5625,
"rewards/rejected": -0.494140625,
"step": 172
},
{
"epoch": 0.4019166545665747,
"grad_norm": 317.2485046386719,
"learning_rate": 1.1953488372093023e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.796875,
"logps/chosen": -133.0,
"logps/rejected": -127.0,
"loss": 15.2124,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.3125,
"rewards/margins": 0.8046875,
"rewards/rejected": -0.4921875,
"step": 173
},
{
"epoch": 0.4042398722230289,
"grad_norm": 339.8619079589844,
"learning_rate": 1.1906976744186047e-06,
"logits/chosen": -0.796875,
"logits/rejected": -0.78125,
"logps/chosen": -129.0,
"logps/rejected": -129.0,
"loss": 15.6531,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.236328125,
"rewards/margins": 0.703125,
"rewards/rejected": -0.46875,
"step": 174
},
{
"epoch": 0.4065630898794831,
"grad_norm": 367.23388671875,
"learning_rate": 1.186046511627907e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.8125,
"logps/chosen": -138.0,
"logps/rejected": -121.0,
"loss": 16.7554,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.130859375,
"rewards/margins": 0.546875,
"rewards/rejected": -0.4140625,
"step": 175
},
{
"epoch": 0.4088863075359373,
"grad_norm": 408.7874755859375,
"learning_rate": 1.1813953488372092e-06,
"logits/chosen": -0.8046875,
"logits/rejected": -0.8125,
"logps/chosen": -138.0,
"logps/rejected": -107.5,
"loss": 15.5679,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2275390625,
"rewards/margins": 0.69140625,
"rewards/rejected": -0.462890625,
"step": 176
},
{
"epoch": 0.41120952519239146,
"grad_norm": 373.4058532714844,
"learning_rate": 1.1767441860465115e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.77734375,
"logps/chosen": -122.0,
"logps/rejected": -134.0,
"loss": 16.6733,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1015625,
"rewards/margins": 0.56640625,
"rewards/rejected": -0.46484375,
"step": 177
},
{
"epoch": 0.41353274284884567,
"grad_norm": 384.1882629394531,
"learning_rate": 1.1720930232558139e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.796875,
"logps/chosen": -120.5,
"logps/rejected": -128.0,
"loss": 18.0225,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0086669921875,
"rewards/margins": 0.482421875,
"rewards/rejected": -0.47265625,
"step": 178
},
{
"epoch": 0.4158559605052998,
"grad_norm": 424.3437805175781,
"learning_rate": 1.1674418604651162e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.7890625,
"logps/chosen": -145.0,
"logps/rejected": -166.0,
"loss": 14.7715,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1630859375,
"rewards/margins": 0.84765625,
"rewards/rejected": -0.68359375,
"step": 179
},
{
"epoch": 0.41817917816175404,
"grad_norm": 329.7294921875,
"learning_rate": 1.1627906976744186e-06,
"logits/chosen": -0.8515625,
"logits/rejected": -0.8515625,
"logps/chosen": -132.0,
"logps/rejected": -124.5,
"loss": 16.3423,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.057861328125,
"rewards/margins": 0.58203125,
"rewards/rejected": -0.640625,
"step": 180
},
{
"epoch": 0.4205023958182082,
"grad_norm": 365.58685302734375,
"learning_rate": 1.158139534883721e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.8203125,
"logps/chosen": -121.0,
"logps/rejected": -113.5,
"loss": 18.0498,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.05859375,
"rewards/margins": 0.48828125,
"rewards/rejected": -0.427734375,
"step": 181
},
{
"epoch": 0.4228256134746624,
"grad_norm": 369.9940185546875,
"learning_rate": 1.1534883720930233e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.796875,
"logps/chosen": -122.0,
"logps/rejected": -144.0,
"loss": 15.6062,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1943359375,
"rewards/margins": 0.76171875,
"rewards/rejected": -0.56640625,
"step": 182
},
{
"epoch": 0.4251488311311166,
"grad_norm": 310.1455078125,
"learning_rate": 1.1488372093023254e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.78125,
"logps/chosen": -118.5,
"logps/rejected": -112.5,
"loss": 14.6064,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07373046875,
"rewards/margins": 0.73046875,
"rewards/rejected": -0.65625,
"step": 183
},
{
"epoch": 0.4274720487875708,
"grad_norm": 396.49993896484375,
"learning_rate": 1.1441860465116278e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.83203125,
"logps/chosen": -142.0,
"logps/rejected": -133.0,
"loss": 18.1318,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.078125,
"rewards/margins": 0.55859375,
"rewards/rejected": -0.48046875,
"step": 184
},
{
"epoch": 0.429795266444025,
"grad_norm": 357.4013977050781,
"learning_rate": 1.1395348837209301e-06,
"logits/chosen": -0.75,
"logits/rejected": -0.79296875,
"logps/chosen": -154.0,
"logps/rejected": -125.5,
"loss": 16.7104,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.043701171875,
"rewards/margins": 0.5859375,
"rewards/rejected": -0.62890625,
"step": 185
},
{
"epoch": 0.43211848410047915,
"grad_norm": 444.602783203125,
"learning_rate": 1.1348837209302325e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.8203125,
"logps/chosen": -128.0,
"logps/rejected": -133.0,
"loss": 18.6221,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0225830078125,
"rewards/margins": 0.54296875,
"rewards/rejected": -0.51953125,
"step": 186
},
{
"epoch": 0.43444170175693336,
"grad_norm": 329.8465881347656,
"learning_rate": 1.1302325581395349e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.8046875,
"logps/chosen": -133.0,
"logps/rejected": -129.0,
"loss": 13.6592,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.142578125,
"rewards/margins": 0.875,
"rewards/rejected": -0.734375,
"step": 187
},
{
"epoch": 0.4367649194133875,
"grad_norm": 460.20770263671875,
"learning_rate": 1.1255813953488372e-06,
"logits/chosen": -0.78125,
"logits/rejected": -0.8046875,
"logps/chosen": -132.0,
"logps/rejected": -124.0,
"loss": 19.8032,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0498046875,
"rewards/margins": 0.51953125,
"rewards/rejected": -0.46875,
"step": 188
},
{
"epoch": 0.43908813706984173,
"grad_norm": 309.28607177734375,
"learning_rate": 1.1209302325581396e-06,
"logits/chosen": -0.8359375,
"logits/rejected": -0.80859375,
"logps/chosen": -129.0,
"logps/rejected": -121.5,
"loss": 12.8267,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.279296875,
"rewards/margins": 1.0,
"rewards/rejected": -0.72265625,
"step": 189
},
{
"epoch": 0.44141135472629595,
"grad_norm": 447.365966796875,
"learning_rate": 1.1162790697674417e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.8359375,
"logps/chosen": -141.0,
"logps/rejected": -138.0,
"loss": 16.2456,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.025146484375,
"rewards/margins": 0.671875,
"rewards/rejected": -0.64453125,
"step": 190
},
{
"epoch": 0.4437345723827501,
"grad_norm": 417.4530944824219,
"learning_rate": 1.1116279069767443e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.79296875,
"logps/chosen": -140.0,
"logps/rejected": -117.5,
"loss": 18.4092,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.08154296875,
"rewards/margins": 0.494140625,
"rewards/rejected": -0.57421875,
"step": 191
},
{
"epoch": 0.4460577900392043,
"grad_norm": 324.08355712890625,
"learning_rate": 1.1069767441860464e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.8125,
"logps/chosen": -144.0,
"logps/rejected": -141.0,
"loss": 13.7632,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.310546875,
"rewards/margins": 0.96484375,
"rewards/rejected": -0.65625,
"step": 192
},
{
"epoch": 0.4483810076956585,
"grad_norm": 342.5097961425781,
"learning_rate": 1.1023255813953488e-06,
"logits/chosen": -0.7734375,
"logits/rejected": -0.80859375,
"logps/chosen": -127.0,
"logps/rejected": -104.5,
"loss": 15.7559,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.048583984375,
"rewards/margins": 0.7578125,
"rewards/rejected": -0.70703125,
"step": 193
},
{
"epoch": 0.4507042253521127,
"grad_norm": 325.03057861328125,
"learning_rate": 1.0976744186046511e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.8359375,
"logps/chosen": -127.0,
"logps/rejected": -119.0,
"loss": 12.7759,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.33203125,
"rewards/margins": 0.953125,
"rewards/rejected": -0.62109375,
"step": 194
},
{
"epoch": 0.45302744300856684,
"grad_norm": 464.0077209472656,
"learning_rate": 1.0930232558139535e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.8046875,
"logps/chosen": -130.0,
"logps/rejected": -124.0,
"loss": 14.6401,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2734375,
"rewards/margins": 0.99609375,
"rewards/rejected": -0.72265625,
"step": 195
},
{
"epoch": 0.45535066066502106,
"grad_norm": 362.340087890625,
"learning_rate": 1.0883720930232558e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.77734375,
"logps/chosen": -125.5,
"logps/rejected": -147.0,
"loss": 14.5552,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.30078125,
"rewards/margins": 0.7890625,
"rewards/rejected": -0.490234375,
"step": 196
},
{
"epoch": 0.45767387832147527,
"grad_norm": 348.3215026855469,
"learning_rate": 1.083720930232558e-06,
"logits/chosen": -0.73828125,
"logits/rejected": -0.75390625,
"logps/chosen": -127.0,
"logps/rejected": -111.0,
"loss": 16.4644,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0018310546875,
"rewards/margins": 0.6640625,
"rewards/rejected": -0.66796875,
"step": 197
},
{
"epoch": 0.4599970959779294,
"grad_norm": 351.0652160644531,
"learning_rate": 1.0790697674418605e-06,
"logits/chosen": -0.8359375,
"logits/rejected": -0.80078125,
"logps/chosen": -141.0,
"logps/rejected": -136.0,
"loss": 14.1152,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10986328125,
"rewards/margins": 0.859375,
"rewards/rejected": -0.75,
"step": 198
},
{
"epoch": 0.46232031363438364,
"grad_norm": 357.92828369140625,
"learning_rate": 1.0744186046511627e-06,
"logits/chosen": -0.734375,
"logits/rejected": -0.8125,
"logps/chosen": -133.0,
"logps/rejected": -121.0,
"loss": 13.2341,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.369140625,
"rewards/margins": 0.94140625,
"rewards/rejected": -0.57421875,
"step": 199
},
{
"epoch": 0.4646435312908378,
"grad_norm": 343.2197265625,
"learning_rate": 1.069767441860465e-06,
"logits/chosen": -0.75390625,
"logits/rejected": -0.78125,
"logps/chosen": -139.0,
"logps/rejected": -119.0,
"loss": 14.146,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1943359375,
"rewards/margins": 0.921875,
"rewards/rejected": -0.73046875,
"step": 200
},
{
"epoch": 0.466966748947292,
"grad_norm": 545.7833862304688,
"learning_rate": 1.0651162790697674e-06,
"logits/chosen": -0.74609375,
"logits/rejected": -0.7578125,
"logps/chosen": -122.5,
"logps/rejected": -125.5,
"loss": 21.0857,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.05810546875,
"rewards/margins": 0.484375,
"rewards/rejected": -0.427734375,
"step": 201
},
{
"epoch": 0.46928996660374617,
"grad_norm": 369.3617248535156,
"learning_rate": 1.0604651162790695e-06,
"logits/chosen": -0.80859375,
"logits/rejected": -0.80859375,
"logps/chosen": -132.0,
"logps/rejected": -120.0,
"loss": 15.3125,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2080078125,
"rewards/margins": 0.734375,
"rewards/rejected": -0.52734375,
"step": 202
},
{
"epoch": 0.4716131842602004,
"grad_norm": 366.6146545410156,
"learning_rate": 1.0558139534883721e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.828125,
"logps/chosen": -129.0,
"logps/rejected": -122.0,
"loss": 16.0518,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.08740234375,
"rewards/margins": 0.6328125,
"rewards/rejected": -0.546875,
"step": 203
},
{
"epoch": 0.4739364019166546,
"grad_norm": 375.0671691894531,
"learning_rate": 1.0511627906976743e-06,
"logits/chosen": -0.77734375,
"logits/rejected": -0.81640625,
"logps/chosen": -148.0,
"logps/rejected": -131.0,
"loss": 17.3831,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2275390625,
"rewards/margins": 0.60546875,
"rewards/rejected": -0.37890625,
"step": 204
},
{
"epoch": 0.47625961957310875,
"grad_norm": 371.096435546875,
"learning_rate": 1.0465116279069768e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.73828125,
"logps/chosen": -107.5,
"logps/rejected": -117.0,
"loss": 17.873,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.369140625,
"rewards/margins": 0.5546875,
"rewards/rejected": -0.1865234375,
"step": 205
},
{
"epoch": 0.47858283722956296,
"grad_norm": 430.0856628417969,
"learning_rate": 1.041860465116279e-06,
"logits/chosen": -0.76171875,
"logits/rejected": -0.72265625,
"logps/chosen": -126.5,
"logps/rejected": -139.0,
"loss": 16.2949,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11328125,
"rewards/margins": 0.734375,
"rewards/rejected": -0.62109375,
"step": 206
},
{
"epoch": 0.4809060548860171,
"grad_norm": 341.1052551269531,
"learning_rate": 1.0372093023255815e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.8125,
"logps/chosen": -135.0,
"logps/rejected": -123.5,
"loss": 13.1196,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1865234375,
"rewards/margins": 0.91015625,
"rewards/rejected": -0.72265625,
"step": 207
},
{
"epoch": 0.48322927254247133,
"grad_norm": 346.2690734863281,
"learning_rate": 1.0325581395348837e-06,
"logits/chosen": -0.7890625,
"logits/rejected": -0.796875,
"logps/chosen": -140.0,
"logps/rejected": -127.0,
"loss": 15.2632,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.27734375,
"rewards/margins": 0.765625,
"rewards/rejected": -0.48828125,
"step": 208
},
{
"epoch": 0.4855524901989255,
"grad_norm": 368.310546875,
"learning_rate": 1.0279069767441858e-06,
"logits/chosen": -0.76953125,
"logits/rejected": -0.80859375,
"logps/chosen": -133.0,
"logps/rejected": -129.0,
"loss": 16.1709,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0908203125,
"rewards/margins": 0.71484375,
"rewards/rejected": -0.625,
"step": 209
},
{
"epoch": 0.4878757078553797,
"grad_norm": 361.7778625488281,
"learning_rate": 1.0232558139534884e-06,
"logits/chosen": -0.8515625,
"logits/rejected": -0.83203125,
"logps/chosen": -140.0,
"logps/rejected": -126.5,
"loss": 16.666,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.216796875,
"rewards/margins": 0.52734375,
"rewards/rejected": -0.310546875,
"step": 210
},
{
"epoch": 0.4901989255118339,
"grad_norm": 360.10772705078125,
"learning_rate": 1.0186046511627905e-06,
"logits/chosen": -0.78515625,
"logits/rejected": -0.81640625,
"logps/chosen": -127.0,
"logps/rejected": -139.0,
"loss": 14.7661,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.322265625,
"rewards/margins": 0.7890625,
"rewards/rejected": -0.466796875,
"step": 211
},
{
"epoch": 0.4925221431682881,
"grad_norm": 329.1163635253906,
"learning_rate": 1.013953488372093e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.77734375,
"logps/chosen": -119.5,
"logps/rejected": -133.0,
"loss": 13.1077,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.33984375,
"rewards/margins": 1.0078125,
"rewards/rejected": -0.66796875,
"step": 212
},
{
"epoch": 0.4948453608247423,
"grad_norm": 362.64532470703125,
"learning_rate": 1.0093023255813952e-06,
"logits/chosen": -0.7578125,
"logits/rejected": -0.77734375,
"logps/chosen": -134.0,
"logps/rejected": -117.0,
"loss": 12.6914,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.4296875,
"rewards/margins": 0.9921875,
"rewards/rejected": -0.5625,
"step": 213
},
{
"epoch": 0.49716857848119644,
"grad_norm": 330.487060546875,
"learning_rate": 1.0046511627906978e-06,
"logits/chosen": -0.79296875,
"logits/rejected": -0.86328125,
"logps/chosen": -127.5,
"logps/rejected": -114.0,
"loss": 12.9277,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.43359375,
"rewards/margins": 1.078125,
"rewards/rejected": -0.64453125,
"step": 214
},
{
"epoch": 0.49949179613765066,
"grad_norm": 339.9930725097656,
"learning_rate": 1e-06,
"logits/chosen": -0.828125,
"logits/rejected": -0.83203125,
"logps/chosen": -128.0,
"logps/rejected": -141.0,
"loss": 13.7705,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2294921875,
"rewards/margins": 0.90234375,
"rewards/rejected": -0.671875,
"step": 215
},
{
"epoch": 0.5018150137941049,
"grad_norm": 376.1474609375,
"learning_rate": 9.953488372093023e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.83203125,
"logps/chosen": -124.0,
"logps/rejected": -123.0,
"loss": 15.8398,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2431640625,
"rewards/margins": 0.73828125,
"rewards/rejected": -0.49609375,
"step": 216
},
{
"epoch": 0.504138231450559,
"grad_norm": 332.0564880371094,
"learning_rate": 9.906976744186047e-07,
"logits/chosen": -0.78515625,
"logits/rejected": -0.8203125,
"logps/chosen": -122.5,
"logps/rejected": -115.5,
"loss": 12.4272,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.298828125,
"rewards/margins": 1.015625,
"rewards/rejected": -0.7109375,
"step": 217
},
{
"epoch": 0.5064614491070132,
"grad_norm": 358.8477783203125,
"learning_rate": 9.86046511627907e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.80859375,
"logps/chosen": -123.0,
"logps/rejected": -144.0,
"loss": 15.3477,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.3203125,
"rewards/margins": 0.73828125,
"rewards/rejected": -0.41796875,
"step": 218
},
{
"epoch": 0.5087846667634675,
"grad_norm": 329.1252746582031,
"learning_rate": 9.813953488372092e-07,
"logits/chosen": -0.81640625,
"logits/rejected": -0.83984375,
"logps/chosen": -124.0,
"logps/rejected": -114.0,
"loss": 14.4053,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1845703125,
"rewards/margins": 0.76171875,
"rewards/rejected": -0.578125,
"step": 219
},
{
"epoch": 0.5111078844199216,
"grad_norm": 333.0457763671875,
"learning_rate": 9.767441860465115e-07,
"logits/chosen": -0.77734375,
"logits/rejected": -0.8125,
"logps/chosen": -136.0,
"logps/rejected": -125.5,
"loss": 14.3213,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.34375,
"rewards/margins": 0.88671875,
"rewards/rejected": -0.54296875,
"step": 220
},
{
"epoch": 0.5134311020763758,
"grad_norm": 371.3757019042969,
"learning_rate": 9.720930232558139e-07,
"logits/chosen": -0.76953125,
"logits/rejected": -0.796875,
"logps/chosen": -152.0,
"logps/rejected": -116.0,
"loss": 12.0801,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.361328125,
"rewards/margins": 1.1328125,
"rewards/rejected": -0.76953125,
"step": 221
},
{
"epoch": 0.5157543197328299,
"grad_norm": 422.3089599609375,
"learning_rate": 9.674418604651162e-07,
"logits/chosen": -0.78515625,
"logits/rejected": -0.87109375,
"logps/chosen": -133.0,
"logps/rejected": -114.5,
"loss": 11.6069,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.43359375,
"rewards/margins": 1.2265625,
"rewards/rejected": -0.7890625,
"step": 222
},
{
"epoch": 0.5180775373892842,
"grad_norm": 410.4743957519531,
"learning_rate": 9.627906976744186e-07,
"logits/chosen": -0.75390625,
"logits/rejected": -0.75,
"logps/chosen": -115.5,
"logps/rejected": -145.0,
"loss": 16.8779,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.11767578125,
"rewards/margins": 0.62109375,
"rewards/rejected": -0.50390625,
"step": 223
},
{
"epoch": 0.5204007550457384,
"grad_norm": 311.5373840332031,
"learning_rate": 9.58139534883721e-07,
"logits/chosen": -0.75390625,
"logits/rejected": -0.80078125,
"logps/chosen": -122.0,
"logps/rejected": -131.0,
"loss": 10.292,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.498046875,
"rewards/margins": 1.2890625,
"rewards/rejected": -0.7890625,
"step": 224
},
{
"epoch": 0.5227239727021925,
"grad_norm": 366.3830261230469,
"learning_rate": 9.534883720930232e-07,
"logits/chosen": -0.77734375,
"logits/rejected": -0.8125,
"logps/chosen": -134.0,
"logps/rejected": -132.0,
"loss": 17.2888,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2001953125,
"rewards/margins": 0.69921875,
"rewards/rejected": -0.5,
"step": 225
},
{
"epoch": 0.5250471903586468,
"grad_norm": 361.7061767578125,
"learning_rate": 9.488372093023255e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.8203125,
"logps/chosen": -143.0,
"logps/rejected": -133.0,
"loss": 14.6245,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2236328125,
"rewards/margins": 0.9140625,
"rewards/rejected": -0.6875,
"step": 226
},
{
"epoch": 0.5273704080151009,
"grad_norm": 289.1031494140625,
"learning_rate": 9.441860465116278e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.86328125,
"logps/chosen": -142.0,
"logps/rejected": -120.5,
"loss": 12.0532,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.357421875,
"rewards/margins": 1.0546875,
"rewards/rejected": -0.703125,
"step": 227
},
{
"epoch": 0.5296936256715551,
"grad_norm": 355.6830749511719,
"learning_rate": 9.395348837209302e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.81640625,
"logps/chosen": -132.0,
"logps/rejected": -143.0,
"loss": 14.6467,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1650390625,
"rewards/margins": 0.94140625,
"rewards/rejected": -0.77734375,
"step": 228
},
{
"epoch": 0.5320168433280092,
"grad_norm": 387.17864990234375,
"learning_rate": 9.348837209302325e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.77734375,
"logps/chosen": -139.0,
"logps/rejected": -137.0,
"loss": 15.71,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.271484375,
"rewards/margins": 0.796875,
"rewards/rejected": -0.5234375,
"step": 229
},
{
"epoch": 0.5343400609844635,
"grad_norm": 399.5079040527344,
"learning_rate": 9.302325581395349e-07,
"logits/chosen": -0.80078125,
"logits/rejected": -0.8515625,
"logps/chosen": -127.5,
"logps/rejected": -132.0,
"loss": 16.8394,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0732421875,
"rewards/margins": 0.8046875,
"rewards/rejected": -0.73046875,
"step": 230
},
{
"epoch": 0.5366632786409177,
"grad_norm": 360.01348876953125,
"learning_rate": 9.255813953488372e-07,
"logits/chosen": -0.76171875,
"logits/rejected": -0.78515625,
"logps/chosen": -133.0,
"logps/rejected": -126.0,
"loss": 12.9294,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.201171875,
"rewards/margins": 1.125,
"rewards/rejected": -0.921875,
"step": 231
},
{
"epoch": 0.5389864962973718,
"grad_norm": 427.7103271484375,
"learning_rate": 9.209302325581395e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.81640625,
"logps/chosen": -135.0,
"logps/rejected": -137.0,
"loss": 15.2183,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2294921875,
"rewards/margins": 0.94140625,
"rewards/rejected": -0.7109375,
"step": 232
},
{
"epoch": 0.5413097139538261,
"grad_norm": 412.2069091796875,
"learning_rate": 9.162790697674418e-07,
"logits/chosen": -0.76171875,
"logits/rejected": -0.82421875,
"logps/chosen": -122.5,
"logps/rejected": -118.5,
"loss": 13.958,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.298828125,
"rewards/margins": 0.9609375,
"rewards/rejected": -0.6640625,
"step": 233
},
{
"epoch": 0.5436329316102803,
"grad_norm": 363.20806884765625,
"learning_rate": 9.116279069767442e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.828125,
"logps/chosen": -124.0,
"logps/rejected": -132.0,
"loss": 14.4912,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.318359375,
"rewards/margins": 0.8671875,
"rewards/rejected": -0.55078125,
"step": 234
},
{
"epoch": 0.5459561492667344,
"grad_norm": 347.8995056152344,
"learning_rate": 9.069767441860464e-07,
"logits/chosen": -0.7734375,
"logits/rejected": -0.85546875,
"logps/chosen": -152.0,
"logps/rejected": -111.5,
"loss": 13.7517,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24609375,
"rewards/margins": 0.99609375,
"rewards/rejected": -0.75,
"step": 235
},
{
"epoch": 0.5482793669231886,
"grad_norm": 466.9878234863281,
"learning_rate": 9.023255813953488e-07,
"logits/chosen": -0.77734375,
"logits/rejected": -0.80859375,
"logps/chosen": -124.5,
"logps/rejected": -126.0,
"loss": 15.3323,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.30859375,
"rewards/margins": 0.9609375,
"rewards/rejected": -0.65234375,
"step": 236
},
{
"epoch": 0.5506025845796428,
"grad_norm": 300.74114990234375,
"learning_rate": 8.976744186046511e-07,
"logits/chosen": -0.78515625,
"logits/rejected": -0.7890625,
"logps/chosen": -143.0,
"logps/rejected": -122.5,
"loss": 10.8423,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.34375,
"rewards/margins": 1.21875,
"rewards/rejected": -0.875,
"step": 237
},
{
"epoch": 0.552925802236097,
"grad_norm": 392.69732666015625,
"learning_rate": 8.930232558139534e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.8125,
"logps/chosen": -136.0,
"logps/rejected": -144.0,
"loss": 13.8433,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1474609375,
"rewards/margins": 0.86328125,
"rewards/rejected": -0.71484375,
"step": 238
},
{
"epoch": 0.5552490198925512,
"grad_norm": 417.43267822265625,
"learning_rate": 8.883720930232557e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.78125,
"logps/chosen": -136.0,
"logps/rejected": -137.0,
"loss": 17.3145,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.004486083984375,
"rewards/margins": 0.6796875,
"rewards/rejected": -0.67578125,
"step": 239
},
{
"epoch": 0.5575722375490054,
"grad_norm": 454.0508728027344,
"learning_rate": 8.837209302325581e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.81640625,
"logps/chosen": -118.0,
"logps/rejected": -134.0,
"loss": 15.6741,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.265625,
"rewards/margins": 0.890625,
"rewards/rejected": -0.62890625,
"step": 240
},
{
"epoch": 0.5598954552054596,
"grad_norm": 406.51776123046875,
"learning_rate": 8.790697674418605e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.8359375,
"logps/chosen": -141.0,
"logps/rejected": -124.0,
"loss": 15.2039,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.34375,
"rewards/margins": 0.92578125,
"rewards/rejected": -0.58203125,
"step": 241
},
{
"epoch": 0.5622186728619137,
"grad_norm": 351.84161376953125,
"learning_rate": 8.744186046511628e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8515625,
"logps/chosen": -102.5,
"logps/rejected": -129.0,
"loss": 14.2102,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.236328125,
"rewards/margins": 0.83984375,
"rewards/rejected": -0.6015625,
"step": 242
},
{
"epoch": 0.5645418905183679,
"grad_norm": 320.64697265625,
"learning_rate": 8.697674418604651e-07,
"logits/chosen": -0.79296875,
"logits/rejected": -0.86328125,
"logps/chosen": -117.0,
"logps/rejected": -122.5,
"loss": 13.1212,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.27734375,
"rewards/margins": 1.03125,
"rewards/rejected": -0.75390625,
"step": 243
},
{
"epoch": 0.5668651081748222,
"grad_norm": 513.0429077148438,
"learning_rate": 8.651162790697674e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.80859375,
"logps/chosen": -142.0,
"logps/rejected": -132.0,
"loss": 16.1929,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.296875,
"rewards/margins": 0.78515625,
"rewards/rejected": -0.486328125,
"step": 244
},
{
"epoch": 0.5691883258312763,
"grad_norm": 381.1427307128906,
"learning_rate": 8.604651162790697e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.82421875,
"logps/chosen": -136.0,
"logps/rejected": -143.0,
"loss": 13.3257,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.29296875,
"rewards/margins": 1.09375,
"rewards/rejected": -0.796875,
"step": 245
},
{
"epoch": 0.5715115434877305,
"grad_norm": 387.599609375,
"learning_rate": 8.55813953488372e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.7890625,
"logps/chosen": -137.0,
"logps/rejected": -129.0,
"loss": 15.1045,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.32421875,
"rewards/margins": 0.796875,
"rewards/rejected": -0.474609375,
"step": 246
},
{
"epoch": 0.5738347611441847,
"grad_norm": 390.8743896484375,
"learning_rate": 8.511627906976744e-07,
"logits/chosen": -0.80078125,
"logits/rejected": -0.87109375,
"logps/chosen": -117.0,
"logps/rejected": -127.0,
"loss": 13.1274,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2314453125,
"rewards/margins": 1.03125,
"rewards/rejected": -0.80078125,
"step": 247
},
{
"epoch": 0.5761579788006389,
"grad_norm": 420.9767150878906,
"learning_rate": 8.465116279069767e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.80859375,
"logps/chosen": -124.5,
"logps/rejected": -155.0,
"loss": 16.0874,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.08251953125,
"rewards/margins": 0.59375,
"rewards/rejected": -0.51171875,
"step": 248
},
{
"epoch": 0.5784811964570931,
"grad_norm": 335.92889404296875,
"learning_rate": 8.418604651162791e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.84375,
"logps/chosen": -127.0,
"logps/rejected": -120.0,
"loss": 13.8997,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.216796875,
"rewards/margins": 0.83203125,
"rewards/rejected": -0.61328125,
"step": 249
},
{
"epoch": 0.5808044141135472,
"grad_norm": 404.8393249511719,
"learning_rate": 8.372093023255814e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.859375,
"logps/chosen": -145.0,
"logps/rejected": -122.5,
"loss": 12.1406,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2080078125,
"rewards/margins": 1.1171875,
"rewards/rejected": -0.91015625,
"step": 250
},
{
"epoch": 0.5831276317700015,
"grad_norm": 451.52215576171875,
"learning_rate": 8.325581395348836e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.8046875,
"logps/chosen": -130.0,
"logps/rejected": -136.0,
"loss": 16.7639,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.07666015625,
"rewards/margins": 0.76953125,
"rewards/rejected": -0.6953125,
"step": 251
},
{
"epoch": 0.5854508494264556,
"grad_norm": 417.9267272949219,
"learning_rate": 8.279069767441859e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.83203125,
"logps/chosen": -137.0,
"logps/rejected": -129.0,
"loss": 15.8306,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.126953125,
"rewards/margins": 0.82421875,
"rewards/rejected": -0.69921875,
"step": 252
},
{
"epoch": 0.5877740670829098,
"grad_norm": 612.1698608398438,
"learning_rate": 8.232558139534883e-07,
"logits/chosen": -0.79296875,
"logits/rejected": -0.8984375,
"logps/chosen": -151.0,
"logps/rejected": -116.5,
"loss": 16.5623,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.095703125,
"rewards/margins": 0.79296875,
"rewards/rejected": -0.69921875,
"step": 253
},
{
"epoch": 0.5900972847393641,
"grad_norm": 562.412841796875,
"learning_rate": 8.186046511627906e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.8359375,
"logps/chosen": -126.0,
"logps/rejected": -136.0,
"loss": 13.9282,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.341796875,
"rewards/margins": 0.87890625,
"rewards/rejected": -0.5390625,
"step": 254
},
{
"epoch": 0.5924205023958182,
"grad_norm": 406.9609069824219,
"learning_rate": 8.13953488372093e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.828125,
"logps/chosen": -111.5,
"logps/rejected": -125.0,
"loss": 17.4863,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.3359375,
"rewards/margins": 0.68359375,
"rewards/rejected": -0.349609375,
"step": 255
},
{
"epoch": 0.5947437200522724,
"grad_norm": 319.95379638671875,
"learning_rate": 8.093023255813954e-07,
"logits/chosen": -0.81640625,
"logits/rejected": -0.8515625,
"logps/chosen": -127.5,
"logps/rejected": -135.0,
"loss": 12.2905,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3125,
"rewards/margins": 1.1171875,
"rewards/rejected": -0.8046875,
"step": 256
},
{
"epoch": 0.5970669377087265,
"grad_norm": 390.3863830566406,
"learning_rate": 8.046511627906977e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.79296875,
"logps/chosen": -140.0,
"logps/rejected": -157.0,
"loss": 12.9624,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.361328125,
"rewards/margins": 1.078125,
"rewards/rejected": -0.71484375,
"step": 257
},
{
"epoch": 0.5993901553651808,
"grad_norm": 345.5944519042969,
"learning_rate": 8e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.8515625,
"logps/chosen": -123.5,
"logps/rejected": -128.0,
"loss": 12.6313,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.486328125,
"rewards/margins": 1.046875,
"rewards/rejected": -0.55859375,
"step": 258
},
{
"epoch": 0.601713373021635,
"grad_norm": 388.45977783203125,
"learning_rate": 7.953488372093022e-07,
"logits/chosen": -0.80078125,
"logits/rejected": -0.8046875,
"logps/chosen": -128.0,
"logps/rejected": -127.5,
"loss": 18.2397,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.064453125,
"rewards/margins": 0.671875,
"rewards/rejected": -0.609375,
"step": 259
},
{
"epoch": 0.6040365906780891,
"grad_norm": 361.9543151855469,
"learning_rate": 7.906976744186046e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.87109375,
"logps/chosen": -131.0,
"logps/rejected": -127.5,
"loss": 14.9993,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.33984375,
"rewards/margins": 0.8984375,
"rewards/rejected": -0.55859375,
"step": 260
},
{
"epoch": 0.6063598083345434,
"grad_norm": 364.9945068359375,
"learning_rate": 7.860465116279069e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.82421875,
"logps/chosen": -136.0,
"logps/rejected": -115.0,
"loss": 14.9531,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1318359375,
"rewards/margins": 0.94140625,
"rewards/rejected": -0.80859375,
"step": 261
},
{
"epoch": 0.6086830259909976,
"grad_norm": 347.11456298828125,
"learning_rate": 7.813953488372093e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.8515625,
"logps/chosen": -136.0,
"logps/rejected": -148.0,
"loss": 13.252,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.201171875,
"rewards/margins": 1.0,
"rewards/rejected": -0.796875,
"step": 262
},
{
"epoch": 0.6110062436474517,
"grad_norm": 344.5708923339844,
"learning_rate": 7.767441860465116e-07,
"logits/chosen": -0.78515625,
"logits/rejected": -0.80859375,
"logps/chosen": -144.0,
"logps/rejected": -136.0,
"loss": 12.5537,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.40234375,
"rewards/margins": 1.1171875,
"rewards/rejected": -0.71484375,
"step": 263
},
{
"epoch": 0.6133294613039059,
"grad_norm": 509.060546875,
"learning_rate": 7.720930232558139e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.8515625,
"logps/chosen": -124.5,
"logps/rejected": -128.0,
"loss": 19.3247,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.06396484375,
"rewards/margins": 0.486328125,
"rewards/rejected": -0.55078125,
"step": 264
},
{
"epoch": 0.6156526789603601,
"grad_norm": 385.6347961425781,
"learning_rate": 7.674418604651162e-07,
"logits/chosen": -0.74609375,
"logits/rejected": -0.81640625,
"logps/chosen": -140.0,
"logps/rejected": -129.0,
"loss": 12.175,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.423828125,
"rewards/margins": 1.1015625,
"rewards/rejected": -0.67578125,
"step": 265
},
{
"epoch": 0.6179758966168143,
"grad_norm": 498.9085693359375,
"learning_rate": 7.627906976744186e-07,
"logits/chosen": -0.7421875,
"logits/rejected": -0.8125,
"logps/chosen": -152.0,
"logps/rejected": -114.5,
"loss": 18.3779,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.36328125,
"rewards/margins": 0.63671875,
"rewards/rejected": -0.2734375,
"step": 266
},
{
"epoch": 0.6202991142732684,
"grad_norm": 372.6788024902344,
"learning_rate": 7.581395348837208e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.85546875,
"logps/chosen": -156.0,
"logps/rejected": -146.0,
"loss": 13.3494,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.33984375,
"rewards/margins": 0.93359375,
"rewards/rejected": -0.59375,
"step": 267
},
{
"epoch": 0.6226223319297227,
"grad_norm": 336.4404296875,
"learning_rate": 7.534883720930232e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.84765625,
"logps/chosen": -135.0,
"logps/rejected": -130.0,
"loss": 14.1318,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28125,
"rewards/margins": 0.765625,
"rewards/rejected": -0.482421875,
"step": 268
},
{
"epoch": 0.6249455495861769,
"grad_norm": 320.9569091796875,
"learning_rate": 7.488372093023256e-07,
"logits/chosen": -0.81640625,
"logits/rejected": -0.8359375,
"logps/chosen": -117.0,
"logps/rejected": -120.5,
"loss": 13.8899,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.349609375,
"rewards/margins": 1.015625,
"rewards/rejected": -0.66796875,
"step": 269
},
{
"epoch": 0.627268767242631,
"grad_norm": 370.9262390136719,
"learning_rate": 7.441860465116279e-07,
"logits/chosen": -0.7734375,
"logits/rejected": -0.84375,
"logps/chosen": -144.0,
"logps/rejected": -120.0,
"loss": 15.52,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.345703125,
"rewards/margins": 1.0390625,
"rewards/rejected": -0.6953125,
"step": 270
},
{
"epoch": 0.6295919848990852,
"grad_norm": 367.8063049316406,
"learning_rate": 7.395348837209302e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.83203125,
"logps/chosen": -137.0,
"logps/rejected": -130.0,
"loss": 12.3782,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.310546875,
"rewards/margins": 1.1328125,
"rewards/rejected": -0.82421875,
"step": 271
},
{
"epoch": 0.6319152025555395,
"grad_norm": 301.8444519042969,
"learning_rate": 7.348837209302325e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.84375,
"logps/chosen": -142.0,
"logps/rejected": -125.5,
"loss": 11.4189,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.53515625,
"rewards/margins": 1.171875,
"rewards/rejected": -0.63671875,
"step": 272
},
{
"epoch": 0.6342384202119936,
"grad_norm": 344.16143798828125,
"learning_rate": 7.302325581395349e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.8671875,
"logps/chosen": -129.0,
"logps/rejected": -117.5,
"loss": 13.3252,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.421875,
"rewards/margins": 1.0703125,
"rewards/rejected": -0.65234375,
"step": 273
},
{
"epoch": 0.6365616378684478,
"grad_norm": 368.489013671875,
"learning_rate": 7.255813953488372e-07,
"logits/chosen": -0.79296875,
"logits/rejected": -0.81640625,
"logps/chosen": -127.5,
"logps/rejected": -141.0,
"loss": 12.7842,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.34375,
"rewards/margins": 0.96484375,
"rewards/rejected": -0.62109375,
"step": 274
},
{
"epoch": 0.638884855524902,
"grad_norm": 365.506103515625,
"learning_rate": 7.209302325581395e-07,
"logits/chosen": -0.765625,
"logits/rejected": -0.8203125,
"logps/chosen": -122.0,
"logps/rejected": -139.0,
"loss": 13.6389,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.412109375,
"rewards/margins": 1.1953125,
"rewards/rejected": -0.7890625,
"step": 275
},
{
"epoch": 0.6412080731813562,
"grad_norm": 352.22149658203125,
"learning_rate": 7.162790697674418e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.82421875,
"logps/chosen": -133.0,
"logps/rejected": -126.5,
"loss": 15.0649,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.1982421875,
"rewards/margins": 0.8203125,
"rewards/rejected": -0.62109375,
"step": 276
},
{
"epoch": 0.6435312908378104,
"grad_norm": 391.1148376464844,
"learning_rate": 7.116279069767441e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.89453125,
"logps/chosen": -140.0,
"logps/rejected": -119.0,
"loss": 14.7524,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.310546875,
"rewards/margins": 0.8671875,
"rewards/rejected": -0.5546875,
"step": 277
},
{
"epoch": 0.6458545084942645,
"grad_norm": 473.5135192871094,
"learning_rate": 7.069767441860464e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.85546875,
"logps/chosen": -145.0,
"logps/rejected": -124.0,
"loss": 17.1322,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.279296875,
"rewards/margins": 0.6875,
"rewards/rejected": -0.41015625,
"step": 278
},
{
"epoch": 0.6481777261507188,
"grad_norm": 492.3699035644531,
"learning_rate": 7.023255813953488e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.8203125,
"logps/chosen": -135.0,
"logps/rejected": -127.5,
"loss": 17.5245,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.1533203125,
"rewards/margins": 0.84375,
"rewards/rejected": -0.69140625,
"step": 279
},
{
"epoch": 0.6505009438071729,
"grad_norm": 311.95196533203125,
"learning_rate": 6.976744186046511e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.84765625,
"logps/chosen": -118.5,
"logps/rejected": -134.0,
"loss": 10.3682,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.408203125,
"rewards/margins": 1.4921875,
"rewards/rejected": -1.0859375,
"step": 280
},
{
"epoch": 0.6528241614636271,
"grad_norm": 401.4697265625,
"learning_rate": 6.930232558139535e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.828125,
"logps/chosen": -123.0,
"logps/rejected": -127.5,
"loss": 15.7085,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.162109375,
"rewards/margins": 0.6796875,
"rewards/rejected": -0.515625,
"step": 281
},
{
"epoch": 0.6551473791200814,
"grad_norm": 343.4604797363281,
"learning_rate": 6.883720930232559e-07,
"logits/chosen": -0.77734375,
"logits/rejected": -0.82421875,
"logps/chosen": -133.0,
"logps/rejected": -128.0,
"loss": 12.6093,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.43359375,
"rewards/margins": 1.1328125,
"rewards/rejected": -0.703125,
"step": 282
},
{
"epoch": 0.6574705967765355,
"grad_norm": 415.1707763671875,
"learning_rate": 6.837209302325581e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.921875,
"logps/chosen": -143.0,
"logps/rejected": -118.5,
"loss": 15.4015,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2119140625,
"rewards/margins": 0.8203125,
"rewards/rejected": -0.60546875,
"step": 283
},
{
"epoch": 0.6597938144329897,
"grad_norm": 355.2691955566406,
"learning_rate": 6.790697674418604e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.8515625,
"logps/chosen": -121.0,
"logps/rejected": -129.0,
"loss": 13.1781,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2001953125,
"rewards/margins": 1.125,
"rewards/rejected": -0.92578125,
"step": 284
},
{
"epoch": 0.6621170320894438,
"grad_norm": 384.2412109375,
"learning_rate": 6.744186046511627e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.9140625,
"logps/chosen": -115.5,
"logps/rejected": -141.0,
"loss": 13.6726,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.466796875,
"rewards/margins": 1.2421875,
"rewards/rejected": -0.77734375,
"step": 285
},
{
"epoch": 0.6644402497458981,
"grad_norm": 376.3741760253906,
"learning_rate": 6.697674418604651e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.83203125,
"logps/chosen": -120.0,
"logps/rejected": -140.0,
"loss": 11.1071,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.369140625,
"rewards/margins": 1.265625,
"rewards/rejected": -0.89453125,
"step": 286
},
{
"epoch": 0.6667634674023523,
"grad_norm": 347.0726318359375,
"learning_rate": 6.651162790697674e-07,
"logits/chosen": -0.78125,
"logits/rejected": -0.84375,
"logps/chosen": -134.0,
"logps/rejected": -124.0,
"loss": 11.7656,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.369140625,
"rewards/margins": 1.2578125,
"rewards/rejected": -0.88671875,
"step": 287
},
{
"epoch": 0.6690866850588064,
"grad_norm": 383.8744812011719,
"learning_rate": 6.604651162790698e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.84765625,
"logps/chosen": -120.0,
"logps/rejected": -129.0,
"loss": 12.8174,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.193359375,
"rewards/margins": 0.96875,
"rewards/rejected": -0.77734375,
"step": 288
},
{
"epoch": 0.6714099027152607,
"grad_norm": 527.3011474609375,
"learning_rate": 6.558139534883721e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.78515625,
"logps/chosen": -133.0,
"logps/rejected": -143.0,
"loss": 16.5997,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.10107421875,
"rewards/margins": 1.015625,
"rewards/rejected": -0.9140625,
"step": 289
},
{
"epoch": 0.6737331203717148,
"grad_norm": 494.76416015625,
"learning_rate": 6.511627906976745e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.83203125,
"logps/chosen": -139.0,
"logps/rejected": -143.0,
"loss": 17.8811,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.154296875,
"rewards/margins": 0.66796875,
"rewards/rejected": -0.51171875,
"step": 290
},
{
"epoch": 0.676056338028169,
"grad_norm": 327.0135192871094,
"learning_rate": 6.465116279069766e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.8515625,
"logps/chosen": -118.5,
"logps/rejected": -131.0,
"loss": 12.48,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.61328125,
"rewards/margins": 1.125,
"rewards/rejected": -0.5078125,
"step": 291
},
{
"epoch": 0.6783795556846232,
"grad_norm": 452.2313537597656,
"learning_rate": 6.41860465116279e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.8671875,
"logps/chosen": -131.0,
"logps/rejected": -138.0,
"loss": 15.7837,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.275390625,
"rewards/margins": 0.7890625,
"rewards/rejected": -0.515625,
"step": 292
},
{
"epoch": 0.6807027733410774,
"grad_norm": 388.10711669921875,
"learning_rate": 6.372093023255813e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.8359375,
"logps/chosen": -134.0,
"logps/rejected": -134.0,
"loss": 14.0817,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.279296875,
"rewards/margins": 1.0234375,
"rewards/rejected": -0.74609375,
"step": 293
},
{
"epoch": 0.6830259909975316,
"grad_norm": 385.43841552734375,
"learning_rate": 6.325581395348837e-07,
"logits/chosen": -0.8046875,
"logits/rejected": -0.80078125,
"logps/chosen": -138.0,
"logps/rejected": -131.0,
"loss": 13.6246,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.373046875,
"rewards/margins": 1.0859375,
"rewards/rejected": -0.71484375,
"step": 294
},
{
"epoch": 0.6853492086539857,
"grad_norm": 378.17828369140625,
"learning_rate": 6.27906976744186e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.78515625,
"logps/chosen": -139.0,
"logps/rejected": -119.0,
"loss": 14.5515,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.337890625,
"rewards/margins": 0.9609375,
"rewards/rejected": -0.62109375,
"step": 295
},
{
"epoch": 0.68767242631044,
"grad_norm": 425.79541015625,
"learning_rate": 6.232558139534884e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.8359375,
"logps/chosen": -112.5,
"logps/rejected": -127.5,
"loss": 15.4453,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.216796875,
"rewards/margins": 0.85546875,
"rewards/rejected": -0.63671875,
"step": 296
},
{
"epoch": 0.6899956439668942,
"grad_norm": 355.3722229003906,
"learning_rate": 6.186046511627907e-07,
"logits/chosen": -0.91015625,
"logits/rejected": -0.890625,
"logps/chosen": -125.0,
"logps/rejected": -112.5,
"loss": 14.6904,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0966796875,
"rewards/margins": 0.89453125,
"rewards/rejected": -0.796875,
"step": 297
},
{
"epoch": 0.6923188616233483,
"grad_norm": 446.3829345703125,
"learning_rate": 6.13953488372093e-07,
"logits/chosen": -0.81640625,
"logits/rejected": -0.828125,
"logps/chosen": -132.0,
"logps/rejected": -121.0,
"loss": 14.7679,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.3671875,
"rewards/margins": 1.046875,
"rewards/rejected": -0.6796875,
"step": 298
},
{
"epoch": 0.6946420792798025,
"grad_norm": 335.9494934082031,
"learning_rate": 6.093023255813953e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.81640625,
"logps/chosen": -116.5,
"logps/rejected": -138.0,
"loss": 13.0884,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.373046875,
"rewards/margins": 1.140625,
"rewards/rejected": -0.765625,
"step": 299
},
{
"epoch": 0.6969652969362568,
"grad_norm": 363.8542785644531,
"learning_rate": 6.046511627906976e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.828125,
"logps/chosen": -136.0,
"logps/rejected": -136.0,
"loss": 13.2286,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.474609375,
"rewards/margins": 1.109375,
"rewards/rejected": -0.63671875,
"step": 300
},
{
"epoch": 0.6992885145927109,
"grad_norm": 400.0084228515625,
"learning_rate": 6e-07,
"logits/chosen": -0.90234375,
"logits/rejected": -0.859375,
"logps/chosen": -117.5,
"logps/rejected": -132.0,
"loss": 15.1213,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.46484375,
"rewards/margins": 0.9375,
"rewards/rejected": -0.47265625,
"step": 301
},
{
"epoch": 0.7016117322491651,
"grad_norm": 314.22222900390625,
"learning_rate": 5.953488372093023e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.86328125,
"logps/chosen": -126.0,
"logps/rejected": -128.0,
"loss": 10.8384,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.396484375,
"rewards/margins": 1.359375,
"rewards/rejected": -0.96484375,
"step": 302
},
{
"epoch": 0.7039349499056193,
"grad_norm": 351.50970458984375,
"learning_rate": 5.906976744186046e-07,
"logits/chosen": -0.7734375,
"logits/rejected": -0.81640625,
"logps/chosen": -141.0,
"logps/rejected": -124.0,
"loss": 9.9349,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.671875,
"rewards/margins": 1.640625,
"rewards/rejected": -0.96875,
"step": 303
},
{
"epoch": 0.7062581675620735,
"grad_norm": 476.5926513671875,
"learning_rate": 5.860465116279069e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.80078125,
"logps/chosen": -137.0,
"logps/rejected": -168.0,
"loss": 16.6069,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.1357421875,
"rewards/margins": 0.91015625,
"rewards/rejected": -0.7734375,
"step": 304
},
{
"epoch": 0.7085813852185276,
"grad_norm": 353.9723815917969,
"learning_rate": 5.813953488372093e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.84375,
"logps/chosen": -136.0,
"logps/rejected": -144.0,
"loss": 11.542,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.5703125,
"rewards/margins": 1.25,
"rewards/rejected": -0.6796875,
"step": 305
},
{
"epoch": 0.7109046028749818,
"grad_norm": 428.2142639160156,
"learning_rate": 5.767441860465116e-07,
"logits/chosen": -0.83984375,
"logits/rejected": -0.82421875,
"logps/chosen": -135.0,
"logps/rejected": -138.0,
"loss": 15.2681,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.26171875,
"rewards/margins": 1.0390625,
"rewards/rejected": -0.77734375,
"step": 306
},
{
"epoch": 0.7132278205314361,
"grad_norm": 391.52825927734375,
"learning_rate": 5.720930232558139e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.84375,
"logps/chosen": -147.0,
"logps/rejected": -122.5,
"loss": 15.5105,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.42578125,
"rewards/margins": 0.8984375,
"rewards/rejected": -0.47265625,
"step": 307
},
{
"epoch": 0.7155510381878902,
"grad_norm": 314.70806884765625,
"learning_rate": 5.674418604651162e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.84765625,
"logps/chosen": -125.0,
"logps/rejected": -149.0,
"loss": 12.5325,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.3046875,
"rewards/margins": 1.1953125,
"rewards/rejected": -0.88671875,
"step": 308
},
{
"epoch": 0.7178742558443444,
"grad_norm": 393.9562072753906,
"learning_rate": 5.627906976744186e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.87890625,
"logps/chosen": -131.0,
"logps/rejected": -130.0,
"loss": 13.47,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.314453125,
"rewards/margins": 1.0546875,
"rewards/rejected": -0.7421875,
"step": 309
},
{
"epoch": 0.7201974735007987,
"grad_norm": 400.5484313964844,
"learning_rate": 5.581395348837209e-07,
"logits/chosen": -0.81640625,
"logits/rejected": -0.84765625,
"logps/chosen": -113.0,
"logps/rejected": -127.5,
"loss": 13.4608,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.55078125,
"rewards/margins": 1.1171875,
"rewards/rejected": -0.5703125,
"step": 310
},
{
"epoch": 0.7225206911572528,
"grad_norm": 422.0895080566406,
"learning_rate": 5.534883720930232e-07,
"logits/chosen": -0.91015625,
"logits/rejected": -0.8671875,
"logps/chosen": -132.0,
"logps/rejected": -147.0,
"loss": 13.0371,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.27734375,
"rewards/margins": 1.0859375,
"rewards/rejected": -0.8125,
"step": 311
},
{
"epoch": 0.724843908813707,
"grad_norm": 412.68701171875,
"learning_rate": 5.488372093023256e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.86328125,
"logps/chosen": -134.0,
"logps/rejected": -133.0,
"loss": 14.7341,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.32421875,
"rewards/margins": 0.8203125,
"rewards/rejected": -0.49609375,
"step": 312
},
{
"epoch": 0.7271671264701611,
"grad_norm": 419.086181640625,
"learning_rate": 5.441860465116279e-07,
"logits/chosen": -0.79296875,
"logits/rejected": -0.796875,
"logps/chosen": -127.0,
"logps/rejected": -135.0,
"loss": 16.5369,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.306640625,
"rewards/margins": 0.90625,
"rewards/rejected": -0.6015625,
"step": 313
},
{
"epoch": 0.7294903441266154,
"grad_norm": 337.012939453125,
"learning_rate": 5.395348837209303e-07,
"logits/chosen": -0.89453125,
"logits/rejected": -0.8828125,
"logps/chosen": -152.0,
"logps/rejected": -117.0,
"loss": 12.7517,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.59765625,
"rewards/margins": 1.15625,
"rewards/rejected": -0.55859375,
"step": 314
},
{
"epoch": 0.7318135617830696,
"grad_norm": 365.5719909667969,
"learning_rate": 5.348837209302325e-07,
"logits/chosen": -0.79296875,
"logits/rejected": -0.8203125,
"logps/chosen": -154.0,
"logps/rejected": -137.0,
"loss": 11.0121,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.54296875,
"rewards/margins": 1.5546875,
"rewards/rejected": -1.015625,
"step": 315
},
{
"epoch": 0.7341367794395237,
"grad_norm": 565.3271484375,
"learning_rate": 5.302325581395348e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.82421875,
"logps/chosen": -121.0,
"logps/rejected": -139.0,
"loss": 14.5569,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.4609375,
"rewards/margins": 0.95703125,
"rewards/rejected": -0.4921875,
"step": 316
},
{
"epoch": 0.736459997095978,
"grad_norm": 336.31488037109375,
"learning_rate": 5.255813953488371e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.83203125,
"logps/chosen": -127.5,
"logps/rejected": -126.5,
"loss": 14.0077,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.228515625,
"rewards/margins": 1.1953125,
"rewards/rejected": -0.96484375,
"step": 317
},
{
"epoch": 0.7387832147524321,
"grad_norm": 331.0687561035156,
"learning_rate": 5.209302325581395e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.85546875,
"logps/chosen": -136.0,
"logps/rejected": -130.0,
"loss": 10.2217,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.5546875,
"rewards/margins": 1.6015625,
"rewards/rejected": -1.046875,
"step": 318
},
{
"epoch": 0.7411064324088863,
"grad_norm": 337.7515869140625,
"learning_rate": 5.162790697674418e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.85546875,
"logps/chosen": -134.0,
"logps/rejected": -141.0,
"loss": 10.2466,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.6171875,
"rewards/margins": 1.3828125,
"rewards/rejected": -0.76953125,
"step": 319
},
{
"epoch": 0.7434296500653405,
"grad_norm": 439.6629333496094,
"learning_rate": 5.116279069767442e-07,
"logits/chosen": -0.90625,
"logits/rejected": -0.90625,
"logps/chosen": -111.0,
"logps/rejected": -143.0,
"loss": 14.8419,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.275390625,
"rewards/margins": 0.96875,
"rewards/rejected": -0.6953125,
"step": 320
},
{
"epoch": 0.7457528677217947,
"grad_norm": 315.7960510253906,
"learning_rate": 5.069767441860466e-07,
"logits/chosen": -0.78125,
"logits/rejected": -0.80859375,
"logps/chosen": -123.0,
"logps/rejected": -134.0,
"loss": 10.7461,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.703125,
"rewards/margins": 1.390625,
"rewards/rejected": -0.68359375,
"step": 321
},
{
"epoch": 0.7480760853782489,
"grad_norm": 443.8883361816406,
"learning_rate": 5.023255813953489e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.8828125,
"logps/chosen": -139.0,
"logps/rejected": -133.0,
"loss": 13.2231,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.306640625,
"rewards/margins": 1.1328125,
"rewards/rejected": -0.82421875,
"step": 322
},
{
"epoch": 0.750399303034703,
"grad_norm": 381.8203430175781,
"learning_rate": 4.976744186046512e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.84375,
"logps/chosen": -136.0,
"logps/rejected": -131.0,
"loss": 14.0621,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.412109375,
"rewards/margins": 1.1640625,
"rewards/rejected": -0.7578125,
"step": 323
},
{
"epoch": 0.7527225206911573,
"grad_norm": 361.1136779785156,
"learning_rate": 4.930232558139535e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.84765625,
"logps/chosen": -132.0,
"logps/rejected": -132.0,
"loss": 13.6553,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.3203125,
"rewards/margins": 1.2109375,
"rewards/rejected": -0.88671875,
"step": 324
},
{
"epoch": 0.7550457383476115,
"grad_norm": 307.30291748046875,
"learning_rate": 4.883720930232558e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8515625,
"logps/chosen": -122.5,
"logps/rejected": -140.0,
"loss": 8.7594,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.55859375,
"rewards/margins": 1.609375,
"rewards/rejected": -1.046875,
"step": 325
},
{
"epoch": 0.7573689560040656,
"grad_norm": 372.7316589355469,
"learning_rate": 4.837209302325581e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.80859375,
"logps/chosen": -133.0,
"logps/rejected": -120.0,
"loss": 12.6277,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.33984375,
"rewards/margins": 1.1875,
"rewards/rejected": -0.84375,
"step": 326
},
{
"epoch": 0.7596921736605198,
"grad_norm": 349.4411926269531,
"learning_rate": 4.790697674418605e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.8359375,
"logps/chosen": -140.0,
"logps/rejected": -130.0,
"loss": 12.8553,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1787109375,
"rewards/margins": 1.109375,
"rewards/rejected": -0.92578125,
"step": 327
},
{
"epoch": 0.762015391316974,
"grad_norm": 353.19378662109375,
"learning_rate": 4.7441860465116277e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.859375,
"logps/chosen": -133.0,
"logps/rejected": -148.0,
"loss": 12.5149,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.328125,
"rewards/margins": 1.09375,
"rewards/rejected": -0.76171875,
"step": 328
},
{
"epoch": 0.7643386089734282,
"grad_norm": 523.6749267578125,
"learning_rate": 4.697674418604651e-07,
"logits/chosen": -0.88671875,
"logits/rejected": -0.9140625,
"logps/chosen": -133.0,
"logps/rejected": -125.0,
"loss": 16.2698,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.10595703125,
"rewards/margins": 0.80859375,
"rewards/rejected": -0.703125,
"step": 329
},
{
"epoch": 0.7666618266298824,
"grad_norm": 528.6472778320312,
"learning_rate": 4.6511627906976743e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.85546875,
"logps/chosen": -134.0,
"logps/rejected": -150.0,
"loss": 14.6694,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.09033203125,
"rewards/margins": 0.86328125,
"rewards/rejected": -0.7734375,
"step": 330
},
{
"epoch": 0.7689850442863366,
"grad_norm": 313.93438720703125,
"learning_rate": 4.6046511627906973e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.8671875,
"logps/chosen": -123.0,
"logps/rejected": -122.0,
"loss": 11.8145,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0341796875,
"rewards/margins": 1.171875,
"rewards/rejected": -1.140625,
"step": 331
},
{
"epoch": 0.7713082619427908,
"grad_norm": 389.487548828125,
"learning_rate": 4.558139534883721e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.85546875,
"logps/chosen": -150.0,
"logps/rejected": -122.5,
"loss": 15.3645,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.36328125,
"rewards/margins": 0.8359375,
"rewards/rejected": -0.47265625,
"step": 332
},
{
"epoch": 0.7736314795992449,
"grad_norm": 380.62176513671875,
"learning_rate": 4.511627906976744e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.890625,
"logps/chosen": -124.5,
"logps/rejected": -129.0,
"loss": 14.4519,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3125,
"rewards/margins": 0.98828125,
"rewards/rejected": -0.67578125,
"step": 333
},
{
"epoch": 0.7759546972556991,
"grad_norm": 415.103271484375,
"learning_rate": 4.465116279069767e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.85546875,
"logps/chosen": -141.0,
"logps/rejected": -150.0,
"loss": 16.2168,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.310546875,
"rewards/margins": 0.6953125,
"rewards/rejected": -0.38671875,
"step": 334
},
{
"epoch": 0.7782779149121534,
"grad_norm": 305.7278747558594,
"learning_rate": 4.4186046511627905e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.84765625,
"logps/chosen": -117.5,
"logps/rejected": -136.0,
"loss": 11.343,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.490234375,
"rewards/margins": 1.1640625,
"rewards/rejected": -0.671875,
"step": 335
},
{
"epoch": 0.7806011325686075,
"grad_norm": 395.62188720703125,
"learning_rate": 4.372093023255814e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.8359375,
"logps/chosen": -132.0,
"logps/rejected": -133.0,
"loss": 13.4861,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.32421875,
"rewards/margins": 1.0,
"rewards/rejected": -0.67578125,
"step": 336
},
{
"epoch": 0.7829243502250617,
"grad_norm": 344.2076721191406,
"learning_rate": 4.325581395348837e-07,
"logits/chosen": -0.765625,
"logits/rejected": -0.83203125,
"logps/chosen": -119.0,
"logps/rejected": -123.0,
"loss": 10.615,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.5703125,
"rewards/margins": 1.4140625,
"rewards/rejected": -0.84375,
"step": 337
},
{
"epoch": 0.785247567881516,
"grad_norm": 415.8197937011719,
"learning_rate": 4.27906976744186e-07,
"logits/chosen": -0.81640625,
"logits/rejected": -0.82421875,
"logps/chosen": -124.5,
"logps/rejected": -130.0,
"loss": 13.9437,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2353515625,
"rewards/margins": 1.1640625,
"rewards/rejected": -0.92578125,
"step": 338
},
{
"epoch": 0.7875707855379701,
"grad_norm": 395.5925598144531,
"learning_rate": 4.2325581395348836e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.890625,
"logps/chosen": -126.0,
"logps/rejected": -125.0,
"loss": 17.0851,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.17578125,
"rewards/margins": 0.609375,
"rewards/rejected": -0.431640625,
"step": 339
},
{
"epoch": 0.7898940031944243,
"grad_norm": 383.22491455078125,
"learning_rate": 4.186046511627907e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.91015625,
"logps/chosen": -120.0,
"logps/rejected": -122.0,
"loss": 14.2013,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.287109375,
"rewards/margins": 0.9296875,
"rewards/rejected": -0.64453125,
"step": 340
},
{
"epoch": 0.7922172208508784,
"grad_norm": 465.37054443359375,
"learning_rate": 4.1395348837209297e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.84765625,
"logps/chosen": -122.0,
"logps/rejected": -148.0,
"loss": 14.8139,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.59375,
"rewards/margins": 1.0859375,
"rewards/rejected": -0.49609375,
"step": 341
},
{
"epoch": 0.7945404385073327,
"grad_norm": 355.3705139160156,
"learning_rate": 4.093023255813953e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.8359375,
"logps/chosen": -138.0,
"logps/rejected": -144.0,
"loss": 12.0349,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.416015625,
"rewards/margins": 1.28125,
"rewards/rejected": -0.86328125,
"step": 342
},
{
"epoch": 0.7968636561637868,
"grad_norm": 389.9146728515625,
"learning_rate": 4.046511627906977e-07,
"logits/chosen": -0.88671875,
"logits/rejected": -0.8515625,
"logps/chosen": -123.0,
"logps/rejected": -119.5,
"loss": 15.8198,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.32421875,
"rewards/margins": 0.921875,
"rewards/rejected": -0.59375,
"step": 343
},
{
"epoch": 0.799186873820241,
"grad_norm": 367.7712707519531,
"learning_rate": 4e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.83984375,
"logps/chosen": -143.0,
"logps/rejected": -134.0,
"loss": 12.8025,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.396484375,
"rewards/margins": 1.15625,
"rewards/rejected": -0.76171875,
"step": 344
},
{
"epoch": 0.8015100914766953,
"grad_norm": 416.6552734375,
"learning_rate": 3.953488372093023e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.86328125,
"logps/chosen": -152.0,
"logps/rejected": -128.0,
"loss": 13.7512,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3671875,
"rewards/margins": 1.046875,
"rewards/rejected": -0.6796875,
"step": 345
},
{
"epoch": 0.8038333091331494,
"grad_norm": 402.32452392578125,
"learning_rate": 3.9069767441860464e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.8984375,
"logps/chosen": -133.0,
"logps/rejected": -126.0,
"loss": 14.7258,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2138671875,
"rewards/margins": 1.2265625,
"rewards/rejected": -1.015625,
"step": 346
},
{
"epoch": 0.8061565267896036,
"grad_norm": 414.1297607421875,
"learning_rate": 3.8604651162790694e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.85546875,
"logps/chosen": -129.0,
"logps/rejected": -134.0,
"loss": 12.463,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.54296875,
"rewards/margins": 1.203125,
"rewards/rejected": -0.65625,
"step": 347
},
{
"epoch": 0.8084797444460577,
"grad_norm": 489.4559631347656,
"learning_rate": 3.813953488372093e-07,
"logits/chosen": -0.78515625,
"logits/rejected": -0.75390625,
"logps/chosen": -114.0,
"logps/rejected": -150.0,
"loss": 14.2197,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.24609375,
"rewards/margins": 1.1328125,
"rewards/rejected": -0.8828125,
"step": 348
},
{
"epoch": 0.810802962102512,
"grad_norm": 359.0513610839844,
"learning_rate": 3.767441860465116e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.890625,
"logps/chosen": -122.5,
"logps/rejected": -119.0,
"loss": 12.5353,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.318359375,
"rewards/margins": 1.2109375,
"rewards/rejected": -0.890625,
"step": 349
},
{
"epoch": 0.8131261797589662,
"grad_norm": 373.05609130859375,
"learning_rate": 3.7209302325581396e-07,
"logits/chosen": -0.90625,
"logits/rejected": -0.8671875,
"logps/chosen": -127.0,
"logps/rejected": -129.0,
"loss": 12.506,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.30859375,
"rewards/margins": 1.2578125,
"rewards/rejected": -0.953125,
"step": 350
},
{
"epoch": 0.8154493974154203,
"grad_norm": 456.4620666503906,
"learning_rate": 3.6744186046511626e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.89453125,
"logps/chosen": -137.0,
"logps/rejected": -131.0,
"loss": 14.227,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.357421875,
"rewards/margins": 1.1796875,
"rewards/rejected": -0.82421875,
"step": 351
},
{
"epoch": 0.8177726150718746,
"grad_norm": 366.9906921386719,
"learning_rate": 3.627906976744186e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.85546875,
"logps/chosen": -136.0,
"logps/rejected": -137.0,
"loss": 13.6667,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1298828125,
"rewards/margins": 1.0390625,
"rewards/rejected": -0.9140625,
"step": 352
},
{
"epoch": 0.8200958327283288,
"grad_norm": 344.71661376953125,
"learning_rate": 3.581395348837209e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.875,
"logps/chosen": -139.0,
"logps/rejected": -122.5,
"loss": 11.369,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.66796875,
"rewards/margins": 1.3671875,
"rewards/rejected": -0.703125,
"step": 353
},
{
"epoch": 0.8224190503847829,
"grad_norm": 364.9308166503906,
"learning_rate": 3.534883720930232e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.89453125,
"logps/chosen": -120.0,
"logps/rejected": -126.5,
"loss": 14.8368,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.271484375,
"rewards/margins": 0.96875,
"rewards/rejected": -0.6953125,
"step": 354
},
{
"epoch": 0.8247422680412371,
"grad_norm": 478.8648376464844,
"learning_rate": 3.4883720930232557e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.86328125,
"logps/chosen": -130.0,
"logps/rejected": -120.5,
"loss": 17.2244,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.30859375,
"rewards/margins": 1.015625,
"rewards/rejected": -0.7109375,
"step": 355
},
{
"epoch": 0.8270654856976913,
"grad_norm": 376.8917236328125,
"learning_rate": 3.4418604651162793e-07,
"logits/chosen": -0.80859375,
"logits/rejected": -0.86328125,
"logps/chosen": -145.0,
"logps/rejected": -120.5,
"loss": 13.5175,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.412109375,
"rewards/margins": 1.125,
"rewards/rejected": -0.71484375,
"step": 356
},
{
"epoch": 0.8293887033541455,
"grad_norm": 364.0615234375,
"learning_rate": 3.395348837209302e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.875,
"logps/chosen": -116.0,
"logps/rejected": -121.5,
"loss": 12.5255,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.55078125,
"rewards/margins": 1.3359375,
"rewards/rejected": -0.7890625,
"step": 357
},
{
"epoch": 0.8317119210105997,
"grad_norm": 353.6752624511719,
"learning_rate": 3.3488372093023253e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.875,
"logps/chosen": -119.0,
"logps/rejected": -117.0,
"loss": 12.7742,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.423828125,
"rewards/margins": 1.3203125,
"rewards/rejected": -0.8984375,
"step": 358
},
{
"epoch": 0.8340351386670539,
"grad_norm": 373.83966064453125,
"learning_rate": 3.302325581395349e-07,
"logits/chosen": -0.890625,
"logits/rejected": -0.88671875,
"logps/chosen": -127.5,
"logps/rejected": -129.0,
"loss": 13.6439,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.47265625,
"rewards/margins": 1.1015625,
"rewards/rejected": -0.625,
"step": 359
},
{
"epoch": 0.8363583563235081,
"grad_norm": 372.99908447265625,
"learning_rate": 3.2558139534883724e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.8515625,
"logps/chosen": -120.5,
"logps/rejected": -122.5,
"loss": 10.6753,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.53515625,
"rewards/margins": 1.625,
"rewards/rejected": -1.0859375,
"step": 360
},
{
"epoch": 0.8386815739799622,
"grad_norm": 441.1159973144531,
"learning_rate": 3.209302325581395e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.8984375,
"logps/chosen": -122.5,
"logps/rejected": -133.0,
"loss": 9.8108,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.6875,
"rewards/margins": 1.5390625,
"rewards/rejected": -0.8515625,
"step": 361
},
{
"epoch": 0.8410047916364164,
"grad_norm": 469.9103088378906,
"learning_rate": 3.1627906976744185e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.890625,
"logps/chosen": -124.5,
"logps/rejected": -121.5,
"loss": 13.8306,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.341796875,
"rewards/margins": 1.1640625,
"rewards/rejected": -0.8203125,
"step": 362
},
{
"epoch": 0.8433280092928707,
"grad_norm": 459.4384765625,
"learning_rate": 3.116279069767442e-07,
"logits/chosen": -0.80078125,
"logits/rejected": -0.78125,
"logps/chosen": -131.0,
"logps/rejected": -132.0,
"loss": 16.8385,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.287109375,
"rewards/margins": 1.09375,
"rewards/rejected": -0.8046875,
"step": 363
},
{
"epoch": 0.8456512269493248,
"grad_norm": 475.96575927734375,
"learning_rate": 3.069767441860465e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.84375,
"logps/chosen": -124.5,
"logps/rejected": -153.0,
"loss": 14.3564,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.33203125,
"rewards/margins": 0.953125,
"rewards/rejected": -0.62109375,
"step": 364
},
{
"epoch": 0.847974444605779,
"grad_norm": 376.33319091796875,
"learning_rate": 3.023255813953488e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.859375,
"logps/chosen": -126.0,
"logps/rejected": -129.0,
"loss": 13.5657,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.302734375,
"rewards/margins": 1.1953125,
"rewards/rejected": -0.890625,
"step": 365
},
{
"epoch": 0.8502976622622332,
"grad_norm": 366.171875,
"learning_rate": 2.9767441860465116e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.88671875,
"logps/chosen": -117.0,
"logps/rejected": -124.0,
"loss": 12.0715,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.53515625,
"rewards/margins": 1.203125,
"rewards/rejected": -0.66796875,
"step": 366
},
{
"epoch": 0.8526208799186874,
"grad_norm": 388.7607116699219,
"learning_rate": 2.9302325581395347e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.85546875,
"logps/chosen": -136.0,
"logps/rejected": -127.0,
"loss": 12.8401,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.296875,
"rewards/margins": 1.0703125,
"rewards/rejected": -0.7734375,
"step": 367
},
{
"epoch": 0.8549440975751416,
"grad_norm": 359.4689025878906,
"learning_rate": 2.883720930232558e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.87890625,
"logps/chosen": -123.0,
"logps/rejected": -118.0,
"loss": 12.6276,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.4921875,
"rewards/margins": 1.2421875,
"rewards/rejected": -0.75,
"step": 368
},
{
"epoch": 0.8572673152315957,
"grad_norm": 436.34637451171875,
"learning_rate": 2.837209302325581e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.88671875,
"logps/chosen": -136.0,
"logps/rejected": -119.5,
"loss": 15.5687,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2734375,
"rewards/margins": 0.953125,
"rewards/rejected": -0.6796875,
"step": 369
},
{
"epoch": 0.85959053288805,
"grad_norm": 460.02642822265625,
"learning_rate": 2.7906976744186043e-07,
"logits/chosen": -0.921875,
"logits/rejected": -0.92578125,
"logps/chosen": -129.0,
"logps/rejected": -126.5,
"loss": 14.6654,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.306640625,
"rewards/margins": 1.1875,
"rewards/rejected": -0.8828125,
"step": 370
},
{
"epoch": 0.8619137505445041,
"grad_norm": 482.4629211425781,
"learning_rate": 2.744186046511628e-07,
"logits/chosen": -0.8828125,
"logits/rejected": -0.8984375,
"logps/chosen": -140.0,
"logps/rejected": -137.0,
"loss": 19.0223,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2001953125,
"rewards/margins": 0.64453125,
"rewards/rejected": -0.443359375,
"step": 371
},
{
"epoch": 0.8642369682009583,
"grad_norm": 430.52734375,
"learning_rate": 2.6976744186046514e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.8515625,
"logps/chosen": -112.5,
"logps/rejected": -150.0,
"loss": 15.3828,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.3515625,
"rewards/margins": 0.8984375,
"rewards/rejected": -0.546875,
"step": 372
},
{
"epoch": 0.8665601858574126,
"grad_norm": 435.8709716796875,
"learning_rate": 2.651162790697674e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.859375,
"logps/chosen": -127.5,
"logps/rejected": -132.0,
"loss": 15.0752,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.27734375,
"rewards/margins": 0.92578125,
"rewards/rejected": -0.6484375,
"step": 373
},
{
"epoch": 0.8688834035138667,
"grad_norm": 341.1181335449219,
"learning_rate": 2.6046511627906974e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.89453125,
"logps/chosen": -127.0,
"logps/rejected": -130.0,
"loss": 10.693,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.44140625,
"rewards/margins": 1.4921875,
"rewards/rejected": -1.046875,
"step": 374
},
{
"epoch": 0.8712066211703209,
"grad_norm": 432.8375549316406,
"learning_rate": 2.558139534883721e-07,
"logits/chosen": -0.82421875,
"logits/rejected": -0.87109375,
"logps/chosen": -111.0,
"logps/rejected": -132.0,
"loss": 16.0132,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.3828125,
"rewards/margins": 0.98828125,
"rewards/rejected": -0.60546875,
"step": 375
},
{
"epoch": 0.873529838826775,
"grad_norm": 496.7705993652344,
"learning_rate": 2.5116279069767445e-07,
"logits/chosen": -0.83203125,
"logits/rejected": -0.85546875,
"logps/chosen": -127.5,
"logps/rejected": -125.5,
"loss": 13.1619,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.376953125,
"rewards/margins": 1.4453125,
"rewards/rejected": -1.0703125,
"step": 376
},
{
"epoch": 0.8758530564832293,
"grad_norm": 475.2943420410156,
"learning_rate": 2.4651162790697676e-07,
"logits/chosen": -0.84765625,
"logits/rejected": -0.90625,
"logps/chosen": -128.0,
"logps/rejected": -127.0,
"loss": 17.3145,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.31640625,
"rewards/margins": 0.921875,
"rewards/rejected": -0.60546875,
"step": 377
},
{
"epoch": 0.8781762741396835,
"grad_norm": 360.33929443359375,
"learning_rate": 2.4186046511627906e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.84765625,
"logps/chosen": -127.0,
"logps/rejected": -121.5,
"loss": 12.2108,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.486328125,
"rewards/margins": 1.15625,
"rewards/rejected": -0.66796875,
"step": 378
},
{
"epoch": 0.8804994917961376,
"grad_norm": 417.58416748046875,
"learning_rate": 2.3720930232558139e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.8203125,
"logps/chosen": -127.0,
"logps/rejected": -114.0,
"loss": 14.0455,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.42578125,
"rewards/margins": 1.125,
"rewards/rejected": -0.69921875,
"step": 379
},
{
"epoch": 0.8828227094525919,
"grad_norm": 360.6600036621094,
"learning_rate": 2.3255813953488372e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.890625,
"logps/chosen": -125.5,
"logps/rejected": -129.0,
"loss": 11.5916,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.494140625,
"rewards/margins": 1.3359375,
"rewards/rejected": -0.84375,
"step": 380
},
{
"epoch": 0.885145927109046,
"grad_norm": 603.400390625,
"learning_rate": 2.2790697674418604e-07,
"logits/chosen": -0.8359375,
"logits/rejected": -0.8359375,
"logps/chosen": -129.0,
"logps/rejected": -137.0,
"loss": 15.2494,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.333984375,
"rewards/margins": 1.0859375,
"rewards/rejected": -0.74609375,
"step": 381
},
{
"epoch": 0.8874691447655002,
"grad_norm": 387.8462829589844,
"learning_rate": 2.2325581395348835e-07,
"logits/chosen": -0.921875,
"logits/rejected": -0.921875,
"logps/chosen": -124.0,
"logps/rejected": -139.0,
"loss": 13.0447,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.349609375,
"rewards/margins": 1.0234375,
"rewards/rejected": -0.67578125,
"step": 382
},
{
"epoch": 0.8897923624219544,
"grad_norm": 379.9131164550781,
"learning_rate": 2.186046511627907e-07,
"logits/chosen": -0.91015625,
"logits/rejected": -0.9140625,
"logps/chosen": -131.0,
"logps/rejected": -128.0,
"loss": 10.8182,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.39453125,
"rewards/margins": 1.46875,
"rewards/rejected": -1.0703125,
"step": 383
},
{
"epoch": 0.8921155800784086,
"grad_norm": 429.8023681640625,
"learning_rate": 2.13953488372093e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.90625,
"logps/chosen": -115.5,
"logps/rejected": -130.0,
"loss": 16.3474,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.333984375,
"rewards/margins": 0.90234375,
"rewards/rejected": -0.56640625,
"step": 384
},
{
"epoch": 0.8944387977348628,
"grad_norm": 399.4114685058594,
"learning_rate": 2.0930232558139536e-07,
"logits/chosen": -0.90625,
"logits/rejected": -0.92578125,
"logps/chosen": -123.0,
"logps/rejected": -119.5,
"loss": 15.1389,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.42578125,
"rewards/margins": 0.92578125,
"rewards/rejected": -0.5,
"step": 385
},
{
"epoch": 0.896762015391317,
"grad_norm": 387.39788818359375,
"learning_rate": 2.0465116279069766e-07,
"logits/chosen": -0.91796875,
"logits/rejected": -0.90234375,
"logps/chosen": -133.0,
"logps/rejected": -130.0,
"loss": 12.6393,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.447265625,
"rewards/margins": 1.3203125,
"rewards/rejected": -0.87109375,
"step": 386
},
{
"epoch": 0.8990852330477712,
"grad_norm": 433.6268310546875,
"learning_rate": 2e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.87890625,
"logps/chosen": -129.0,
"logps/rejected": -147.0,
"loss": 16.6982,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.263671875,
"rewards/margins": 0.6171875,
"rewards/rejected": -0.35546875,
"step": 387
},
{
"epoch": 0.9014084507042254,
"grad_norm": 478.2352600097656,
"learning_rate": 1.9534883720930232e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.85546875,
"logps/chosen": -136.0,
"logps/rejected": -142.0,
"loss": 15.4782,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.373046875,
"rewards/margins": 1.0390625,
"rewards/rejected": -0.6640625,
"step": 388
},
{
"epoch": 0.9037316683606795,
"grad_norm": 321.55224609375,
"learning_rate": 1.9069767441860465e-07,
"logits/chosen": -0.87109375,
"logits/rejected": -0.9140625,
"logps/chosen": -122.5,
"logps/rejected": -119.5,
"loss": 11.955,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.5703125,
"rewards/margins": 1.2890625,
"rewards/rejected": -0.71484375,
"step": 389
},
{
"epoch": 0.9060548860171337,
"grad_norm": 389.5977478027344,
"learning_rate": 1.8604651162790698e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.8359375,
"logps/chosen": -143.0,
"logps/rejected": -120.5,
"loss": 12.9778,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.60546875,
"rewards/margins": 1.234375,
"rewards/rejected": -0.62890625,
"step": 390
},
{
"epoch": 0.908378103673588,
"grad_norm": 358.9306640625,
"learning_rate": 1.813953488372093e-07,
"logits/chosen": -0.85546875,
"logits/rejected": -0.86328125,
"logps/chosen": -142.0,
"logps/rejected": -113.5,
"loss": 11.2094,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.4609375,
"rewards/margins": 1.5078125,
"rewards/rejected": -1.046875,
"step": 391
},
{
"epoch": 0.9107013213300421,
"grad_norm": 554.0177612304688,
"learning_rate": 1.767441860465116e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.921875,
"logps/chosen": -130.0,
"logps/rejected": -149.0,
"loss": 20.13,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.267578125,
"rewards/margins": 0.734375,
"rewards/rejected": -0.46484375,
"step": 392
},
{
"epoch": 0.9130245389864963,
"grad_norm": 366.87103271484375,
"learning_rate": 1.7209302325581396e-07,
"logits/chosen": -0.78125,
"logits/rejected": -0.8125,
"logps/chosen": -134.0,
"logps/rejected": -138.0,
"loss": 10.4358,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.6328125,
"rewards/margins": 1.53125,
"rewards/rejected": -0.89453125,
"step": 393
},
{
"epoch": 0.9153477566429505,
"grad_norm": 392.17437744140625,
"learning_rate": 1.6744186046511627e-07,
"logits/chosen": -0.84375,
"logits/rejected": -0.87109375,
"logps/chosen": -131.0,
"logps/rejected": -128.0,
"loss": 13.6418,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.56640625,
"rewards/margins": 1.3359375,
"rewards/rejected": -0.765625,
"step": 394
},
{
"epoch": 0.9176709742994047,
"grad_norm": 317.3909912109375,
"learning_rate": 1.6279069767441862e-07,
"logits/chosen": -0.859375,
"logits/rejected": -0.86328125,
"logps/chosen": -146.0,
"logps/rejected": -119.0,
"loss": 10.7445,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.41015625,
"rewards/margins": 1.2734375,
"rewards/rejected": -0.86328125,
"step": 395
},
{
"epoch": 0.9199941919558589,
"grad_norm": 375.08453369140625,
"learning_rate": 1.5813953488372092e-07,
"logits/chosen": -0.8671875,
"logits/rejected": -0.890625,
"logps/chosen": -130.0,
"logps/rejected": -123.5,
"loss": 10.4174,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.431640625,
"rewards/margins": 1.5078125,
"rewards/rejected": -1.078125,
"step": 396
},
{
"epoch": 0.922317409612313,
"grad_norm": 379.6015319824219,
"learning_rate": 1.5348837209302325e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.91015625,
"logps/chosen": -116.0,
"logps/rejected": -119.0,
"loss": 13.0293,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.66796875,
"rewards/margins": 1.0234375,
"rewards/rejected": -0.353515625,
"step": 397
},
{
"epoch": 0.9246406272687673,
"grad_norm": 399.4117431640625,
"learning_rate": 1.4883720930232558e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.890625,
"logps/chosen": -135.0,
"logps/rejected": -121.5,
"loss": 14.1611,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.6484375,
"rewards/margins": 1.109375,
"rewards/rejected": -0.4609375,
"step": 398
},
{
"epoch": 0.9269638449252214,
"grad_norm": 325.7952880859375,
"learning_rate": 1.441860465116279e-07,
"logits/chosen": -0.875,
"logits/rejected": -0.921875,
"logps/chosen": -137.0,
"logps/rejected": -125.5,
"loss": 12.9187,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.54296875,
"rewards/margins": 1.1171875,
"rewards/rejected": -0.57421875,
"step": 399
},
{
"epoch": 0.9292870625816756,
"grad_norm": 504.759033203125,
"learning_rate": 1.3953488372093021e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.90234375,
"logps/chosen": -137.0,
"logps/rejected": -148.0,
"loss": 13.8368,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.330078125,
"rewards/margins": 1.1015625,
"rewards/rejected": -0.7734375,
"step": 400
},
{
"epoch": 0.9316102802381299,
"grad_norm": 399.3138122558594,
"learning_rate": 1.3488372093023257e-07,
"logits/chosen": -0.86328125,
"logits/rejected": -0.90234375,
"logps/chosen": -138.0,
"logps/rejected": -117.5,
"loss": 14.4127,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2490234375,
"rewards/margins": 1.015625,
"rewards/rejected": -0.765625,
"step": 401
},
{
"epoch": 0.933933497894584,
"grad_norm": 487.4891357421875,
"learning_rate": 1.3023255813953487e-07,
"logits/chosen": -0.87890625,
"logits/rejected": -0.87109375,
"logps/chosen": -144.0,
"logps/rejected": -145.0,
"loss": 14.2865,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.265625,
"rewards/margins": 1.1328125,
"rewards/rejected": -0.8671875,
"step": 402
},
{
"epoch": 0.9362567155510382,
"grad_norm": 342.6651611328125,
"learning_rate": 1.2558139534883723e-07,
"logits/chosen": -0.828125,
"logits/rejected": -0.859375,
"logps/chosen": -133.0,
"logps/rejected": -127.0,
"loss": 11.4037,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.470703125,
"rewards/margins": 1.4609375,
"rewards/rejected": -0.98828125,
"step": 403
},
{
"epoch": 0.9385799332074923,
"grad_norm": 398.06939697265625,
"learning_rate": 1.2093023255813953e-07,
"logits/chosen": -0.90625,
"logits/rejected": -0.8984375,
"logps/chosen": -124.0,
"logps/rejected": -126.0,
"loss": 13.7546,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.265625,
"rewards/margins": 1.015625,
"rewards/rejected": -0.75,
"step": 404
},
{
"epoch": 0.9409031508639466,
"grad_norm": 298.3856201171875,
"learning_rate": 1.1627906976744186e-07,
"logits/chosen": -0.8515625,
"logits/rejected": -0.88671875,
"logps/chosen": -122.0,
"logps/rejected": -120.5,
"loss": 11.0682,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.388671875,
"rewards/margins": 1.3671875,
"rewards/rejected": -0.98046875,
"step": 405
},
{
"epoch": 0.9432263685204008,
"grad_norm": 368.4793701171875,
"learning_rate": 1.1162790697674417e-07,
"logits/chosen": -0.796875,
"logits/rejected": -0.81640625,
"logps/chosen": -162.0,
"logps/rejected": -133.0,
"loss": 11.1848,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.65234375,
"rewards/margins": 1.421875,
"rewards/rejected": -0.76953125,
"step": 406
},
{
"epoch": 0.9455495861768549,
"grad_norm": 294.15423583984375,
"learning_rate": 1.069767441860465e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.83984375,
"logps/chosen": -117.0,
"logps/rejected": -121.0,
"loss": 9.3992,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.5,
"rewards/margins": 1.4609375,
"rewards/rejected": -0.96484375,
"step": 407
},
{
"epoch": 0.9478728038333092,
"grad_norm": 366.13348388671875,
"learning_rate": 1.0232558139534883e-07,
"logits/chosen": -0.8203125,
"logits/rejected": -0.8359375,
"logps/chosen": -116.0,
"logps/rejected": -122.0,
"loss": 12.3627,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.61328125,
"rewards/margins": 1.171875,
"rewards/rejected": -0.55859375,
"step": 408
},
{
"epoch": 0.9501960214897633,
"grad_norm": 424.2518310546875,
"learning_rate": 9.767441860465116e-08,
"logits/chosen": -0.83984375,
"logits/rejected": -0.86328125,
"logps/chosen": -129.0,
"logps/rejected": -138.0,
"loss": 13.1234,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.51171875,
"rewards/margins": 1.078125,
"rewards/rejected": -0.5625,
"step": 409
},
{
"epoch": 0.9525192391462175,
"grad_norm": 398.58087158203125,
"learning_rate": 9.302325581395349e-08,
"logits/chosen": -0.8359375,
"logits/rejected": -0.88671875,
"logps/chosen": -120.0,
"logps/rejected": -123.0,
"loss": 13.4062,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.291015625,
"rewards/margins": 1.203125,
"rewards/rejected": -0.91796875,
"step": 410
},
{
"epoch": 0.9548424568026717,
"grad_norm": 391.4315185546875,
"learning_rate": 8.83720930232558e-08,
"logits/chosen": -0.828125,
"logits/rejected": -0.85546875,
"logps/chosen": -128.0,
"logps/rejected": -152.0,
"loss": 15.4103,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.3671875,
"rewards/margins": 0.828125,
"rewards/rejected": -0.4609375,
"step": 411
},
{
"epoch": 0.9571656744591259,
"grad_norm": 391.45184326171875,
"learning_rate": 8.372093023255813e-08,
"logits/chosen": -0.8359375,
"logits/rejected": -0.88671875,
"logps/chosen": -128.0,
"logps/rejected": -125.0,
"loss": 14.7136,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.419921875,
"rewards/margins": 1.015625,
"rewards/rejected": -0.59765625,
"step": 412
},
{
"epoch": 0.9594888921155801,
"grad_norm": 330.07623291015625,
"learning_rate": 7.906976744186046e-08,
"logits/chosen": -0.875,
"logits/rejected": -0.8828125,
"logps/chosen": -122.5,
"logps/rejected": -146.0,
"loss": 12.1995,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.72265625,
"rewards/margins": 1.1640625,
"rewards/rejected": -0.443359375,
"step": 413
},
{
"epoch": 0.9618121097720342,
"grad_norm": 374.36016845703125,
"learning_rate": 7.441860465116279e-08,
"logits/chosen": -0.88671875,
"logits/rejected": -0.91015625,
"logps/chosen": -123.5,
"logps/rejected": -130.0,
"loss": 11.3741,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.63671875,
"rewards/margins": 1.28125,
"rewards/rejected": -0.6484375,
"step": 414
},
{
"epoch": 0.9641353274284885,
"grad_norm": 351.6080322265625,
"learning_rate": 6.976744186046511e-08,
"logits/chosen": -0.8828125,
"logits/rejected": -0.92578125,
"logps/chosen": -123.5,
"logps/rejected": -113.0,
"loss": 15.8728,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2314453125,
"rewards/margins": 0.84765625,
"rewards/rejected": -0.6171875,
"step": 415
},
{
"epoch": 0.9664585450849427,
"grad_norm": 364.0675048828125,
"learning_rate": 6.511627906976744e-08,
"logits/chosen": -0.87109375,
"logits/rejected": -0.859375,
"logps/chosen": -141.0,
"logps/rejected": -130.0,
"loss": 10.63,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.45703125,
"rewards/margins": 1.40625,
"rewards/rejected": -0.9453125,
"step": 416
},
{
"epoch": 0.9687817627413968,
"grad_norm": 329.6365051269531,
"learning_rate": 6.046511627906976e-08,
"logits/chosen": -0.85546875,
"logits/rejected": -0.87109375,
"logps/chosen": -150.0,
"logps/rejected": -123.5,
"loss": 9.7498,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.70703125,
"rewards/margins": 1.3671875,
"rewards/rejected": -0.66015625,
"step": 417
},
{
"epoch": 0.971104980397851,
"grad_norm": 351.0168151855469,
"learning_rate": 5.5813953488372087e-08,
"logits/chosen": -0.84375,
"logits/rejected": -0.8671875,
"logps/chosen": -143.0,
"logps/rejected": -138.0,
"loss": 11.6222,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.67578125,
"rewards/margins": 1.3125,
"rewards/rejected": -0.63671875,
"step": 418
},
{
"epoch": 0.9734281980543052,
"grad_norm": 338.6527099609375,
"learning_rate": 5.1162790697674416e-08,
"logits/chosen": -0.91015625,
"logits/rejected": -0.94140625,
"logps/chosen": -145.0,
"logps/rejected": -125.5,
"loss": 12.6106,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.443359375,
"rewards/margins": 1.2265625,
"rewards/rejected": -0.78125,
"step": 419
},
{
"epoch": 0.9757514157107594,
"grad_norm": 476.017333984375,
"learning_rate": 4.6511627906976744e-08,
"logits/chosen": -0.8984375,
"logits/rejected": -0.8984375,
"logps/chosen": -127.0,
"logps/rejected": -124.0,
"loss": 11.9675,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.56640625,
"rewards/margins": 1.125,
"rewards/rejected": -0.55859375,
"step": 420
},
{
"epoch": 0.9780746333672136,
"grad_norm": 597.4747314453125,
"learning_rate": 4.1860465116279067e-08,
"logits/chosen": -0.8828125,
"logits/rejected": -0.890625,
"logps/chosen": -135.0,
"logps/rejected": -129.0,
"loss": 20.6045,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.140625,
"rewards/margins": 0.53515625,
"rewards/rejected": -0.396484375,
"step": 421
},
{
"epoch": 0.9803978510236678,
"grad_norm": 422.0390319824219,
"learning_rate": 3.7209302325581396e-08,
"logits/chosen": -0.84375,
"logits/rejected": -0.86328125,
"logps/chosen": -142.0,
"logps/rejected": -131.0,
"loss": 13.5287,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.02783203125,
"rewards/margins": 1.21875,
"rewards/rejected": -1.2421875,
"step": 422
},
{
"epoch": 0.982721068680122,
"grad_norm": 461.14935302734375,
"learning_rate": 3.255813953488372e-08,
"logits/chosen": -0.88671875,
"logits/rejected": -0.87890625,
"logps/chosen": -138.0,
"logps/rejected": -143.0,
"loss": 15.0398,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.042236328125,
"rewards/margins": 0.84765625,
"rewards/rejected": -0.8046875,
"step": 423
},
{
"epoch": 0.9850442863365761,
"grad_norm": 412.094482421875,
"learning_rate": 2.7906976744186043e-08,
"logits/chosen": -0.85546875,
"logits/rejected": -0.8515625,
"logps/chosen": -130.0,
"logps/rejected": -125.0,
"loss": 13.0969,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.42578125,
"rewards/margins": 1.1015625,
"rewards/rejected": -0.67578125,
"step": 424
},
{
"epoch": 0.9873675039930303,
"grad_norm": 348.2117614746094,
"learning_rate": 2.3255813953488372e-08,
"logits/chosen": -0.84765625,
"logits/rejected": -0.8515625,
"logps/chosen": -127.0,
"logps/rejected": -145.0,
"loss": 13.7319,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.44921875,
"rewards/margins": 1.2734375,
"rewards/rejected": -0.828125,
"step": 425
},
{
"epoch": 0.9896907216494846,
"grad_norm": 383.5706787109375,
"learning_rate": 1.8604651162790698e-08,
"logits/chosen": -0.84375,
"logits/rejected": -0.890625,
"logps/chosen": -130.0,
"logps/rejected": -137.0,
"loss": 13.9442,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.484375,
"rewards/margins": 1.0703125,
"rewards/rejected": -0.5859375,
"step": 426
},
{
"epoch": 0.9920139393059387,
"grad_norm": 368.6072082519531,
"learning_rate": 1.3953488372093022e-08,
"logits/chosen": -0.875,
"logits/rejected": -0.88671875,
"logps/chosen": -133.0,
"logps/rejected": -137.0,
"loss": 15.8562,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.279296875,
"rewards/margins": 1.0390625,
"rewards/rejected": -0.7578125,
"step": 427
},
{
"epoch": 0.9943371569623929,
"grad_norm": 555.5682983398438,
"learning_rate": 9.302325581395349e-09,
"logits/chosen": -0.8203125,
"logits/rejected": -0.8359375,
"logps/chosen": -117.0,
"logps/rejected": -126.0,
"loss": 15.7869,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.283203125,
"rewards/margins": 1.09375,
"rewards/rejected": -0.80859375,
"step": 428
},
{
"epoch": 0.9966603746188472,
"grad_norm": 393.66015625,
"learning_rate": 4.6511627906976744e-09,
"logits/chosen": -0.84765625,
"logits/rejected": -0.921875,
"logps/chosen": -144.0,
"logps/rejected": -130.0,
"loss": 13.2079,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.44921875,
"rewards/margins": 1.25,
"rewards/rejected": -0.796875,
"step": 429
},
{
"epoch": 0.9989835922753013,
"grad_norm": 407.5803527832031,
"learning_rate": 0.0,
"logits/chosen": -0.84375,
"logits/rejected": -0.87109375,
"logps/chosen": -111.5,
"logps/rejected": -123.0,
"loss": 14.8324,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.32421875,
"rewards/margins": 0.99609375,
"rewards/rejected": -0.671875,
"step": 430
}
],
"logging_steps": 1,
"max_steps": 430,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}