Text Generation
PEFT
Safetensors
rag-gym
retrieval-augmented-generation
agent
lora
process-supervision
search-agent
conversational
Instructions to use RAG-Gym/Search-o1-MedQA-DPO with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use RAG-Gym/Search-o1-MedQA-DPO with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Meta-Llama-3.1-8B-Instruct") model = PeftModel.from_pretrained(base_model, "RAG-Gym/Search-o1-MedQA-DPO") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.9989835922753013, | |
| "eval_steps": 500, | |
| "global_step": 430, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002323217656454189, | |
| "grad_norm": 323.048828125, | |
| "learning_rate": 1.995348837209302e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -126.0, | |
| "loss": 22.125, | |
| "rewards/accuracies": 0.0, | |
| "rewards/chosen": 0.0, | |
| "rewards/margins": 0.0, | |
| "rewards/rejected": 0.0, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.004646435312908378, | |
| "grad_norm": 338.7125244140625, | |
| "learning_rate": 1.9906976744186046e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -137.0, | |
| "loss": 22.3984, | |
| "rewards/accuracies": 0.21875, | |
| "rewards/chosen": 0.01251220703125, | |
| "rewards/margins": -0.01409912109375, | |
| "rewards/rejected": 0.026611328125, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.0069696529693625674, | |
| "grad_norm": 324.7102355957031, | |
| "learning_rate": 1.9860465116279068e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.69921875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -112.0, | |
| "loss": 22.25, | |
| "rewards/accuracies": 0.34375, | |
| "rewards/chosen": 0.0152587890625, | |
| "rewards/margins": -0.00311279296875, | |
| "rewards/rejected": 0.0184326171875, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.009292870625816756, | |
| "grad_norm": 359.8957824707031, | |
| "learning_rate": 1.9813953488372093e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -121.0, | |
| "loss": 22.0312, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.0031280517578125, | |
| "rewards/margins": 0.01092529296875, | |
| "rewards/rejected": -0.0078125, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.011616088282270945, | |
| "grad_norm": 337.0638122558594, | |
| "learning_rate": 1.9767441860465115e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -114.0, | |
| "loss": 21.7578, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.02734375, | |
| "rewards/margins": 0.02734375, | |
| "rewards/rejected": 0.0, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.013939305938725135, | |
| "grad_norm": 325.502197265625, | |
| "learning_rate": 1.972093023255814e-06, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -117.5, | |
| "loss": 21.9141, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.0218505859375, | |
| "rewards/margins": 0.0211181640625, | |
| "rewards/rejected": 0.000782012939453125, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.016262523595179323, | |
| "grad_norm": 319.614990234375, | |
| "learning_rate": 1.967441860465116e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -161.0, | |
| "logps/rejected": -127.5, | |
| "loss": 21.7227, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.0203857421875, | |
| "rewards/margins": 0.0281982421875, | |
| "rewards/rejected": -0.0078125, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.018585741251633512, | |
| "grad_norm": 339.0907287597656, | |
| "learning_rate": 1.9627906976744183e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -125.5, | |
| "loss": 21.5156, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.042236328125, | |
| "rewards/margins": 0.04296875, | |
| "rewards/rejected": -0.000782012939453125, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.0209089589080877, | |
| "grad_norm": 317.0169982910156, | |
| "learning_rate": 1.958139534883721e-06, | |
| "logits/chosen": -0.64453125, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -116.5, | |
| "loss": 21.7969, | |
| "rewards/accuracies": 0.4375, | |
| "rewards/chosen": 0.03759765625, | |
| "rewards/margins": 0.03125, | |
| "rewards/rejected": 0.006256103515625, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.02323217656454189, | |
| "grad_norm": 353.8077392578125, | |
| "learning_rate": 1.953488372093023e-06, | |
| "logits/chosen": -0.68359375, | |
| "logits/rejected": -0.703125, | |
| "logps/chosen": -149.0, | |
| "logps/rejected": -113.5, | |
| "loss": 21.8633, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": 0.035888671875, | |
| "rewards/margins": 0.026611328125, | |
| "rewards/rejected": 0.0093994140625, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.02555539422099608, | |
| "grad_norm": 324.4909362792969, | |
| "learning_rate": 1.9488372093023256e-06, | |
| "logits/chosen": -0.765625, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -138.0, | |
| "loss": 22.5781, | |
| "rewards/accuracies": 0.375, | |
| "rewards/chosen": 0.026611328125, | |
| "rewards/margins": -0.0172119140625, | |
| "rewards/rejected": 0.043701171875, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.02787861187745027, | |
| "grad_norm": 360.6048583984375, | |
| "learning_rate": 1.9441860465116278e-06, | |
| "logits/chosen": -0.70703125, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -155.0, | |
| "logps/rejected": -116.0, | |
| "loss": 20.6895, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.07666015625, | |
| "rewards/margins": 0.10498046875, | |
| "rewards/rejected": -0.0281982421875, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.03020182953390446, | |
| "grad_norm": 321.6941223144531, | |
| "learning_rate": 1.9395348837209303e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -125.0, | |
| "logps/rejected": -132.0, | |
| "loss": 20.8535, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.05712890625, | |
| "rewards/margins": 0.08740234375, | |
| "rewards/rejected": -0.030517578125, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.03252504719035865, | |
| "grad_norm": 314.4052429199219, | |
| "learning_rate": 1.9348837209302325e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -114.0, | |
| "logps/rejected": -123.5, | |
| "loss": 21.2949, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.04541015625, | |
| "rewards/margins": 0.0673828125, | |
| "rewards/rejected": -0.02197265625, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.03484826484681284, | |
| "grad_norm": 339.468017578125, | |
| "learning_rate": 1.930232558139535e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -132.0, | |
| "loss": 21.8496, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.020263671875, | |
| "rewards/margins": 0.0250244140625, | |
| "rewards/rejected": -0.00469970703125, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.037171482503267024, | |
| "grad_norm": 370.9052429199219, | |
| "learning_rate": 1.925581395348837e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -131.0, | |
| "loss": 22.0898, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.015625, | |
| "rewards/margins": 0.0179443359375, | |
| "rewards/rejected": -0.002349853515625, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.039494700159721216, | |
| "grad_norm": 337.88262939453125, | |
| "learning_rate": 1.9209302325581393e-06, | |
| "logits/chosen": -0.6875, | |
| "logits/rejected": -0.70703125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -137.0, | |
| "loss": 21.0625, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.10791015625, | |
| "rewards/margins": 0.08984375, | |
| "rewards/rejected": 0.0179443359375, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.0418179178161754, | |
| "grad_norm": 363.0306091308594, | |
| "learning_rate": 1.916279069767442e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -162.0, | |
| "loss": 22.3711, | |
| "rewards/accuracies": 0.46875, | |
| "rewards/chosen": 0.018798828125, | |
| "rewards/margins": -0.004730224609375, | |
| "rewards/rejected": 0.0234375, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.04414113547262959, | |
| "grad_norm": 300.884521484375, | |
| "learning_rate": 1.911627906976744e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -115.0, | |
| "loss": 20.6758, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.055419921875, | |
| "rewards/margins": 0.109375, | |
| "rewards/rejected": -0.053955078125, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.04646435312908378, | |
| "grad_norm": 330.6780090332031, | |
| "learning_rate": 1.9069767441860464e-06, | |
| "logits/chosen": -0.6953125, | |
| "logits/rejected": -0.68359375, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -113.5, | |
| "loss": 20.2715, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.046875, | |
| "rewards/margins": 0.1376953125, | |
| "rewards/rejected": -0.0908203125, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.04878757078553797, | |
| "grad_norm": 316.6097106933594, | |
| "learning_rate": 1.9023255813953487e-06, | |
| "logits/chosen": -0.7109375, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -110.5, | |
| "loss": 19.916, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.076171875, | |
| "rewards/margins": 0.1591796875, | |
| "rewards/rejected": -0.0830078125, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.05111078844199216, | |
| "grad_norm": 310.86370849609375, | |
| "learning_rate": 1.897674418604651e-06, | |
| "logits/chosen": -0.6484375, | |
| "logits/rejected": -0.69921875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -128.0, | |
| "loss": 21.1484, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.03662109375, | |
| "rewards/margins": 0.0869140625, | |
| "rewards/rejected": -0.050048828125, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.05343400609844635, | |
| "grad_norm": 442.0061950683594, | |
| "learning_rate": 1.8930232558139534e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -108.0, | |
| "logps/rejected": -128.0, | |
| "loss": 20.5215, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": 0.018798828125, | |
| "rewards/margins": 0.1298828125, | |
| "rewards/rejected": -0.11083984375, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.05575722375490054, | |
| "grad_norm": 351.7835693359375, | |
| "learning_rate": 1.8883720930232556e-06, | |
| "logits/chosen": -0.7109375, | |
| "logits/rejected": -0.71875, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -119.0, | |
| "loss": 19.3867, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0849609375, | |
| "rewards/margins": 0.2158203125, | |
| "rewards/rejected": -0.130859375, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.058080441411354725, | |
| "grad_norm": 332.74700927734375, | |
| "learning_rate": 1.8837209302325582e-06, | |
| "logits/chosen": -0.703125, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -117.5, | |
| "loss": 19.75, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.046875, | |
| "rewards/margins": 0.181640625, | |
| "rewards/rejected": -0.134765625, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.06040365906780892, | |
| "grad_norm": 334.2042541503906, | |
| "learning_rate": 1.8790697674418603e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -130.0, | |
| "loss": 19.8301, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.0625, | |
| "rewards/margins": 0.1904296875, | |
| "rewards/rejected": -0.1279296875, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.06272687672426311, | |
| "grad_norm": 328.3305969238281, | |
| "learning_rate": 1.8744186046511627e-06, | |
| "logits/chosen": -0.6796875, | |
| "logits/rejected": -0.6875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -131.0, | |
| "loss": 20.0059, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.0654296875, | |
| "rewards/margins": 0.181640625, | |
| "rewards/rejected": -0.1162109375, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.0650500943807173, | |
| "grad_norm": 310.84674072265625, | |
| "learning_rate": 1.869767441860465e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.7265625, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -118.0, | |
| "loss": 19.7676, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.0625, | |
| "rewards/margins": 0.1826171875, | |
| "rewards/rejected": -0.11962890625, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.06737331203717148, | |
| "grad_norm": 363.75628662109375, | |
| "learning_rate": 1.8651162790697674e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -128.0, | |
| "loss": 20.2852, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.01165771484375, | |
| "rewards/margins": 0.1474609375, | |
| "rewards/rejected": -0.1357421875, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.06969652969362568, | |
| "grad_norm": 331.91949462890625, | |
| "learning_rate": 1.8604651162790697e-06, | |
| "logits/chosen": -0.6875, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -124.0, | |
| "loss": 20.332, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.046875, | |
| "rewards/margins": 0.169921875, | |
| "rewards/rejected": -0.12255859375, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.07201974735007986, | |
| "grad_norm": 314.3414001464844, | |
| "learning_rate": 1.855813953488372e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -119.5, | |
| "loss": 20.3867, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.043701171875, | |
| "rewards/margins": 0.1552734375, | |
| "rewards/rejected": -0.1982421875, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.07434296500653405, | |
| "grad_norm": 353.8963928222656, | |
| "learning_rate": 1.8511627906976744e-06, | |
| "logits/chosen": -0.70703125, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -141.0, | |
| "loss": 20.543, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.021728515625, | |
| "rewards/margins": 0.1591796875, | |
| "rewards/rejected": -0.1806640625, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.07666618266298823, | |
| "grad_norm": 315.1564636230469, | |
| "learning_rate": 1.8465116279069766e-06, | |
| "logits/chosen": -0.6875, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -111.0, | |
| "loss": 21.7266, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.0869140625, | |
| "rewards/margins": 0.07373046875, | |
| "rewards/rejected": -0.16015625, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.07898940031944243, | |
| "grad_norm": 353.0196533203125, | |
| "learning_rate": 1.841860465116279e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -120.0, | |
| "loss": 19.3828, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.078125, | |
| "rewards/margins": 0.236328125, | |
| "rewards/rejected": -0.314453125, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.08131261797589662, | |
| "grad_norm": 367.0079650878906, | |
| "learning_rate": 1.8372093023255813e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -121.5, | |
| "logps/rejected": -131.0, | |
| "loss": 20.9941, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.07666015625, | |
| "rewards/margins": 0.1220703125, | |
| "rewards/rejected": -0.1982421875, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.0836358356323508, | |
| "grad_norm": 301.0638732910156, | |
| "learning_rate": 1.8325581395348836e-06, | |
| "logits/chosen": -0.6953125, | |
| "logits/rejected": -0.71484375, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -124.0, | |
| "loss": 17.9121, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.004791259765625, | |
| "rewards/margins": 0.33203125, | |
| "rewards/rejected": -0.328125, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.085959053288805, | |
| "grad_norm": 359.94842529296875, | |
| "learning_rate": 1.827906976744186e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.7109375, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -128.0, | |
| "loss": 21.6172, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.08203125, | |
| "rewards/margins": 0.0986328125, | |
| "rewards/rejected": -0.181640625, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.08828227094525919, | |
| "grad_norm": 322.6696472167969, | |
| "learning_rate": 1.8232558139534884e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -129.0, | |
| "loss": 20.4121, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.024169921875, | |
| "rewards/margins": 0.1884765625, | |
| "rewards/rejected": -0.212890625, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.09060548860171337, | |
| "grad_norm": 308.0600280761719, | |
| "learning_rate": 1.8186046511627907e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -121.5, | |
| "loss": 19.002, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.06494140625, | |
| "rewards/margins": 0.267578125, | |
| "rewards/rejected": -0.33203125, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.09292870625816756, | |
| "grad_norm": 324.52655029296875, | |
| "learning_rate": 1.8139534883720929e-06, | |
| "logits/chosen": -0.7109375, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -125.0, | |
| "logps/rejected": -105.0, | |
| "loss": 20.1504, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.044677734375, | |
| "rewards/margins": 0.1904296875, | |
| "rewards/rejected": -0.2353515625, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.09525192391462176, | |
| "grad_norm": 336.1131286621094, | |
| "learning_rate": 1.8093023255813952e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -116.0, | |
| "loss": 19.748, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.10546875, | |
| "rewards/margins": 0.234375, | |
| "rewards/rejected": -0.33984375, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.09757514157107594, | |
| "grad_norm": 348.0433654785156, | |
| "learning_rate": 1.8046511627906976e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -162.0, | |
| "logps/rejected": -124.0, | |
| "loss": 18.8906, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.1455078125, | |
| "rewards/margins": 0.294921875, | |
| "rewards/rejected": -0.44140625, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.09989835922753013, | |
| "grad_norm": 327.6149597167969, | |
| "learning_rate": 1.8e-06, | |
| "logits/chosen": -0.6796875, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -126.5, | |
| "loss": 17.3145, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.020263671875, | |
| "rewards/margins": 0.423828125, | |
| "rewards/rejected": -0.4453125, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.10222157688398432, | |
| "grad_norm": 303.6740417480469, | |
| "learning_rate": 1.7953488372093023e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -121.0, | |
| "loss": 19.2715, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.11669921875, | |
| "rewards/margins": 0.271484375, | |
| "rewards/rejected": -0.388671875, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.10454479454043851, | |
| "grad_norm": 333.5793762207031, | |
| "learning_rate": 1.7906976744186046e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.703125, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -121.5, | |
| "loss": 18.8203, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.057861328125, | |
| "rewards/margins": 0.318359375, | |
| "rewards/rejected": -0.376953125, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.1068680121968927, | |
| "grad_norm": 318.89398193359375, | |
| "learning_rate": 1.7860465116279068e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -126.5, | |
| "loss": 17.5156, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.052978515625, | |
| "rewards/margins": 0.404296875, | |
| "rewards/rejected": -0.458984375, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.10919122985334688, | |
| "grad_norm": 364.5682678222656, | |
| "learning_rate": 1.7813953488372093e-06, | |
| "logits/chosen": -0.765625, | |
| "logits/rejected": -0.70703125, | |
| "logps/chosen": -117.5, | |
| "logps/rejected": -150.0, | |
| "loss": 20.8301, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.1201171875, | |
| "rewards/margins": 0.208984375, | |
| "rewards/rejected": -0.328125, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.11151444750980108, | |
| "grad_norm": 327.97412109375, | |
| "learning_rate": 1.7767441860465115e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -134.0, | |
| "loss": 19.6973, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.09912109375, | |
| "rewards/margins": 0.265625, | |
| "rewards/rejected": -0.365234375, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.11383766516625526, | |
| "grad_norm": 345.9813232421875, | |
| "learning_rate": 1.7720930232558138e-06, | |
| "logits/chosen": -0.66015625, | |
| "logits/rejected": -0.7109375, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -133.0, | |
| "loss": 21.0566, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.10986328125, | |
| "rewards/margins": 0.1953125, | |
| "rewards/rejected": -0.3046875, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.11616088282270945, | |
| "grad_norm": 336.94677734375, | |
| "learning_rate": 1.7674418604651162e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -111.5, | |
| "loss": 19.0391, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.138671875, | |
| "rewards/margins": 0.318359375, | |
| "rewards/rejected": -0.45703125, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.11848410047916365, | |
| "grad_norm": 341.45440673828125, | |
| "learning_rate": 1.7627906976744185e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -120.5, | |
| "logps/rejected": -145.0, | |
| "loss": 19.6602, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.07958984375, | |
| "rewards/margins": 0.287109375, | |
| "rewards/rejected": -0.3671875, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.12080731813561783, | |
| "grad_norm": 378.4522399902344, | |
| "learning_rate": 1.758139534883721e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -141.0, | |
| "loss": 21.7686, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.1962890625, | |
| "rewards/margins": 0.138671875, | |
| "rewards/rejected": -0.3359375, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.12313053579207202, | |
| "grad_norm": 278.8151550292969, | |
| "learning_rate": 1.753488372093023e-06, | |
| "logits/chosen": -0.70703125, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -150.0, | |
| "logps/rejected": -126.5, | |
| "loss": 16.0195, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.06884765625, | |
| "rewards/margins": 0.55859375, | |
| "rewards/rejected": -0.490234375, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.12545375344852622, | |
| "grad_norm": 336.42022705078125, | |
| "learning_rate": 1.7488372093023256e-06, | |
| "logits/chosen": -0.703125, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -121.5, | |
| "loss": 19.0742, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.0966796875, | |
| "rewards/margins": 0.3359375, | |
| "rewards/rejected": -0.431640625, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.1277769711049804, | |
| "grad_norm": 324.8966369628906, | |
| "learning_rate": 1.7441860465116278e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -111.5, | |
| "loss": 19.2002, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.2138671875, | |
| "rewards/margins": 0.296875, | |
| "rewards/rejected": -0.51171875, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.1301001887614346, | |
| "grad_norm": 357.81597900390625, | |
| "learning_rate": 1.7395348837209301e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -136.0, | |
| "loss": 19.1963, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.166015625, | |
| "rewards/margins": 0.3046875, | |
| "rewards/rejected": -0.470703125, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.13242340641788877, | |
| "grad_norm": 359.42279052734375, | |
| "learning_rate": 1.7348837209302325e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.6796875, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -136.0, | |
| "loss": 20.8135, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.1484375, | |
| "rewards/margins": 0.21875, | |
| "rewards/rejected": -0.3671875, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.13474662407434296, | |
| "grad_norm": 376.3425598144531, | |
| "learning_rate": 1.7302325581395348e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -142.0, | |
| "loss": 21.0859, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.126953125, | |
| "rewards/margins": 0.20703125, | |
| "rewards/rejected": -0.3359375, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.13706984173079714, | |
| "grad_norm": 276.28466796875, | |
| "learning_rate": 1.7255813953488372e-06, | |
| "logits/chosen": -0.6953125, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -132.0, | |
| "loss": 16.6836, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.05712890625, | |
| "rewards/margins": 0.515625, | |
| "rewards/rejected": -0.45703125, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.13939305938725136, | |
| "grad_norm": 308.0601806640625, | |
| "learning_rate": 1.7209302325581393e-06, | |
| "logits/chosen": -0.7109375, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -129.0, | |
| "loss": 17.4619, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.031494140625, | |
| "rewards/margins": 0.466796875, | |
| "rewards/rejected": -0.435546875, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.14171627704370554, | |
| "grad_norm": 334.4534606933594, | |
| "learning_rate": 1.7162790697674419e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -116.0, | |
| "loss": 19.7373, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.09521484375, | |
| "rewards/margins": 0.333984375, | |
| "rewards/rejected": -0.4296875, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.14403949470015973, | |
| "grad_norm": 324.9841613769531, | |
| "learning_rate": 1.711627906976744e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -157.0, | |
| "logps/rejected": -122.0, | |
| "loss": 18.4209, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.004669189453125, | |
| "rewards/margins": 0.384765625, | |
| "rewards/rejected": -0.37890625, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.1463627123566139, | |
| "grad_norm": 344.504638671875, | |
| "learning_rate": 1.7069767441860466e-06, | |
| "logits/chosen": -0.70703125, | |
| "logits/rejected": -0.7265625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -115.5, | |
| "loss": 19.3184, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.158203125, | |
| "rewards/margins": 0.31640625, | |
| "rewards/rejected": -0.474609375, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.1486859300130681, | |
| "grad_norm": 323.4111328125, | |
| "learning_rate": 1.7023255813953487e-06, | |
| "logits/chosen": -0.63671875, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -118.0, | |
| "loss": 17.728, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.017578125, | |
| "rewards/margins": 0.484375, | |
| "rewards/rejected": -0.5, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.15100914766952228, | |
| "grad_norm": 301.9679870605469, | |
| "learning_rate": 1.6976744186046509e-06, | |
| "logits/chosen": -0.65234375, | |
| "logits/rejected": -0.70703125, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -136.0, | |
| "loss": 16.2197, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.01263427734375, | |
| "rewards/margins": 0.53125, | |
| "rewards/rejected": -0.51953125, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.15333236532597647, | |
| "grad_norm": 370.5312194824219, | |
| "learning_rate": 1.6930232558139535e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.76171875, | |
| "logps/chosen": -119.5, | |
| "logps/rejected": -126.5, | |
| "loss": 20.4912, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.349609375, | |
| "rewards/margins": 0.1962890625, | |
| "rewards/rejected": -0.546875, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.15565558298243068, | |
| "grad_norm": 341.2892150878906, | |
| "learning_rate": 1.6883720930232556e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -119.0, | |
| "logps/rejected": -128.0, | |
| "loss": 19.6045, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.1416015625, | |
| "rewards/margins": 0.330078125, | |
| "rewards/rejected": -0.47265625, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.15797880063888486, | |
| "grad_norm": 331.32476806640625, | |
| "learning_rate": 1.6837209302325582e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -116.5, | |
| "loss": 17.0586, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.021728515625, | |
| "rewards/margins": 0.53125, | |
| "rewards/rejected": -0.55078125, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.16030201829533905, | |
| "grad_norm": 348.9662780761719, | |
| "learning_rate": 1.6790697674418603e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.7265625, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -131.0, | |
| "loss": 18.208, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.0615234375, | |
| "rewards/margins": 0.421875, | |
| "rewards/rejected": -0.484375, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.16262523595179323, | |
| "grad_norm": 286.9308776855469, | |
| "learning_rate": 1.6744186046511629e-06, | |
| "logits/chosen": -0.67578125, | |
| "logits/rejected": -0.671875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -119.0, | |
| "loss": 15.4043, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1142578125, | |
| "rewards/margins": 0.6640625, | |
| "rewards/rejected": -0.55078125, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.16494845360824742, | |
| "grad_norm": 400.8143615722656, | |
| "learning_rate": 1.669767441860465e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -148.0, | |
| "loss": 20.6289, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.208984375, | |
| "rewards/margins": 0.2734375, | |
| "rewards/rejected": -0.482421875, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.1672716712647016, | |
| "grad_norm": 307.0199890136719, | |
| "learning_rate": 1.6651162790697672e-06, | |
| "logits/chosen": -0.7109375, | |
| "logits/rejected": -0.703125, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -126.0, | |
| "loss": 17.0361, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.014892578125, | |
| "rewards/margins": 0.466796875, | |
| "rewards/rejected": -0.48046875, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.1695948889211558, | |
| "grad_norm": 394.55084228515625, | |
| "learning_rate": 1.6604651162790697e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -128.0, | |
| "loss": 20.4941, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.31640625, | |
| "rewards/margins": 0.23046875, | |
| "rewards/rejected": -0.546875, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.17191810657761, | |
| "grad_norm": 406.731201171875, | |
| "learning_rate": 1.6558139534883719e-06, | |
| "logits/chosen": -0.68359375, | |
| "logits/rejected": -0.7109375, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -127.5, | |
| "loss": 19.4707, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.166015625, | |
| "rewards/margins": 0.328125, | |
| "rewards/rejected": -0.494140625, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.1742413242340642, | |
| "grad_norm": 333.3077087402344, | |
| "learning_rate": 1.6511627906976744e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -155.0, | |
| "logps/rejected": -124.0, | |
| "loss": 18.7402, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.2333984375, | |
| "rewards/margins": 0.294921875, | |
| "rewards/rejected": -0.52734375, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.17656454189051837, | |
| "grad_norm": 345.686279296875, | |
| "learning_rate": 1.6465116279069766e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -128.0, | |
| "loss": 20.583, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.228515625, | |
| "rewards/margins": 0.287109375, | |
| "rewards/rejected": -0.515625, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.17888775954697256, | |
| "grad_norm": 315.1790466308594, | |
| "learning_rate": 1.6418604651162792e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -108.5, | |
| "loss": 16.7363, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.103515625, | |
| "rewards/margins": 0.50390625, | |
| "rewards/rejected": -0.60546875, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.18121097720342674, | |
| "grad_norm": 279.80206298828125, | |
| "learning_rate": 1.6372093023255813e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -108.0, | |
| "loss": 16.207, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.07470703125, | |
| "rewards/margins": 0.55859375, | |
| "rewards/rejected": -0.6328125, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.18353419485988093, | |
| "grad_norm": 381.6708679199219, | |
| "learning_rate": 1.6325581395348837e-06, | |
| "logits/chosen": -0.69140625, | |
| "logits/rejected": -0.69921875, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -150.0, | |
| "loss": 18.6279, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.10791015625, | |
| "rewards/margins": 0.419921875, | |
| "rewards/rejected": -0.52734375, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.1858574125163351, | |
| "grad_norm": 309.5762634277344, | |
| "learning_rate": 1.627906976744186e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -127.0, | |
| "loss": 16.7793, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.0576171875, | |
| "rewards/margins": 0.5078125, | |
| "rewards/rejected": -0.5625, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.18818063017278933, | |
| "grad_norm": 357.2296142578125, | |
| "learning_rate": 1.6232558139534882e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -158.0, | |
| "loss": 20.2842, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.0771484375, | |
| "rewards/margins": 0.283203125, | |
| "rewards/rejected": -0.359375, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.1905038478292435, | |
| "grad_norm": 361.9767761230469, | |
| "learning_rate": 1.6186046511627907e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -153.0, | |
| "logps/rejected": -131.0, | |
| "loss": 20.2363, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.0169677734375, | |
| "rewards/margins": 0.298828125, | |
| "rewards/rejected": -0.31640625, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.1928270654856977, | |
| "grad_norm": 300.6635437011719, | |
| "learning_rate": 1.6139534883720929e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -133.0, | |
| "loss": 18.0459, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.06494140625, | |
| "rewards/margins": 0.453125, | |
| "rewards/rejected": -0.51953125, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.19515028314215188, | |
| "grad_norm": 317.6025390625, | |
| "learning_rate": 1.6093023255813954e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -123.5, | |
| "logps/rejected": -119.0, | |
| "loss": 18.7881, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.166015625, | |
| "rewards/margins": 0.41015625, | |
| "rewards/rejected": -0.57421875, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.19747350079860607, | |
| "grad_norm": 324.6422424316406, | |
| "learning_rate": 1.6046511627906976e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -126.0, | |
| "loss": 16.6187, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.134765625, | |
| "rewards/margins": 0.5234375, | |
| "rewards/rejected": -0.65625, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.19979671845506025, | |
| "grad_norm": 442.3411865234375, | |
| "learning_rate": 1.6e-06, | |
| "logits/chosen": -0.71875, | |
| "logits/rejected": -0.703125, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -137.0, | |
| "loss": 23.7383, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -0.1767578125, | |
| "rewards/margins": 0.1103515625, | |
| "rewards/rejected": -0.287109375, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.20211993611151444, | |
| "grad_norm": 386.96435546875, | |
| "learning_rate": 1.5953488372093023e-06, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -140.0, | |
| "loss": 16.4014, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0020904541015625, | |
| "rewards/margins": 0.6015625, | |
| "rewards/rejected": -0.59765625, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.20444315376796865, | |
| "grad_norm": 463.20635986328125, | |
| "learning_rate": 1.5906976744186044e-06, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.76171875, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -148.0, | |
| "loss": 22.9053, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.38671875, | |
| "rewards/margins": 0.11669921875, | |
| "rewards/rejected": -0.50390625, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.20676637142442283, | |
| "grad_norm": 373.3138427734375, | |
| "learning_rate": 1.586046511627907e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.71484375, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -123.0, | |
| "loss": 17.3862, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.201171875, | |
| "rewards/margins": 0.546875, | |
| "rewards/rejected": -0.74609375, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.20908958908087702, | |
| "grad_norm": 378.5066223144531, | |
| "learning_rate": 1.5813953488372091e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -119.5, | |
| "loss": 18.2598, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.208984375, | |
| "rewards/margins": 0.36328125, | |
| "rewards/rejected": -0.57421875, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.2114128067373312, | |
| "grad_norm": 348.6402282714844, | |
| "learning_rate": 1.5767441860465117e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -132.0, | |
| "loss": 17.7559, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0556640625, | |
| "rewards/margins": 0.4453125, | |
| "rewards/rejected": -0.5, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.2137360243937854, | |
| "grad_norm": 369.6512145996094, | |
| "learning_rate": 1.5720930232558138e-06, | |
| "logits/chosen": -0.70703125, | |
| "logits/rejected": -0.70703125, | |
| "logps/chosen": -150.0, | |
| "logps/rejected": -130.0, | |
| "loss": 20.6709, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": 0.003204345703125, | |
| "rewards/margins": 0.2890625, | |
| "rewards/rejected": -0.28515625, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.21605924205023957, | |
| "grad_norm": 352.605224609375, | |
| "learning_rate": 1.5674418604651162e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.71484375, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -115.5, | |
| "loss": 18.3926, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.1494140625, | |
| "rewards/margins": 0.435546875, | |
| "rewards/rejected": -0.5859375, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.21838245970669376, | |
| "grad_norm": 486.412109375, | |
| "learning_rate": 1.5627906976744186e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -132.0, | |
| "loss": 19.9014, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.09521484375, | |
| "rewards/margins": 0.298828125, | |
| "rewards/rejected": -0.39453125, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.22070567736314797, | |
| "grad_norm": 376.4161071777344, | |
| "learning_rate": 1.558139534883721e-06, | |
| "logits/chosen": -0.71484375, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -123.5, | |
| "loss": 18.9131, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.1552734375, | |
| "rewards/margins": 0.38671875, | |
| "rewards/rejected": -0.54296875, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.22302889501960216, | |
| "grad_norm": 396.44061279296875, | |
| "learning_rate": 1.5534883720930233e-06, | |
| "logits/chosen": -0.69921875, | |
| "logits/rejected": -0.69140625, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -139.0, | |
| "loss": 21.1982, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.263671875, | |
| "rewards/margins": 0.2119140625, | |
| "rewards/rejected": -0.4765625, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.22535211267605634, | |
| "grad_norm": 340.9673156738281, | |
| "learning_rate": 1.5488372093023254e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -127.0, | |
| "loss": 19.959, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.1279296875, | |
| "rewards/margins": 0.296875, | |
| "rewards/rejected": -0.42578125, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.22767533033251053, | |
| "grad_norm": 338.022216796875, | |
| "learning_rate": 1.5441860465116278e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -124.0, | |
| "loss": 18.5508, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.16015625, | |
| "rewards/margins": 0.390625, | |
| "rewards/rejected": -0.55078125, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.2299985479889647, | |
| "grad_norm": 839.4739379882812, | |
| "learning_rate": 1.5395348837209301e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -126.5, | |
| "logps/rejected": -124.5, | |
| "loss": 20.8574, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": -0.2119140625, | |
| "rewards/margins": 0.185546875, | |
| "rewards/rejected": -0.3984375, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.2323217656454189, | |
| "grad_norm": 341.3218078613281, | |
| "learning_rate": 1.5348837209302325e-06, | |
| "logits/chosen": -0.72265625, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -114.0, | |
| "logps/rejected": -143.0, | |
| "loss": 16.5, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0233154296875, | |
| "rewards/margins": 0.57421875, | |
| "rewards/rejected": -0.55078125, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.23464498330187308, | |
| "grad_norm": 346.95849609375, | |
| "learning_rate": 1.5302325581395348e-06, | |
| "logits/chosen": -0.71875, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -124.5, | |
| "loss": 18.8315, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0247802734375, | |
| "rewards/margins": 0.48828125, | |
| "rewards/rejected": -0.515625, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.2369682009583273, | |
| "grad_norm": 293.3309326171875, | |
| "learning_rate": 1.5255813953488372e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -109.5, | |
| "loss": 16.605, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.00069427490234375, | |
| "rewards/margins": 0.55859375, | |
| "rewards/rejected": -0.55859375, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.23929141861478148, | |
| "grad_norm": 308.8841857910156, | |
| "learning_rate": 1.5209302325581395e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -130.0, | |
| "loss": 17.4863, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0162353515625, | |
| "rewards/margins": 0.494140625, | |
| "rewards/rejected": -0.5078125, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.24161463627123567, | |
| "grad_norm": 359.3336486816406, | |
| "learning_rate": 1.5162790697674417e-06, | |
| "logits/chosen": -0.6796875, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -135.0, | |
| "loss": 18.2041, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.039794921875, | |
| "rewards/margins": 0.462890625, | |
| "rewards/rejected": -0.50390625, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.24393785392768985, | |
| "grad_norm": 357.3771667480469, | |
| "learning_rate": 1.511627906976744e-06, | |
| "logits/chosen": -0.63671875, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -126.5, | |
| "loss": 19.3569, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.034423828125, | |
| "rewards/margins": 0.37109375, | |
| "rewards/rejected": -0.404296875, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.24626107158414404, | |
| "grad_norm": 306.6966552734375, | |
| "learning_rate": 1.5069767441860464e-06, | |
| "logits/chosen": -0.69140625, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -116.5, | |
| "loss": 15.3809, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": -0.01092529296875, | |
| "rewards/margins": 0.5859375, | |
| "rewards/rejected": -0.59765625, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.24858428924059822, | |
| "grad_norm": 330.71868896484375, | |
| "learning_rate": 1.5023255813953488e-06, | |
| "logits/chosen": -0.71484375, | |
| "logits/rejected": -0.734375, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -133.0, | |
| "loss": 18.6147, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.00238037109375, | |
| "rewards/margins": 0.44921875, | |
| "rewards/rejected": -0.4453125, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.25090750689705243, | |
| "grad_norm": 315.73272705078125, | |
| "learning_rate": 1.4976744186046511e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -137.0, | |
| "loss": 17.1006, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.025634765625, | |
| "rewards/margins": 0.486328125, | |
| "rewards/rejected": -0.4609375, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.2532307245535066, | |
| "grad_norm": 322.492919921875, | |
| "learning_rate": 1.4930232558139535e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -115.0, | |
| "loss": 18.3628, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.00384521484375, | |
| "rewards/margins": 0.40625, | |
| "rewards/rejected": -0.41015625, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.2555539422099608, | |
| "grad_norm": 309.7414855957031, | |
| "learning_rate": 1.4883720930232558e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.7109375, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -143.0, | |
| "loss": 15.1797, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1357421875, | |
| "rewards/margins": 0.6796875, | |
| "rewards/rejected": -0.546875, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.25787715986641496, | |
| "grad_norm": 295.3927917480469, | |
| "learning_rate": 1.4837209302325582e-06, | |
| "logits/chosen": -0.671875, | |
| "logits/rejected": -0.71484375, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -107.0, | |
| "loss": 15.5156, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1982421875, | |
| "rewards/margins": 0.67578125, | |
| "rewards/rejected": -0.478515625, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.2602003775228692, | |
| "grad_norm": 448.44561767578125, | |
| "learning_rate": 1.4790697674418603e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -133.0, | |
| "loss": 20.8838, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.04150390625, | |
| "rewards/margins": 0.3046875, | |
| "rewards/rejected": -0.345703125, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.2625235951793234, | |
| "grad_norm": 313.7855529785156, | |
| "learning_rate": 1.4744186046511627e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -122.5, | |
| "loss": 14.2803, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1044921875, | |
| "rewards/margins": 0.71484375, | |
| "rewards/rejected": -0.61328125, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.26484681283577755, | |
| "grad_norm": 323.4468688964844, | |
| "learning_rate": 1.469767441860465e-06, | |
| "logits/chosen": -0.67578125, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -153.0, | |
| "logps/rejected": -110.5, | |
| "loss": 14.3198, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.08984375, | |
| "rewards/margins": 0.6796875, | |
| "rewards/rejected": -0.58984375, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.26717003049223176, | |
| "grad_norm": 405.1533508300781, | |
| "learning_rate": 1.4651162790697674e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -142.0, | |
| "loss": 18.8086, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.0260009765625, | |
| "rewards/margins": 0.40625, | |
| "rewards/rejected": -0.43359375, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.2694932481486859, | |
| "grad_norm": 321.9844970703125, | |
| "learning_rate": 1.4604651162790697e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -130.0, | |
| "loss": 17.3525, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0093994140625, | |
| "rewards/margins": 0.48046875, | |
| "rewards/rejected": -0.470703125, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.27181646580514013, | |
| "grad_norm": 314.1150207519531, | |
| "learning_rate": 1.455813953488372e-06, | |
| "logits/chosen": -0.6640625, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -129.0, | |
| "loss": 15.6147, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.09765625, | |
| "rewards/margins": 0.65625, | |
| "rewards/rejected": -0.55859375, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.2741396834615943, | |
| "grad_norm": 352.8371276855469, | |
| "learning_rate": 1.4511627906976745e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -126.0, | |
| "loss": 16.1631, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0400390625, | |
| "rewards/margins": 0.54296875, | |
| "rewards/rejected": -0.50390625, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.2764629011180485, | |
| "grad_norm": 332.5674133300781, | |
| "learning_rate": 1.4465116279069766e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -138.0, | |
| "loss": 19.4419, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.06494140625, | |
| "rewards/margins": 0.359375, | |
| "rewards/rejected": -0.423828125, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.2787861187745027, | |
| "grad_norm": 315.2549133300781, | |
| "learning_rate": 1.441860465116279e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -118.0, | |
| "loss": 17.2822, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": -0.099609375, | |
| "rewards/margins": 0.46875, | |
| "rewards/rejected": -0.56640625, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.28110933643095687, | |
| "grad_norm": 478.6551818847656, | |
| "learning_rate": 1.4372093023255813e-06, | |
| "logits/chosen": -0.6953125, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -128.0, | |
| "loss": 17.1152, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0625, | |
| "rewards/margins": 0.5625, | |
| "rewards/rejected": -0.498046875, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.2834325540874111, | |
| "grad_norm": 391.9820251464844, | |
| "learning_rate": 1.4325581395348837e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -131.0, | |
| "loss": 20.3496, | |
| "rewards/accuracies": 0.59375, | |
| "rewards/chosen": -0.0390625, | |
| "rewards/margins": 0.3359375, | |
| "rewards/rejected": -0.376953125, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.28575577174386524, | |
| "grad_norm": 303.6994934082031, | |
| "learning_rate": 1.427906976744186e-06, | |
| "logits/chosen": -0.67578125, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -120.5, | |
| "loss": 13.2358, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1875, | |
| "rewards/margins": 0.890625, | |
| "rewards/rejected": -0.703125, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.28807898940031945, | |
| "grad_norm": 446.9607238769531, | |
| "learning_rate": 1.4232558139534882e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.76171875, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -159.0, | |
| "loss": 21.2852, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.197265625, | |
| "rewards/margins": 0.306640625, | |
| "rewards/rejected": -0.50390625, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.2904022070567736, | |
| "grad_norm": 445.76715087890625, | |
| "learning_rate": 1.4186046511627907e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -137.0, | |
| "loss": 21.9111, | |
| "rewards/accuracies": 0.5625, | |
| "rewards/chosen": -0.10302734375, | |
| "rewards/margins": 0.1767578125, | |
| "rewards/rejected": -0.279296875, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.2927254247132278, | |
| "grad_norm": 332.1394348144531, | |
| "learning_rate": 1.4139534883720929e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -117.5, | |
| "loss": 16.6499, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.02978515625, | |
| "rewards/margins": 0.6328125, | |
| "rewards/rejected": -0.6640625, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.29504864236968203, | |
| "grad_norm": 344.578857421875, | |
| "learning_rate": 1.4093023255813954e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -162.0, | |
| "logps/rejected": -116.0, | |
| "loss": 17.2349, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.14453125, | |
| "rewards/margins": 0.62109375, | |
| "rewards/rejected": -0.4765625, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.2973718600261362, | |
| "grad_norm": 346.4666748046875, | |
| "learning_rate": 1.4046511627906976e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -114.0, | |
| "logps/rejected": -124.5, | |
| "loss": 15.5078, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.032958984375, | |
| "rewards/margins": 0.640625, | |
| "rewards/rejected": -0.60546875, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.2996950776825904, | |
| "grad_norm": 299.059814453125, | |
| "learning_rate": 1.4e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -117.0, | |
| "loss": 15.9556, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.0213623046875, | |
| "rewards/margins": 0.66796875, | |
| "rewards/rejected": -0.6484375, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.30201829533904456, | |
| "grad_norm": 381.7353820800781, | |
| "learning_rate": 1.3953488372093023e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -133.0, | |
| "loss": 17.2666, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.045166015625, | |
| "rewards/margins": 0.51171875, | |
| "rewards/rejected": -0.5546875, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.3043415129954988, | |
| "grad_norm": 341.33587646484375, | |
| "learning_rate": 1.3906976744186044e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -133.0, | |
| "loss": 16.5908, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.034423828125, | |
| "rewards/margins": 0.60546875, | |
| "rewards/rejected": -0.5703125, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.30666473065195293, | |
| "grad_norm": 344.2981872558594, | |
| "learning_rate": 1.386046511627907e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -125.5, | |
| "loss": 17.6572, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": -0.1435546875, | |
| "rewards/margins": 0.455078125, | |
| "rewards/rejected": -0.59765625, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.30898794830840715, | |
| "grad_norm": 348.2516784667969, | |
| "learning_rate": 1.3813953488372091e-06, | |
| "logits/chosen": -0.71875, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -143.0, | |
| "loss": 16.5669, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.02734375, | |
| "rewards/margins": 0.6875, | |
| "rewards/rejected": -0.66015625, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.31131116596486136, | |
| "grad_norm": 362.1626892089844, | |
| "learning_rate": 1.3767441860465117e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -129.0, | |
| "loss": 18.2139, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.006195068359375, | |
| "rewards/margins": 0.5234375, | |
| "rewards/rejected": -0.515625, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.3136343836213155, | |
| "grad_norm": 353.5246887207031, | |
| "learning_rate": 1.3720930232558139e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -121.5, | |
| "loss": 13.8765, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.166015625, | |
| "rewards/margins": 0.88671875, | |
| "rewards/rejected": -0.71875, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.31595760127776973, | |
| "grad_norm": 372.60943603515625, | |
| "learning_rate": 1.3674418604651162e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -115.0, | |
| "loss": 17.5029, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1630859375, | |
| "rewards/margins": 0.55859375, | |
| "rewards/rejected": -0.39453125, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 0.3182808189342239, | |
| "grad_norm": 321.0161437988281, | |
| "learning_rate": 1.3627906976744186e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -121.5, | |
| "loss": 18.1797, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.123046875, | |
| "rewards/margins": 0.5, | |
| "rewards/rejected": -0.625, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 0.3206040365906781, | |
| "grad_norm": 446.3941345214844, | |
| "learning_rate": 1.3581395348837207e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -136.0, | |
| "loss": 20.2749, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.13671875, | |
| "rewards/margins": 0.32421875, | |
| "rewards/rejected": -0.4609375, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 0.32292725424713226, | |
| "grad_norm": 331.55670166015625, | |
| "learning_rate": 1.3534883720930233e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.73046875, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -128.0, | |
| "loss": 16.3931, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.0022125244140625, | |
| "rewards/margins": 0.66015625, | |
| "rewards/rejected": -0.66015625, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 0.32525047190358647, | |
| "grad_norm": 352.9888000488281, | |
| "learning_rate": 1.3488372093023254e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -132.0, | |
| "loss": 16.7803, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.029052734375, | |
| "rewards/margins": 0.60546875, | |
| "rewards/rejected": -0.6328125, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.3275736895600407, | |
| "grad_norm": 406.76025390625, | |
| "learning_rate": 1.344186046511628e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -159.0, | |
| "logps/rejected": -124.5, | |
| "loss": 20.5513, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.1513671875, | |
| "rewards/margins": 0.33984375, | |
| "rewards/rejected": -0.490234375, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 0.32989690721649484, | |
| "grad_norm": 329.72747802734375, | |
| "learning_rate": 1.3395348837209301e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -131.0, | |
| "loss": 15.2583, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.09716796875, | |
| "rewards/margins": 0.6796875, | |
| "rewards/rejected": -0.5859375, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 0.33222012487294905, | |
| "grad_norm": 353.4764709472656, | |
| "learning_rate": 1.3348837209302327e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -126.0, | |
| "loss": 15.2578, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1416015625, | |
| "rewards/margins": 0.75390625, | |
| "rewards/rejected": -0.61328125, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 0.3345433425294032, | |
| "grad_norm": 333.3570861816406, | |
| "learning_rate": 1.3302325581395348e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -125.0, | |
| "loss": 15.1777, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.11669921875, | |
| "rewards/margins": 0.77734375, | |
| "rewards/rejected": -0.66015625, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 0.3368665601858574, | |
| "grad_norm": 359.3620300292969, | |
| "learning_rate": 1.325581395348837e-06, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -154.0, | |
| "loss": 18.0942, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.04833984375, | |
| "rewards/margins": 0.494140625, | |
| "rewards/rejected": -0.4453125, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.3391897778423116, | |
| "grad_norm": 364.3636169433594, | |
| "learning_rate": 1.3209302325581396e-06, | |
| "logits/chosen": -0.7265625, | |
| "logits/rejected": -0.76953125, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -113.5, | |
| "loss": 18.7627, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.10791015625, | |
| "rewards/margins": 0.46484375, | |
| "rewards/rejected": -0.5703125, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 0.3415129954987658, | |
| "grad_norm": 402.0943908691406, | |
| "learning_rate": 1.3162790697674417e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.69921875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -137.0, | |
| "loss": 16.6462, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.04541015625, | |
| "rewards/margins": 0.6640625, | |
| "rewards/rejected": -0.6171875, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 0.34383621315522, | |
| "grad_norm": 381.5396728515625, | |
| "learning_rate": 1.3116279069767443e-06, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -130.0, | |
| "loss": 17.2354, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.05078125, | |
| "rewards/margins": 0.58984375, | |
| "rewards/rejected": -0.5390625, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 0.34615943081167416, | |
| "grad_norm": 329.5745544433594, | |
| "learning_rate": 1.3069767441860464e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -129.0, | |
| "loss": 14.4468, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.0140380859375, | |
| "rewards/margins": 0.7109375, | |
| "rewards/rejected": -0.6953125, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 0.3484826484681284, | |
| "grad_norm": 300.583740234375, | |
| "learning_rate": 1.302325581395349e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -116.5, | |
| "logps/rejected": -121.5, | |
| "loss": 14.4277, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0400390625, | |
| "rewards/margins": 0.77734375, | |
| "rewards/rejected": -0.73828125, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.35080586612458253, | |
| "grad_norm": 334.9747619628906, | |
| "learning_rate": 1.2976744186046511e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -123.0, | |
| "loss": 14.1069, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.208984375, | |
| "rewards/margins": 0.8515625, | |
| "rewards/rejected": -0.64453125, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 0.35312908378103675, | |
| "grad_norm": 321.225341796875, | |
| "learning_rate": 1.2930232558139533e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -124.5, | |
| "loss": 16.7876, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.16015625, | |
| "rewards/margins": 0.6640625, | |
| "rewards/rejected": -0.50390625, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.3554523014374909, | |
| "grad_norm": 405.748291015625, | |
| "learning_rate": 1.2883720930232558e-06, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -121.5, | |
| "logps/rejected": -126.0, | |
| "loss": 20.0581, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0693359375, | |
| "rewards/margins": 0.361328125, | |
| "rewards/rejected": -0.291015625, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 0.3577755190939451, | |
| "grad_norm": 368.13897705078125, | |
| "learning_rate": 1.283720930232558e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -126.0, | |
| "loss": 17.3945, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.10205078125, | |
| "rewards/margins": 0.5234375, | |
| "rewards/rejected": -0.62890625, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 0.36009873675039933, | |
| "grad_norm": 350.93634033203125, | |
| "learning_rate": 1.2790697674418605e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -117.0, | |
| "loss": 16.8164, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1787109375, | |
| "rewards/margins": 0.66796875, | |
| "rewards/rejected": -0.48828125, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.3624219544068535, | |
| "grad_norm": 415.9078674316406, | |
| "learning_rate": 1.2744186046511627e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -116.5, | |
| "logps/rejected": -144.0, | |
| "loss": 18.9238, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.09521484375, | |
| "rewards/margins": 0.455078125, | |
| "rewards/rejected": -0.361328125, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.3647451720633077, | |
| "grad_norm": 312.6370849609375, | |
| "learning_rate": 1.269767441860465e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -110.5, | |
| "logps/rejected": -138.0, | |
| "loss": 15.6787, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0986328125, | |
| "rewards/margins": 0.640625, | |
| "rewards/rejected": -0.54296875, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 0.36706838971976186, | |
| "grad_norm": 382.05224609375, | |
| "learning_rate": 1.2651162790697674e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -137.0, | |
| "loss": 19.4893, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.045654296875, | |
| "rewards/margins": 0.4375, | |
| "rewards/rejected": -0.392578125, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 0.36939160737621607, | |
| "grad_norm": 310.7190856933594, | |
| "learning_rate": 1.2604651162790697e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -138.0, | |
| "loss": 13.9204, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.265625, | |
| "rewards/margins": 0.859375, | |
| "rewards/rejected": -0.58984375, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 0.3717148250326702, | |
| "grad_norm": 389.124267578125, | |
| "learning_rate": 1.255813953488372e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.765625, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -152.0, | |
| "loss": 20.2124, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0064697265625, | |
| "rewards/margins": 0.3515625, | |
| "rewards/rejected": -0.34375, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.37403804268912444, | |
| "grad_norm": 375.34124755859375, | |
| "learning_rate": 1.2511627906976742e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -126.5, | |
| "logps/rejected": -134.0, | |
| "loss": 17.8145, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0242919921875, | |
| "rewards/margins": 0.51171875, | |
| "rewards/rejected": -0.48828125, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 0.37636126034557865, | |
| "grad_norm": 379.35711669921875, | |
| "learning_rate": 1.2465116279069768e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -130.0, | |
| "loss": 19.0, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": -0.020263671875, | |
| "rewards/margins": 0.37890625, | |
| "rewards/rejected": -0.3984375, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 0.3786844780020328, | |
| "grad_norm": 381.5658264160156, | |
| "learning_rate": 1.241860465116279e-06, | |
| "logits/chosen": -0.73046875, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -128.0, | |
| "loss": 15.1387, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.115234375, | |
| "rewards/margins": 0.6796875, | |
| "rewards/rejected": -0.5625, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 0.381007695658487, | |
| "grad_norm": 336.80560302734375, | |
| "learning_rate": 1.2372093023255813e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.7421875, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -128.0, | |
| "loss": 17.6543, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.1962890625, | |
| "rewards/margins": 0.55859375, | |
| "rewards/rejected": -0.361328125, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 0.3833309133149412, | |
| "grad_norm": 372.18060302734375, | |
| "learning_rate": 1.2325581395348837e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -126.5, | |
| "logps/rejected": -122.5, | |
| "loss": 18.4209, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0205078125, | |
| "rewards/margins": 0.416015625, | |
| "rewards/rejected": -0.4375, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.3856541309713954, | |
| "grad_norm": 344.254638671875, | |
| "learning_rate": 1.227906976744186e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -133.0, | |
| "loss": 15.5132, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.2236328125, | |
| "rewards/margins": 0.671875, | |
| "rewards/rejected": -0.447265625, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 0.38797734862784955, | |
| "grad_norm": 341.03778076171875, | |
| "learning_rate": 1.2232558139534884e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.74609375, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -126.5, | |
| "loss": 14.437, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.259765625, | |
| "rewards/margins": 0.7734375, | |
| "rewards/rejected": -0.51171875, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 0.39030056628430376, | |
| "grad_norm": 390.4228515625, | |
| "learning_rate": 1.2186046511627905e-06, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -143.0, | |
| "loss": 19.0215, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.02490234375, | |
| "rewards/margins": 0.443359375, | |
| "rewards/rejected": -0.41796875, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 0.392623783940758, | |
| "grad_norm": 351.5334167480469, | |
| "learning_rate": 1.213953488372093e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -115.5, | |
| "logps/rejected": -132.0, | |
| "loss": 15.6899, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.09765625, | |
| "rewards/margins": 0.69140625, | |
| "rewards/rejected": -0.59375, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 0.39494700159721213, | |
| "grad_norm": 328.7664794921875, | |
| "learning_rate": 1.2093023255813952e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -120.5, | |
| "logps/rejected": -121.5, | |
| "loss": 16.6416, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.181640625, | |
| "rewards/margins": 0.56640625, | |
| "rewards/rejected": -0.384765625, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.39727021925366635, | |
| "grad_norm": 341.4001159667969, | |
| "learning_rate": 1.2046511627906976e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.7734375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -120.5, | |
| "loss": 15.8726, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.263671875, | |
| "rewards/margins": 0.734375, | |
| "rewards/rejected": -0.47265625, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 0.3995934369101205, | |
| "grad_norm": 398.38494873046875, | |
| "learning_rate": 1.2e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -123.5, | |
| "loss": 16.7817, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.06884765625, | |
| "rewards/margins": 0.5625, | |
| "rewards/rejected": -0.494140625, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 0.4019166545665747, | |
| "grad_norm": 317.2485046386719, | |
| "learning_rate": 1.1953488372093023e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -127.0, | |
| "loss": 15.2124, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.3125, | |
| "rewards/margins": 0.8046875, | |
| "rewards/rejected": -0.4921875, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 0.4042398722230289, | |
| "grad_norm": 339.8619079589844, | |
| "learning_rate": 1.1906976744186047e-06, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -129.0, | |
| "loss": 15.6531, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.236328125, | |
| "rewards/margins": 0.703125, | |
| "rewards/rejected": -0.46875, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 0.4065630898794831, | |
| "grad_norm": 367.23388671875, | |
| "learning_rate": 1.186046511627907e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -121.0, | |
| "loss": 16.7554, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.130859375, | |
| "rewards/margins": 0.546875, | |
| "rewards/rejected": -0.4140625, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.4088863075359373, | |
| "grad_norm": 408.7874755859375, | |
| "learning_rate": 1.1813953488372092e-06, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -107.5, | |
| "loss": 15.5679, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2275390625, | |
| "rewards/margins": 0.69140625, | |
| "rewards/rejected": -0.462890625, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 0.41120952519239146, | |
| "grad_norm": 373.4058532714844, | |
| "learning_rate": 1.1767441860465115e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -134.0, | |
| "loss": 16.6733, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.1015625, | |
| "rewards/margins": 0.56640625, | |
| "rewards/rejected": -0.46484375, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.41353274284884567, | |
| "grad_norm": 384.1882629394531, | |
| "learning_rate": 1.1720930232558139e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -120.5, | |
| "logps/rejected": -128.0, | |
| "loss": 18.0225, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0086669921875, | |
| "rewards/margins": 0.482421875, | |
| "rewards/rejected": -0.47265625, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 0.4158559605052998, | |
| "grad_norm": 424.3437805175781, | |
| "learning_rate": 1.1674418604651162e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -166.0, | |
| "loss": 14.7715, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1630859375, | |
| "rewards/margins": 0.84765625, | |
| "rewards/rejected": -0.68359375, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 0.41817917816175404, | |
| "grad_norm": 329.7294921875, | |
| "learning_rate": 1.1627906976744186e-06, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -124.5, | |
| "loss": 16.3423, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.057861328125, | |
| "rewards/margins": 0.58203125, | |
| "rewards/rejected": -0.640625, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.4205023958182082, | |
| "grad_norm": 365.58685302734375, | |
| "learning_rate": 1.158139534883721e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -121.0, | |
| "logps/rejected": -113.5, | |
| "loss": 18.0498, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.05859375, | |
| "rewards/margins": 0.48828125, | |
| "rewards/rejected": -0.427734375, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 0.4228256134746624, | |
| "grad_norm": 369.9940185546875, | |
| "learning_rate": 1.1534883720930233e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -144.0, | |
| "loss": 15.6062, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1943359375, | |
| "rewards/margins": 0.76171875, | |
| "rewards/rejected": -0.56640625, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 0.4251488311311166, | |
| "grad_norm": 310.1455078125, | |
| "learning_rate": 1.1488372093023254e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -118.5, | |
| "logps/rejected": -112.5, | |
| "loss": 14.6064, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.07373046875, | |
| "rewards/margins": 0.73046875, | |
| "rewards/rejected": -0.65625, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 0.4274720487875708, | |
| "grad_norm": 396.49993896484375, | |
| "learning_rate": 1.1441860465116278e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -133.0, | |
| "loss": 18.1318, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.078125, | |
| "rewards/margins": 0.55859375, | |
| "rewards/rejected": -0.48046875, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 0.429795266444025, | |
| "grad_norm": 357.4013977050781, | |
| "learning_rate": 1.1395348837209301e-06, | |
| "logits/chosen": -0.75, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -154.0, | |
| "logps/rejected": -125.5, | |
| "loss": 16.7104, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": -0.043701171875, | |
| "rewards/margins": 0.5859375, | |
| "rewards/rejected": -0.62890625, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.43211848410047915, | |
| "grad_norm": 444.602783203125, | |
| "learning_rate": 1.1348837209302325e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -133.0, | |
| "loss": 18.6221, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0225830078125, | |
| "rewards/margins": 0.54296875, | |
| "rewards/rejected": -0.51953125, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 0.43444170175693336, | |
| "grad_norm": 329.8465881347656, | |
| "learning_rate": 1.1302325581395349e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -129.0, | |
| "loss": 13.6592, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.142578125, | |
| "rewards/margins": 0.875, | |
| "rewards/rejected": -0.734375, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 0.4367649194133875, | |
| "grad_norm": 460.20770263671875, | |
| "learning_rate": 1.1255813953488372e-06, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -124.0, | |
| "loss": 19.8032, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0498046875, | |
| "rewards/margins": 0.51953125, | |
| "rewards/rejected": -0.46875, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 0.43908813706984173, | |
| "grad_norm": 309.28607177734375, | |
| "learning_rate": 1.1209302325581396e-06, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -121.5, | |
| "loss": 12.8267, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.279296875, | |
| "rewards/margins": 1.0, | |
| "rewards/rejected": -0.72265625, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 0.44141135472629595, | |
| "grad_norm": 447.365966796875, | |
| "learning_rate": 1.1162790697674417e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -138.0, | |
| "loss": 16.2456, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.025146484375, | |
| "rewards/margins": 0.671875, | |
| "rewards/rejected": -0.64453125, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.4437345723827501, | |
| "grad_norm": 417.4530944824219, | |
| "learning_rate": 1.1116279069767443e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -117.5, | |
| "loss": 18.4092, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": -0.08154296875, | |
| "rewards/margins": 0.494140625, | |
| "rewards/rejected": -0.57421875, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 0.4460577900392043, | |
| "grad_norm": 324.08355712890625, | |
| "learning_rate": 1.1069767441860464e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -141.0, | |
| "loss": 13.7632, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.310546875, | |
| "rewards/margins": 0.96484375, | |
| "rewards/rejected": -0.65625, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 0.4483810076956585, | |
| "grad_norm": 342.5097961425781, | |
| "learning_rate": 1.1023255813953488e-06, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -104.5, | |
| "loss": 15.7559, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.048583984375, | |
| "rewards/margins": 0.7578125, | |
| "rewards/rejected": -0.70703125, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 0.4507042253521127, | |
| "grad_norm": 325.03057861328125, | |
| "learning_rate": 1.0976744186046511e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -119.0, | |
| "loss": 12.7759, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.33203125, | |
| "rewards/margins": 0.953125, | |
| "rewards/rejected": -0.62109375, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 0.45302744300856684, | |
| "grad_norm": 464.0077209472656, | |
| "learning_rate": 1.0930232558139535e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -124.0, | |
| "loss": 14.6401, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2734375, | |
| "rewards/margins": 0.99609375, | |
| "rewards/rejected": -0.72265625, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.45535066066502106, | |
| "grad_norm": 362.340087890625, | |
| "learning_rate": 1.0883720930232558e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -147.0, | |
| "loss": 14.5552, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.30078125, | |
| "rewards/margins": 0.7890625, | |
| "rewards/rejected": -0.490234375, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 0.45767387832147527, | |
| "grad_norm": 348.3215026855469, | |
| "learning_rate": 1.083720930232558e-06, | |
| "logits/chosen": -0.73828125, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -111.0, | |
| "loss": 16.4644, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.0018310546875, | |
| "rewards/margins": 0.6640625, | |
| "rewards/rejected": -0.66796875, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 0.4599970959779294, | |
| "grad_norm": 351.0652160644531, | |
| "learning_rate": 1.0790697674418605e-06, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -136.0, | |
| "loss": 14.1152, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.10986328125, | |
| "rewards/margins": 0.859375, | |
| "rewards/rejected": -0.75, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 0.46232031363438364, | |
| "grad_norm": 357.92828369140625, | |
| "learning_rate": 1.0744186046511627e-06, | |
| "logits/chosen": -0.734375, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -121.0, | |
| "loss": 13.2341, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.369140625, | |
| "rewards/margins": 0.94140625, | |
| "rewards/rejected": -0.57421875, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 0.4646435312908378, | |
| "grad_norm": 343.2197265625, | |
| "learning_rate": 1.069767441860465e-06, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -119.0, | |
| "loss": 14.146, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1943359375, | |
| "rewards/margins": 0.921875, | |
| "rewards/rejected": -0.73046875, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.466966748947292, | |
| "grad_norm": 545.7833862304688, | |
| "learning_rate": 1.0651162790697674e-06, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.7578125, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -125.5, | |
| "loss": 21.0857, | |
| "rewards/accuracies": 0.53125, | |
| "rewards/chosen": 0.05810546875, | |
| "rewards/margins": 0.484375, | |
| "rewards/rejected": -0.427734375, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 0.46928996660374617, | |
| "grad_norm": 369.3617248535156, | |
| "learning_rate": 1.0604651162790695e-06, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -120.0, | |
| "loss": 15.3125, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2080078125, | |
| "rewards/margins": 0.734375, | |
| "rewards/rejected": -0.52734375, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 0.4716131842602004, | |
| "grad_norm": 366.6146545410156, | |
| "learning_rate": 1.0558139534883721e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -122.0, | |
| "loss": 16.0518, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.08740234375, | |
| "rewards/margins": 0.6328125, | |
| "rewards/rejected": -0.546875, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 0.4739364019166546, | |
| "grad_norm": 375.0671691894531, | |
| "learning_rate": 1.0511627906976743e-06, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -148.0, | |
| "logps/rejected": -131.0, | |
| "loss": 17.3831, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2275390625, | |
| "rewards/margins": 0.60546875, | |
| "rewards/rejected": -0.37890625, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 0.47625961957310875, | |
| "grad_norm": 371.096435546875, | |
| "learning_rate": 1.0465116279069768e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.73828125, | |
| "logps/chosen": -107.5, | |
| "logps/rejected": -117.0, | |
| "loss": 17.873, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.369140625, | |
| "rewards/margins": 0.5546875, | |
| "rewards/rejected": -0.1865234375, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 0.47858283722956296, | |
| "grad_norm": 430.0856628417969, | |
| "learning_rate": 1.041860465116279e-06, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.72265625, | |
| "logps/chosen": -126.5, | |
| "logps/rejected": -139.0, | |
| "loss": 16.2949, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.11328125, | |
| "rewards/margins": 0.734375, | |
| "rewards/rejected": -0.62109375, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 0.4809060548860171, | |
| "grad_norm": 341.1052551269531, | |
| "learning_rate": 1.0372093023255815e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -123.5, | |
| "loss": 13.1196, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1865234375, | |
| "rewards/margins": 0.91015625, | |
| "rewards/rejected": -0.72265625, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 0.48322927254247133, | |
| "grad_norm": 346.2690734863281, | |
| "learning_rate": 1.0325581395348837e-06, | |
| "logits/chosen": -0.7890625, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -127.0, | |
| "loss": 15.2632, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.27734375, | |
| "rewards/margins": 0.765625, | |
| "rewards/rejected": -0.48828125, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 0.4855524901989255, | |
| "grad_norm": 368.310546875, | |
| "learning_rate": 1.0279069767441858e-06, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -129.0, | |
| "loss": 16.1709, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.0908203125, | |
| "rewards/margins": 0.71484375, | |
| "rewards/rejected": -0.625, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 0.4878757078553797, | |
| "grad_norm": 361.7778625488281, | |
| "learning_rate": 1.0232558139534884e-06, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -126.5, | |
| "loss": 16.666, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.216796875, | |
| "rewards/margins": 0.52734375, | |
| "rewards/rejected": -0.310546875, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.4901989255118339, | |
| "grad_norm": 360.10772705078125, | |
| "learning_rate": 1.0186046511627905e-06, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -139.0, | |
| "loss": 14.7661, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.322265625, | |
| "rewards/margins": 0.7890625, | |
| "rewards/rejected": -0.466796875, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 0.4925221431682881, | |
| "grad_norm": 329.1163635253906, | |
| "learning_rate": 1.013953488372093e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -119.5, | |
| "logps/rejected": -133.0, | |
| "loss": 13.1077, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.33984375, | |
| "rewards/margins": 1.0078125, | |
| "rewards/rejected": -0.66796875, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 0.4948453608247423, | |
| "grad_norm": 362.64532470703125, | |
| "learning_rate": 1.0093023255813952e-06, | |
| "logits/chosen": -0.7578125, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -117.0, | |
| "loss": 12.6914, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.4296875, | |
| "rewards/margins": 0.9921875, | |
| "rewards/rejected": -0.5625, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 0.49716857848119644, | |
| "grad_norm": 330.487060546875, | |
| "learning_rate": 1.0046511627906978e-06, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -114.0, | |
| "loss": 12.9277, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.43359375, | |
| "rewards/margins": 1.078125, | |
| "rewards/rejected": -0.64453125, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 0.49949179613765066, | |
| "grad_norm": 339.9930725097656, | |
| "learning_rate": 1e-06, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -141.0, | |
| "loss": 13.7705, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2294921875, | |
| "rewards/margins": 0.90234375, | |
| "rewards/rejected": -0.671875, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 0.5018150137941049, | |
| "grad_norm": 376.1474609375, | |
| "learning_rate": 9.953488372093023e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -123.0, | |
| "loss": 15.8398, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2431640625, | |
| "rewards/margins": 0.73828125, | |
| "rewards/rejected": -0.49609375, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 0.504138231450559, | |
| "grad_norm": 332.0564880371094, | |
| "learning_rate": 9.906976744186047e-07, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -115.5, | |
| "loss": 12.4272, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.298828125, | |
| "rewards/margins": 1.015625, | |
| "rewards/rejected": -0.7109375, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 0.5064614491070132, | |
| "grad_norm": 358.8477783203125, | |
| "learning_rate": 9.86046511627907e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -144.0, | |
| "loss": 15.3477, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.3203125, | |
| "rewards/margins": 0.73828125, | |
| "rewards/rejected": -0.41796875, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 0.5087846667634675, | |
| "grad_norm": 329.1252746582031, | |
| "learning_rate": 9.813953488372092e-07, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -114.0, | |
| "loss": 14.4053, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.1845703125, | |
| "rewards/margins": 0.76171875, | |
| "rewards/rejected": -0.578125, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 0.5111078844199216, | |
| "grad_norm": 333.0457763671875, | |
| "learning_rate": 9.767441860465115e-07, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -125.5, | |
| "loss": 14.3213, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.34375, | |
| "rewards/margins": 0.88671875, | |
| "rewards/rejected": -0.54296875, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.5134311020763758, | |
| "grad_norm": 371.3757019042969, | |
| "learning_rate": 9.720930232558139e-07, | |
| "logits/chosen": -0.76953125, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -116.0, | |
| "loss": 12.0801, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.361328125, | |
| "rewards/margins": 1.1328125, | |
| "rewards/rejected": -0.76953125, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 0.5157543197328299, | |
| "grad_norm": 422.3089599609375, | |
| "learning_rate": 9.674418604651162e-07, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -114.5, | |
| "loss": 11.6069, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.43359375, | |
| "rewards/margins": 1.2265625, | |
| "rewards/rejected": -0.7890625, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 0.5180775373892842, | |
| "grad_norm": 410.4743957519531, | |
| "learning_rate": 9.627906976744186e-07, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.75, | |
| "logps/chosen": -115.5, | |
| "logps/rejected": -145.0, | |
| "loss": 16.8779, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.11767578125, | |
| "rewards/margins": 0.62109375, | |
| "rewards/rejected": -0.50390625, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 0.5204007550457384, | |
| "grad_norm": 311.5373840332031, | |
| "learning_rate": 9.58139534883721e-07, | |
| "logits/chosen": -0.75390625, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -131.0, | |
| "loss": 10.292, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.498046875, | |
| "rewards/margins": 1.2890625, | |
| "rewards/rejected": -0.7890625, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 0.5227239727021925, | |
| "grad_norm": 366.3830261230469, | |
| "learning_rate": 9.534883720930232e-07, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -132.0, | |
| "loss": 17.2888, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.2001953125, | |
| "rewards/margins": 0.69921875, | |
| "rewards/rejected": -0.5, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.5250471903586468, | |
| "grad_norm": 361.7061767578125, | |
| "learning_rate": 9.488372093023255e-07, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -133.0, | |
| "loss": 14.6245, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2236328125, | |
| "rewards/margins": 0.9140625, | |
| "rewards/rejected": -0.6875, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 0.5273704080151009, | |
| "grad_norm": 289.1031494140625, | |
| "learning_rate": 9.441860465116278e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -120.5, | |
| "loss": 12.0532, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.357421875, | |
| "rewards/margins": 1.0546875, | |
| "rewards/rejected": -0.703125, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 0.5296936256715551, | |
| "grad_norm": 355.6830749511719, | |
| "learning_rate": 9.395348837209302e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -143.0, | |
| "loss": 14.6467, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.1650390625, | |
| "rewards/margins": 0.94140625, | |
| "rewards/rejected": -0.77734375, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 0.5320168433280092, | |
| "grad_norm": 387.17864990234375, | |
| "learning_rate": 9.348837209302325e-07, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.77734375, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -137.0, | |
| "loss": 15.71, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.271484375, | |
| "rewards/margins": 0.796875, | |
| "rewards/rejected": -0.5234375, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 0.5343400609844635, | |
| "grad_norm": 399.5079040527344, | |
| "learning_rate": 9.302325581395349e-07, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -132.0, | |
| "loss": 16.8394, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.0732421875, | |
| "rewards/margins": 0.8046875, | |
| "rewards/rejected": -0.73046875, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.5366632786409177, | |
| "grad_norm": 360.01348876953125, | |
| "learning_rate": 9.255813953488372e-07, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -126.0, | |
| "loss": 12.9294, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.201171875, | |
| "rewards/margins": 1.125, | |
| "rewards/rejected": -0.921875, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 0.5389864962973718, | |
| "grad_norm": 427.7103271484375, | |
| "learning_rate": 9.209302325581395e-07, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -137.0, | |
| "loss": 15.2183, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2294921875, | |
| "rewards/margins": 0.94140625, | |
| "rewards/rejected": -0.7109375, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 0.5413097139538261, | |
| "grad_norm": 412.2069091796875, | |
| "learning_rate": 9.162790697674418e-07, | |
| "logits/chosen": -0.76171875, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -118.5, | |
| "loss": 13.958, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.298828125, | |
| "rewards/margins": 0.9609375, | |
| "rewards/rejected": -0.6640625, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 0.5436329316102803, | |
| "grad_norm": 363.20806884765625, | |
| "learning_rate": 9.116279069767442e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -132.0, | |
| "loss": 14.4912, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.318359375, | |
| "rewards/margins": 0.8671875, | |
| "rewards/rejected": -0.55078125, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 0.5459561492667344, | |
| "grad_norm": 347.8995056152344, | |
| "learning_rate": 9.069767441860464e-07, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -111.5, | |
| "loss": 13.7517, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.24609375, | |
| "rewards/margins": 0.99609375, | |
| "rewards/rejected": -0.75, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 0.5482793669231886, | |
| "grad_norm": 466.9878234863281, | |
| "learning_rate": 9.023255813953488e-07, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -126.0, | |
| "loss": 15.3323, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.30859375, | |
| "rewards/margins": 0.9609375, | |
| "rewards/rejected": -0.65234375, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 0.5506025845796428, | |
| "grad_norm": 300.74114990234375, | |
| "learning_rate": 8.976744186046511e-07, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -122.5, | |
| "loss": 10.8423, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.34375, | |
| "rewards/margins": 1.21875, | |
| "rewards/rejected": -0.875, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 0.552925802236097, | |
| "grad_norm": 392.69732666015625, | |
| "learning_rate": 8.930232558139534e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -144.0, | |
| "loss": 13.8433, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1474609375, | |
| "rewards/margins": 0.86328125, | |
| "rewards/rejected": -0.71484375, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 0.5552490198925512, | |
| "grad_norm": 417.43267822265625, | |
| "learning_rate": 8.883720930232557e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -137.0, | |
| "loss": 17.3145, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.004486083984375, | |
| "rewards/margins": 0.6796875, | |
| "rewards/rejected": -0.67578125, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 0.5575722375490054, | |
| "grad_norm": 454.0508728027344, | |
| "learning_rate": 8.837209302325581e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -118.0, | |
| "logps/rejected": -134.0, | |
| "loss": 15.6741, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.265625, | |
| "rewards/margins": 0.890625, | |
| "rewards/rejected": -0.62890625, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.5598954552054596, | |
| "grad_norm": 406.51776123046875, | |
| "learning_rate": 8.790697674418605e-07, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -124.0, | |
| "loss": 15.2039, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.34375, | |
| "rewards/margins": 0.92578125, | |
| "rewards/rejected": -0.58203125, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 0.5622186728619137, | |
| "grad_norm": 351.84161376953125, | |
| "learning_rate": 8.744186046511628e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -102.5, | |
| "logps/rejected": -129.0, | |
| "loss": 14.2102, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.236328125, | |
| "rewards/margins": 0.83984375, | |
| "rewards/rejected": -0.6015625, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 0.5645418905183679, | |
| "grad_norm": 320.64697265625, | |
| "learning_rate": 8.697674418604651e-07, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -117.0, | |
| "logps/rejected": -122.5, | |
| "loss": 13.1212, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.27734375, | |
| "rewards/margins": 1.03125, | |
| "rewards/rejected": -0.75390625, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 0.5668651081748222, | |
| "grad_norm": 513.0429077148438, | |
| "learning_rate": 8.651162790697674e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -132.0, | |
| "loss": 16.1929, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.296875, | |
| "rewards/margins": 0.78515625, | |
| "rewards/rejected": -0.486328125, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 0.5691883258312763, | |
| "grad_norm": 381.1427307128906, | |
| "learning_rate": 8.604651162790697e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -143.0, | |
| "loss": 13.3257, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.29296875, | |
| "rewards/margins": 1.09375, | |
| "rewards/rejected": -0.796875, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 0.5715115434877305, | |
| "grad_norm": 387.599609375, | |
| "learning_rate": 8.55813953488372e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.7890625, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -129.0, | |
| "loss": 15.1045, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.32421875, | |
| "rewards/margins": 0.796875, | |
| "rewards/rejected": -0.474609375, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 0.5738347611441847, | |
| "grad_norm": 390.8743896484375, | |
| "learning_rate": 8.511627906976744e-07, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -117.0, | |
| "logps/rejected": -127.0, | |
| "loss": 13.1274, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2314453125, | |
| "rewards/margins": 1.03125, | |
| "rewards/rejected": -0.80078125, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 0.5761579788006389, | |
| "grad_norm": 420.9767150878906, | |
| "learning_rate": 8.465116279069767e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -155.0, | |
| "loss": 16.0874, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.08251953125, | |
| "rewards/margins": 0.59375, | |
| "rewards/rejected": -0.51171875, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 0.5784811964570931, | |
| "grad_norm": 335.92889404296875, | |
| "learning_rate": 8.418604651162791e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -120.0, | |
| "loss": 13.8997, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.216796875, | |
| "rewards/margins": 0.83203125, | |
| "rewards/rejected": -0.61328125, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 0.5808044141135472, | |
| "grad_norm": 404.8393249511719, | |
| "learning_rate": 8.372093023255814e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -122.5, | |
| "loss": 12.1406, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.2080078125, | |
| "rewards/margins": 1.1171875, | |
| "rewards/rejected": -0.91015625, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.5831276317700015, | |
| "grad_norm": 451.52215576171875, | |
| "learning_rate": 8.325581395348836e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -136.0, | |
| "loss": 16.7639, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.07666015625, | |
| "rewards/margins": 0.76953125, | |
| "rewards/rejected": -0.6953125, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 0.5854508494264556, | |
| "grad_norm": 417.9267272949219, | |
| "learning_rate": 8.279069767441859e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -129.0, | |
| "loss": 15.8306, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.126953125, | |
| "rewards/margins": 0.82421875, | |
| "rewards/rejected": -0.69921875, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 0.5877740670829098, | |
| "grad_norm": 612.1698608398438, | |
| "learning_rate": 8.232558139534883e-07, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -151.0, | |
| "logps/rejected": -116.5, | |
| "loss": 16.5623, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.095703125, | |
| "rewards/margins": 0.79296875, | |
| "rewards/rejected": -0.69921875, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 0.5900972847393641, | |
| "grad_norm": 562.412841796875, | |
| "learning_rate": 8.186046511627906e-07, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -136.0, | |
| "loss": 13.9282, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.341796875, | |
| "rewards/margins": 0.87890625, | |
| "rewards/rejected": -0.5390625, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 0.5924205023958182, | |
| "grad_norm": 406.9609069824219, | |
| "learning_rate": 8.13953488372093e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -111.5, | |
| "logps/rejected": -125.0, | |
| "loss": 17.4863, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.3359375, | |
| "rewards/margins": 0.68359375, | |
| "rewards/rejected": -0.349609375, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 0.5947437200522724, | |
| "grad_norm": 319.95379638671875, | |
| "learning_rate": 8.093023255813954e-07, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -135.0, | |
| "loss": 12.2905, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.3125, | |
| "rewards/margins": 1.1171875, | |
| "rewards/rejected": -0.8046875, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 0.5970669377087265, | |
| "grad_norm": 390.3863830566406, | |
| "learning_rate": 8.046511627906977e-07, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.79296875, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -157.0, | |
| "loss": 12.9624, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.361328125, | |
| "rewards/margins": 1.078125, | |
| "rewards/rejected": -0.71484375, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 0.5993901553651808, | |
| "grad_norm": 345.5944519042969, | |
| "learning_rate": 8e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -123.5, | |
| "logps/rejected": -128.0, | |
| "loss": 12.6313, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.486328125, | |
| "rewards/margins": 1.046875, | |
| "rewards/rejected": -0.55859375, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 0.601713373021635, | |
| "grad_norm": 388.45977783203125, | |
| "learning_rate": 7.953488372093022e-07, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.8046875, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -127.5, | |
| "loss": 18.2397, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.064453125, | |
| "rewards/margins": 0.671875, | |
| "rewards/rejected": -0.609375, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 0.6040365906780891, | |
| "grad_norm": 361.9543151855469, | |
| "learning_rate": 7.906976744186046e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -127.5, | |
| "loss": 14.9993, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.33984375, | |
| "rewards/margins": 0.8984375, | |
| "rewards/rejected": -0.55859375, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.6063598083345434, | |
| "grad_norm": 364.9945068359375, | |
| "learning_rate": 7.860465116279069e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -115.0, | |
| "loss": 14.9531, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.1318359375, | |
| "rewards/margins": 0.94140625, | |
| "rewards/rejected": -0.80859375, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 0.6086830259909976, | |
| "grad_norm": 347.11456298828125, | |
| "learning_rate": 7.813953488372093e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -148.0, | |
| "loss": 13.252, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.201171875, | |
| "rewards/margins": 1.0, | |
| "rewards/rejected": -0.796875, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 0.6110062436474517, | |
| "grad_norm": 344.5708923339844, | |
| "learning_rate": 7.767441860465116e-07, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -136.0, | |
| "loss": 12.5537, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.40234375, | |
| "rewards/margins": 1.1171875, | |
| "rewards/rejected": -0.71484375, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 0.6133294613039059, | |
| "grad_norm": 509.060546875, | |
| "learning_rate": 7.720930232558139e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -128.0, | |
| "loss": 19.3247, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": -0.06396484375, | |
| "rewards/margins": 0.486328125, | |
| "rewards/rejected": -0.55078125, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 0.6156526789603601, | |
| "grad_norm": 385.6347961425781, | |
| "learning_rate": 7.674418604651162e-07, | |
| "logits/chosen": -0.74609375, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -129.0, | |
| "loss": 12.175, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.423828125, | |
| "rewards/margins": 1.1015625, | |
| "rewards/rejected": -0.67578125, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 0.6179758966168143, | |
| "grad_norm": 498.9085693359375, | |
| "learning_rate": 7.627906976744186e-07, | |
| "logits/chosen": -0.7421875, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -114.5, | |
| "loss": 18.3779, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.36328125, | |
| "rewards/margins": 0.63671875, | |
| "rewards/rejected": -0.2734375, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 0.6202991142732684, | |
| "grad_norm": 372.6788024902344, | |
| "learning_rate": 7.581395348837208e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -156.0, | |
| "logps/rejected": -146.0, | |
| "loss": 13.3494, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.33984375, | |
| "rewards/margins": 0.93359375, | |
| "rewards/rejected": -0.59375, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 0.6226223319297227, | |
| "grad_norm": 336.4404296875, | |
| "learning_rate": 7.534883720930232e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -130.0, | |
| "loss": 14.1318, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.28125, | |
| "rewards/margins": 0.765625, | |
| "rewards/rejected": -0.482421875, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 0.6249455495861769, | |
| "grad_norm": 320.9569091796875, | |
| "learning_rate": 7.488372093023256e-07, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -117.0, | |
| "logps/rejected": -120.5, | |
| "loss": 13.8899, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.349609375, | |
| "rewards/margins": 1.015625, | |
| "rewards/rejected": -0.66796875, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 0.627268767242631, | |
| "grad_norm": 370.9262390136719, | |
| "learning_rate": 7.441860465116279e-07, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -120.0, | |
| "loss": 15.52, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.345703125, | |
| "rewards/margins": 1.0390625, | |
| "rewards/rejected": -0.6953125, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.6295919848990852, | |
| "grad_norm": 367.8063049316406, | |
| "learning_rate": 7.395348837209302e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -130.0, | |
| "loss": 12.3782, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.310546875, | |
| "rewards/margins": 1.1328125, | |
| "rewards/rejected": -0.82421875, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 0.6319152025555395, | |
| "grad_norm": 301.8444519042969, | |
| "learning_rate": 7.348837209302325e-07, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -125.5, | |
| "loss": 11.4189, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.53515625, | |
| "rewards/margins": 1.171875, | |
| "rewards/rejected": -0.63671875, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 0.6342384202119936, | |
| "grad_norm": 344.16143798828125, | |
| "learning_rate": 7.302325581395349e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -117.5, | |
| "loss": 13.3252, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.421875, | |
| "rewards/margins": 1.0703125, | |
| "rewards/rejected": -0.65234375, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 0.6365616378684478, | |
| "grad_norm": 368.489013671875, | |
| "learning_rate": 7.255813953488372e-07, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -141.0, | |
| "loss": 12.7842, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.34375, | |
| "rewards/margins": 0.96484375, | |
| "rewards/rejected": -0.62109375, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 0.638884855524902, | |
| "grad_norm": 365.506103515625, | |
| "learning_rate": 7.209302325581395e-07, | |
| "logits/chosen": -0.765625, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -139.0, | |
| "loss": 13.6389, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.412109375, | |
| "rewards/margins": 1.1953125, | |
| "rewards/rejected": -0.7890625, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.6412080731813562, | |
| "grad_norm": 352.22149658203125, | |
| "learning_rate": 7.162790697674418e-07, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -126.5, | |
| "loss": 15.0649, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.1982421875, | |
| "rewards/margins": 0.8203125, | |
| "rewards/rejected": -0.62109375, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 0.6435312908378104, | |
| "grad_norm": 391.1148376464844, | |
| "learning_rate": 7.116279069767441e-07, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -119.0, | |
| "loss": 14.7524, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.310546875, | |
| "rewards/margins": 0.8671875, | |
| "rewards/rejected": -0.5546875, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 0.6458545084942645, | |
| "grad_norm": 473.5135192871094, | |
| "learning_rate": 7.069767441860464e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -124.0, | |
| "loss": 17.1322, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.279296875, | |
| "rewards/margins": 0.6875, | |
| "rewards/rejected": -0.41015625, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 0.6481777261507188, | |
| "grad_norm": 492.3699035644531, | |
| "learning_rate": 7.023255813953488e-07, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -127.5, | |
| "loss": 17.5245, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.1533203125, | |
| "rewards/margins": 0.84375, | |
| "rewards/rejected": -0.69140625, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 0.6505009438071729, | |
| "grad_norm": 311.95196533203125, | |
| "learning_rate": 6.976744186046511e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -118.5, | |
| "logps/rejected": -134.0, | |
| "loss": 10.3682, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.408203125, | |
| "rewards/margins": 1.4921875, | |
| "rewards/rejected": -1.0859375, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.6528241614636271, | |
| "grad_norm": 401.4697265625, | |
| "learning_rate": 6.930232558139535e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -127.5, | |
| "loss": 15.7085, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.162109375, | |
| "rewards/margins": 0.6796875, | |
| "rewards/rejected": -0.515625, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 0.6551473791200814, | |
| "grad_norm": 343.4604797363281, | |
| "learning_rate": 6.883720930232559e-07, | |
| "logits/chosen": -0.77734375, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -128.0, | |
| "loss": 12.6093, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.43359375, | |
| "rewards/margins": 1.1328125, | |
| "rewards/rejected": -0.703125, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 0.6574705967765355, | |
| "grad_norm": 415.1707763671875, | |
| "learning_rate": 6.837209302325581e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.921875, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -118.5, | |
| "loss": 15.4015, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2119140625, | |
| "rewards/margins": 0.8203125, | |
| "rewards/rejected": -0.60546875, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 0.6597938144329897, | |
| "grad_norm": 355.2691955566406, | |
| "learning_rate": 6.790697674418604e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -121.0, | |
| "logps/rejected": -129.0, | |
| "loss": 13.1781, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.2001953125, | |
| "rewards/margins": 1.125, | |
| "rewards/rejected": -0.92578125, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 0.6621170320894438, | |
| "grad_norm": 384.2412109375, | |
| "learning_rate": 6.744186046511627e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.9140625, | |
| "logps/chosen": -115.5, | |
| "logps/rejected": -141.0, | |
| "loss": 13.6726, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.466796875, | |
| "rewards/margins": 1.2421875, | |
| "rewards/rejected": -0.77734375, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 0.6644402497458981, | |
| "grad_norm": 376.3741760253906, | |
| "learning_rate": 6.697674418604651e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -140.0, | |
| "loss": 11.1071, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.369140625, | |
| "rewards/margins": 1.265625, | |
| "rewards/rejected": -0.89453125, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 0.6667634674023523, | |
| "grad_norm": 347.0726318359375, | |
| "learning_rate": 6.651162790697674e-07, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -124.0, | |
| "loss": 11.7656, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.369140625, | |
| "rewards/margins": 1.2578125, | |
| "rewards/rejected": -0.88671875, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 0.6690866850588064, | |
| "grad_norm": 383.8744812011719, | |
| "learning_rate": 6.604651162790698e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -129.0, | |
| "loss": 12.8174, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.193359375, | |
| "rewards/margins": 0.96875, | |
| "rewards/rejected": -0.77734375, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 0.6714099027152607, | |
| "grad_norm": 527.3011474609375, | |
| "learning_rate": 6.558139534883721e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -143.0, | |
| "loss": 16.5997, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.10107421875, | |
| "rewards/margins": 1.015625, | |
| "rewards/rejected": -0.9140625, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 0.6737331203717148, | |
| "grad_norm": 494.76416015625, | |
| "learning_rate": 6.511627906976745e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -143.0, | |
| "loss": 17.8811, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.154296875, | |
| "rewards/margins": 0.66796875, | |
| "rewards/rejected": -0.51171875, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.676056338028169, | |
| "grad_norm": 327.0135192871094, | |
| "learning_rate": 6.465116279069766e-07, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -118.5, | |
| "logps/rejected": -131.0, | |
| "loss": 12.48, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.61328125, | |
| "rewards/margins": 1.125, | |
| "rewards/rejected": -0.5078125, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 0.6783795556846232, | |
| "grad_norm": 452.2313537597656, | |
| "learning_rate": 6.41860465116279e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -138.0, | |
| "loss": 15.7837, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.275390625, | |
| "rewards/margins": 0.7890625, | |
| "rewards/rejected": -0.515625, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 0.6807027733410774, | |
| "grad_norm": 388.10711669921875, | |
| "learning_rate": 6.372093023255813e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -134.0, | |
| "loss": 14.0817, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.279296875, | |
| "rewards/margins": 1.0234375, | |
| "rewards/rejected": -0.74609375, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 0.6830259909975316, | |
| "grad_norm": 385.43841552734375, | |
| "learning_rate": 6.325581395348837e-07, | |
| "logits/chosen": -0.8046875, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -131.0, | |
| "loss": 13.6246, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.373046875, | |
| "rewards/margins": 1.0859375, | |
| "rewards/rejected": -0.71484375, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 0.6853492086539857, | |
| "grad_norm": 378.17828369140625, | |
| "learning_rate": 6.27906976744186e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.78515625, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -119.0, | |
| "loss": 14.5515, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.337890625, | |
| "rewards/margins": 0.9609375, | |
| "rewards/rejected": -0.62109375, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 0.68767242631044, | |
| "grad_norm": 425.79541015625, | |
| "learning_rate": 6.232558139534884e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -112.5, | |
| "logps/rejected": -127.5, | |
| "loss": 15.4453, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.216796875, | |
| "rewards/margins": 0.85546875, | |
| "rewards/rejected": -0.63671875, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 0.6899956439668942, | |
| "grad_norm": 355.3722229003906, | |
| "learning_rate": 6.186046511627907e-07, | |
| "logits/chosen": -0.91015625, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -125.0, | |
| "logps/rejected": -112.5, | |
| "loss": 14.6904, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.0966796875, | |
| "rewards/margins": 0.89453125, | |
| "rewards/rejected": -0.796875, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 0.6923188616233483, | |
| "grad_norm": 446.3829345703125, | |
| "learning_rate": 6.13953488372093e-07, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -121.0, | |
| "loss": 14.7679, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.3671875, | |
| "rewards/margins": 1.046875, | |
| "rewards/rejected": -0.6796875, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 0.6946420792798025, | |
| "grad_norm": 335.9494934082031, | |
| "learning_rate": 6.093023255813953e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -116.5, | |
| "logps/rejected": -138.0, | |
| "loss": 13.0884, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.373046875, | |
| "rewards/margins": 1.140625, | |
| "rewards/rejected": -0.765625, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 0.6969652969362568, | |
| "grad_norm": 363.8542785644531, | |
| "learning_rate": 6.046511627906976e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.828125, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -136.0, | |
| "loss": 13.2286, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.474609375, | |
| "rewards/margins": 1.109375, | |
| "rewards/rejected": -0.63671875, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.6992885145927109, | |
| "grad_norm": 400.0084228515625, | |
| "learning_rate": 6e-07, | |
| "logits/chosen": -0.90234375, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -117.5, | |
| "logps/rejected": -132.0, | |
| "loss": 15.1213, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.46484375, | |
| "rewards/margins": 0.9375, | |
| "rewards/rejected": -0.47265625, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 0.7016117322491651, | |
| "grad_norm": 314.22222900390625, | |
| "learning_rate": 5.953488372093023e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -128.0, | |
| "loss": 10.8384, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.396484375, | |
| "rewards/margins": 1.359375, | |
| "rewards/rejected": -0.96484375, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 0.7039349499056193, | |
| "grad_norm": 351.50970458984375, | |
| "learning_rate": 5.906976744186046e-07, | |
| "logits/chosen": -0.7734375, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -124.0, | |
| "loss": 9.9349, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.671875, | |
| "rewards/margins": 1.640625, | |
| "rewards/rejected": -0.96875, | |
| "step": 303 | |
| }, | |
| { | |
| "epoch": 0.7062581675620735, | |
| "grad_norm": 476.5926513671875, | |
| "learning_rate": 5.860465116279069e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.80078125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -168.0, | |
| "loss": 16.6069, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.1357421875, | |
| "rewards/margins": 0.91015625, | |
| "rewards/rejected": -0.7734375, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 0.7085813852185276, | |
| "grad_norm": 353.9723815917969, | |
| "learning_rate": 5.813953488372093e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -144.0, | |
| "loss": 11.542, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.5703125, | |
| "rewards/margins": 1.25, | |
| "rewards/rejected": -0.6796875, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 0.7109046028749818, | |
| "grad_norm": 428.2142639160156, | |
| "learning_rate": 5.767441860465116e-07, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -138.0, | |
| "loss": 15.2681, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.26171875, | |
| "rewards/margins": 1.0390625, | |
| "rewards/rejected": -0.77734375, | |
| "step": 306 | |
| }, | |
| { | |
| "epoch": 0.7132278205314361, | |
| "grad_norm": 391.52825927734375, | |
| "learning_rate": 5.720930232558139e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -147.0, | |
| "logps/rejected": -122.5, | |
| "loss": 15.5105, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.42578125, | |
| "rewards/margins": 0.8984375, | |
| "rewards/rejected": -0.47265625, | |
| "step": 307 | |
| }, | |
| { | |
| "epoch": 0.7155510381878902, | |
| "grad_norm": 314.70806884765625, | |
| "learning_rate": 5.674418604651162e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -125.0, | |
| "logps/rejected": -149.0, | |
| "loss": 12.5325, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.3046875, | |
| "rewards/margins": 1.1953125, | |
| "rewards/rejected": -0.88671875, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 0.7178742558443444, | |
| "grad_norm": 393.9562072753906, | |
| "learning_rate": 5.627906976744186e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -130.0, | |
| "loss": 13.47, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.314453125, | |
| "rewards/margins": 1.0546875, | |
| "rewards/rejected": -0.7421875, | |
| "step": 309 | |
| }, | |
| { | |
| "epoch": 0.7201974735007987, | |
| "grad_norm": 400.5484313964844, | |
| "learning_rate": 5.581395348837209e-07, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -113.0, | |
| "logps/rejected": -127.5, | |
| "loss": 13.4608, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.55078125, | |
| "rewards/margins": 1.1171875, | |
| "rewards/rejected": -0.5703125, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.7225206911572528, | |
| "grad_norm": 422.0895080566406, | |
| "learning_rate": 5.534883720930232e-07, | |
| "logits/chosen": -0.91015625, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -147.0, | |
| "loss": 13.0371, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.27734375, | |
| "rewards/margins": 1.0859375, | |
| "rewards/rejected": -0.8125, | |
| "step": 311 | |
| }, | |
| { | |
| "epoch": 0.724843908813707, | |
| "grad_norm": 412.68701171875, | |
| "learning_rate": 5.488372093023256e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -133.0, | |
| "loss": 14.7341, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.32421875, | |
| "rewards/margins": 0.8203125, | |
| "rewards/rejected": -0.49609375, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 0.7271671264701611, | |
| "grad_norm": 419.086181640625, | |
| "learning_rate": 5.441860465116279e-07, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.796875, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -135.0, | |
| "loss": 16.5369, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.306640625, | |
| "rewards/margins": 0.90625, | |
| "rewards/rejected": -0.6015625, | |
| "step": 313 | |
| }, | |
| { | |
| "epoch": 0.7294903441266154, | |
| "grad_norm": 337.012939453125, | |
| "learning_rate": 5.395348837209303e-07, | |
| "logits/chosen": -0.89453125, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -117.0, | |
| "loss": 12.7517, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.59765625, | |
| "rewards/margins": 1.15625, | |
| "rewards/rejected": -0.55859375, | |
| "step": 314 | |
| }, | |
| { | |
| "epoch": 0.7318135617830696, | |
| "grad_norm": 365.5719909667969, | |
| "learning_rate": 5.348837209302325e-07, | |
| "logits/chosen": -0.79296875, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -154.0, | |
| "logps/rejected": -137.0, | |
| "loss": 11.0121, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.54296875, | |
| "rewards/margins": 1.5546875, | |
| "rewards/rejected": -1.015625, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 0.7341367794395237, | |
| "grad_norm": 565.3271484375, | |
| "learning_rate": 5.302325581395348e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -121.0, | |
| "logps/rejected": -139.0, | |
| "loss": 14.5569, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.4609375, | |
| "rewards/margins": 0.95703125, | |
| "rewards/rejected": -0.4921875, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 0.736459997095978, | |
| "grad_norm": 336.31488037109375, | |
| "learning_rate": 5.255813953488371e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -126.5, | |
| "loss": 14.0077, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.228515625, | |
| "rewards/margins": 1.1953125, | |
| "rewards/rejected": -0.96484375, | |
| "step": 317 | |
| }, | |
| { | |
| "epoch": 0.7387832147524321, | |
| "grad_norm": 331.0687561035156, | |
| "learning_rate": 5.209302325581395e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -130.0, | |
| "loss": 10.2217, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.5546875, | |
| "rewards/margins": 1.6015625, | |
| "rewards/rejected": -1.046875, | |
| "step": 318 | |
| }, | |
| { | |
| "epoch": 0.7411064324088863, | |
| "grad_norm": 337.7515869140625, | |
| "learning_rate": 5.162790697674418e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -141.0, | |
| "loss": 10.2466, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.6171875, | |
| "rewards/margins": 1.3828125, | |
| "rewards/rejected": -0.76953125, | |
| "step": 319 | |
| }, | |
| { | |
| "epoch": 0.7434296500653405, | |
| "grad_norm": 439.6629333496094, | |
| "learning_rate": 5.116279069767442e-07, | |
| "logits/chosen": -0.90625, | |
| "logits/rejected": -0.90625, | |
| "logps/chosen": -111.0, | |
| "logps/rejected": -143.0, | |
| "loss": 14.8419, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.275390625, | |
| "rewards/margins": 0.96875, | |
| "rewards/rejected": -0.6953125, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.7457528677217947, | |
| "grad_norm": 315.7960510253906, | |
| "learning_rate": 5.069767441860466e-07, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -134.0, | |
| "loss": 10.7461, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.703125, | |
| "rewards/margins": 1.390625, | |
| "rewards/rejected": -0.68359375, | |
| "step": 321 | |
| }, | |
| { | |
| "epoch": 0.7480760853782489, | |
| "grad_norm": 443.8883361816406, | |
| "learning_rate": 5.023255813953489e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -133.0, | |
| "loss": 13.2231, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.306640625, | |
| "rewards/margins": 1.1328125, | |
| "rewards/rejected": -0.82421875, | |
| "step": 322 | |
| }, | |
| { | |
| "epoch": 0.750399303034703, | |
| "grad_norm": 381.8203430175781, | |
| "learning_rate": 4.976744186046512e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -131.0, | |
| "loss": 14.0621, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.412109375, | |
| "rewards/margins": 1.1640625, | |
| "rewards/rejected": -0.7578125, | |
| "step": 323 | |
| }, | |
| { | |
| "epoch": 0.7527225206911573, | |
| "grad_norm": 361.1136779785156, | |
| "learning_rate": 4.930232558139535e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -132.0, | |
| "loss": 13.6553, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.3203125, | |
| "rewards/margins": 1.2109375, | |
| "rewards/rejected": -0.88671875, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 0.7550457383476115, | |
| "grad_norm": 307.30291748046875, | |
| "learning_rate": 4.883720930232558e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -140.0, | |
| "loss": 8.7594, | |
| "rewards/accuracies": 0.9375, | |
| "rewards/chosen": 0.55859375, | |
| "rewards/margins": 1.609375, | |
| "rewards/rejected": -1.046875, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 0.7573689560040656, | |
| "grad_norm": 372.7316589355469, | |
| "learning_rate": 4.837209302325581e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.80859375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -120.0, | |
| "loss": 12.6277, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.33984375, | |
| "rewards/margins": 1.1875, | |
| "rewards/rejected": -0.84375, | |
| "step": 326 | |
| }, | |
| { | |
| "epoch": 0.7596921736605198, | |
| "grad_norm": 349.4411926269531, | |
| "learning_rate": 4.790697674418605e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -130.0, | |
| "loss": 12.8553, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.1787109375, | |
| "rewards/margins": 1.109375, | |
| "rewards/rejected": -0.92578125, | |
| "step": 327 | |
| }, | |
| { | |
| "epoch": 0.762015391316974, | |
| "grad_norm": 353.19378662109375, | |
| "learning_rate": 4.7441860465116277e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -148.0, | |
| "loss": 12.5149, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.328125, | |
| "rewards/margins": 1.09375, | |
| "rewards/rejected": -0.76171875, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 0.7643386089734282, | |
| "grad_norm": 523.6749267578125, | |
| "learning_rate": 4.697674418604651e-07, | |
| "logits/chosen": -0.88671875, | |
| "logits/rejected": -0.9140625, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -125.0, | |
| "loss": 16.2698, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.10595703125, | |
| "rewards/margins": 0.80859375, | |
| "rewards/rejected": -0.703125, | |
| "step": 329 | |
| }, | |
| { | |
| "epoch": 0.7666618266298824, | |
| "grad_norm": 528.6472778320312, | |
| "learning_rate": 4.6511627906976743e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -150.0, | |
| "loss": 14.6694, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.09033203125, | |
| "rewards/margins": 0.86328125, | |
| "rewards/rejected": -0.7734375, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.7689850442863366, | |
| "grad_norm": 313.93438720703125, | |
| "learning_rate": 4.6046511627906973e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -122.0, | |
| "loss": 11.8145, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.0341796875, | |
| "rewards/margins": 1.171875, | |
| "rewards/rejected": -1.140625, | |
| "step": 331 | |
| }, | |
| { | |
| "epoch": 0.7713082619427908, | |
| "grad_norm": 389.487548828125, | |
| "learning_rate": 4.558139534883721e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -150.0, | |
| "logps/rejected": -122.5, | |
| "loss": 15.3645, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.36328125, | |
| "rewards/margins": 0.8359375, | |
| "rewards/rejected": -0.47265625, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 0.7736314795992449, | |
| "grad_norm": 380.62176513671875, | |
| "learning_rate": 4.511627906976744e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -129.0, | |
| "loss": 14.4519, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3125, | |
| "rewards/margins": 0.98828125, | |
| "rewards/rejected": -0.67578125, | |
| "step": 333 | |
| }, | |
| { | |
| "epoch": 0.7759546972556991, | |
| "grad_norm": 415.103271484375, | |
| "learning_rate": 4.465116279069767e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -150.0, | |
| "loss": 16.2168, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.310546875, | |
| "rewards/margins": 0.6953125, | |
| "rewards/rejected": -0.38671875, | |
| "step": 334 | |
| }, | |
| { | |
| "epoch": 0.7782779149121534, | |
| "grad_norm": 305.7278747558594, | |
| "learning_rate": 4.4186046511627905e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -117.5, | |
| "logps/rejected": -136.0, | |
| "loss": 11.343, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.490234375, | |
| "rewards/margins": 1.1640625, | |
| "rewards/rejected": -0.671875, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 0.7806011325686075, | |
| "grad_norm": 395.62188720703125, | |
| "learning_rate": 4.372093023255814e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -132.0, | |
| "logps/rejected": -133.0, | |
| "loss": 13.4861, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.32421875, | |
| "rewards/margins": 1.0, | |
| "rewards/rejected": -0.67578125, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 0.7829243502250617, | |
| "grad_norm": 344.2076721191406, | |
| "learning_rate": 4.325581395348837e-07, | |
| "logits/chosen": -0.765625, | |
| "logits/rejected": -0.83203125, | |
| "logps/chosen": -119.0, | |
| "logps/rejected": -123.0, | |
| "loss": 10.615, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.5703125, | |
| "rewards/margins": 1.4140625, | |
| "rewards/rejected": -0.84375, | |
| "step": 337 | |
| }, | |
| { | |
| "epoch": 0.785247567881516, | |
| "grad_norm": 415.8197937011719, | |
| "learning_rate": 4.27906976744186e-07, | |
| "logits/chosen": -0.81640625, | |
| "logits/rejected": -0.82421875, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -130.0, | |
| "loss": 13.9437, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2353515625, | |
| "rewards/margins": 1.1640625, | |
| "rewards/rejected": -0.92578125, | |
| "step": 338 | |
| }, | |
| { | |
| "epoch": 0.7875707855379701, | |
| "grad_norm": 395.5925598144531, | |
| "learning_rate": 4.2325581395348836e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -125.0, | |
| "loss": 17.0851, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.17578125, | |
| "rewards/margins": 0.609375, | |
| "rewards/rejected": -0.431640625, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 0.7898940031944243, | |
| "grad_norm": 383.22491455078125, | |
| "learning_rate": 4.186046511627907e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.91015625, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -122.0, | |
| "loss": 14.2013, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.287109375, | |
| "rewards/margins": 0.9296875, | |
| "rewards/rejected": -0.64453125, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.7922172208508784, | |
| "grad_norm": 465.37054443359375, | |
| "learning_rate": 4.1395348837209297e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -148.0, | |
| "loss": 14.8139, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.59375, | |
| "rewards/margins": 1.0859375, | |
| "rewards/rejected": -0.49609375, | |
| "step": 341 | |
| }, | |
| { | |
| "epoch": 0.7945404385073327, | |
| "grad_norm": 355.3705139160156, | |
| "learning_rate": 4.093023255813953e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -144.0, | |
| "loss": 12.0349, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.416015625, | |
| "rewards/margins": 1.28125, | |
| "rewards/rejected": -0.86328125, | |
| "step": 342 | |
| }, | |
| { | |
| "epoch": 0.7968636561637868, | |
| "grad_norm": 389.9146728515625, | |
| "learning_rate": 4.046511627906977e-07, | |
| "logits/chosen": -0.88671875, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -119.5, | |
| "loss": 15.8198, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.32421875, | |
| "rewards/margins": 0.921875, | |
| "rewards/rejected": -0.59375, | |
| "step": 343 | |
| }, | |
| { | |
| "epoch": 0.799186873820241, | |
| "grad_norm": 367.7712707519531, | |
| "learning_rate": 4e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -134.0, | |
| "loss": 12.8025, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.396484375, | |
| "rewards/margins": 1.15625, | |
| "rewards/rejected": -0.76171875, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 0.8015100914766953, | |
| "grad_norm": 416.6552734375, | |
| "learning_rate": 3.953488372093023e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -152.0, | |
| "logps/rejected": -128.0, | |
| "loss": 13.7512, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.3671875, | |
| "rewards/margins": 1.046875, | |
| "rewards/rejected": -0.6796875, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 0.8038333091331494, | |
| "grad_norm": 402.32452392578125, | |
| "learning_rate": 3.9069767441860464e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -126.0, | |
| "loss": 14.7258, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2138671875, | |
| "rewards/margins": 1.2265625, | |
| "rewards/rejected": -1.015625, | |
| "step": 346 | |
| }, | |
| { | |
| "epoch": 0.8061565267896036, | |
| "grad_norm": 414.1297607421875, | |
| "learning_rate": 3.8604651162790694e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -134.0, | |
| "loss": 12.463, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.54296875, | |
| "rewards/margins": 1.203125, | |
| "rewards/rejected": -0.65625, | |
| "step": 347 | |
| }, | |
| { | |
| "epoch": 0.8084797444460577, | |
| "grad_norm": 489.4559631347656, | |
| "learning_rate": 3.813953488372093e-07, | |
| "logits/chosen": -0.78515625, | |
| "logits/rejected": -0.75390625, | |
| "logps/chosen": -114.0, | |
| "logps/rejected": -150.0, | |
| "loss": 14.2197, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.24609375, | |
| "rewards/margins": 1.1328125, | |
| "rewards/rejected": -0.8828125, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 0.810802962102512, | |
| "grad_norm": 359.0513610839844, | |
| "learning_rate": 3.767441860465116e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -119.0, | |
| "loss": 12.5353, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.318359375, | |
| "rewards/margins": 1.2109375, | |
| "rewards/rejected": -0.890625, | |
| "step": 349 | |
| }, | |
| { | |
| "epoch": 0.8131261797589662, | |
| "grad_norm": 373.05609130859375, | |
| "learning_rate": 3.7209302325581396e-07, | |
| "logits/chosen": -0.90625, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -129.0, | |
| "loss": 12.506, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.30859375, | |
| "rewards/margins": 1.2578125, | |
| "rewards/rejected": -0.953125, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.8154493974154203, | |
| "grad_norm": 456.4620666503906, | |
| "learning_rate": 3.6744186046511626e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -131.0, | |
| "loss": 14.227, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.357421875, | |
| "rewards/margins": 1.1796875, | |
| "rewards/rejected": -0.82421875, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 0.8177726150718746, | |
| "grad_norm": 366.9906921386719, | |
| "learning_rate": 3.627906976744186e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -137.0, | |
| "loss": 13.6667, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.1298828125, | |
| "rewards/margins": 1.0390625, | |
| "rewards/rejected": -0.9140625, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 0.8200958327283288, | |
| "grad_norm": 344.71661376953125, | |
| "learning_rate": 3.581395348837209e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -139.0, | |
| "logps/rejected": -122.5, | |
| "loss": 11.369, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.66796875, | |
| "rewards/margins": 1.3671875, | |
| "rewards/rejected": -0.703125, | |
| "step": 353 | |
| }, | |
| { | |
| "epoch": 0.8224190503847829, | |
| "grad_norm": 364.9308166503906, | |
| "learning_rate": 3.534883720930232e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -126.5, | |
| "loss": 14.8368, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.271484375, | |
| "rewards/margins": 0.96875, | |
| "rewards/rejected": -0.6953125, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 0.8247422680412371, | |
| "grad_norm": 478.8648376464844, | |
| "learning_rate": 3.4883720930232557e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -120.5, | |
| "loss": 17.2244, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.30859375, | |
| "rewards/margins": 1.015625, | |
| "rewards/rejected": -0.7109375, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 0.8270654856976913, | |
| "grad_norm": 376.8917236328125, | |
| "learning_rate": 3.4418604651162793e-07, | |
| "logits/chosen": -0.80859375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -120.5, | |
| "loss": 13.5175, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.412109375, | |
| "rewards/margins": 1.125, | |
| "rewards/rejected": -0.71484375, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 0.8293887033541455, | |
| "grad_norm": 364.0615234375, | |
| "learning_rate": 3.395348837209302e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -116.0, | |
| "logps/rejected": -121.5, | |
| "loss": 12.5255, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.55078125, | |
| "rewards/margins": 1.3359375, | |
| "rewards/rejected": -0.7890625, | |
| "step": 357 | |
| }, | |
| { | |
| "epoch": 0.8317119210105997, | |
| "grad_norm": 353.6752624511719, | |
| "learning_rate": 3.3488372093023253e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.875, | |
| "logps/chosen": -119.0, | |
| "logps/rejected": -117.0, | |
| "loss": 12.7742, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.423828125, | |
| "rewards/margins": 1.3203125, | |
| "rewards/rejected": -0.8984375, | |
| "step": 358 | |
| }, | |
| { | |
| "epoch": 0.8340351386670539, | |
| "grad_norm": 373.83966064453125, | |
| "learning_rate": 3.302325581395349e-07, | |
| "logits/chosen": -0.890625, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -129.0, | |
| "loss": 13.6439, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.47265625, | |
| "rewards/margins": 1.1015625, | |
| "rewards/rejected": -0.625, | |
| "step": 359 | |
| }, | |
| { | |
| "epoch": 0.8363583563235081, | |
| "grad_norm": 372.99908447265625, | |
| "learning_rate": 3.2558139534883724e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -120.5, | |
| "logps/rejected": -122.5, | |
| "loss": 10.6753, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.53515625, | |
| "rewards/margins": 1.625, | |
| "rewards/rejected": -1.0859375, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.8386815739799622, | |
| "grad_norm": 441.1159973144531, | |
| "learning_rate": 3.209302325581395e-07, | |
| "logits/chosen": -0.8125, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -133.0, | |
| "loss": 9.8108, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.6875, | |
| "rewards/margins": 1.5390625, | |
| "rewards/rejected": -0.8515625, | |
| "step": 361 | |
| }, | |
| { | |
| "epoch": 0.8410047916364164, | |
| "grad_norm": 469.9103088378906, | |
| "learning_rate": 3.1627906976744185e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -121.5, | |
| "loss": 13.8306, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.341796875, | |
| "rewards/margins": 1.1640625, | |
| "rewards/rejected": -0.8203125, | |
| "step": 362 | |
| }, | |
| { | |
| "epoch": 0.8433280092928707, | |
| "grad_norm": 459.4384765625, | |
| "learning_rate": 3.116279069767442e-07, | |
| "logits/chosen": -0.80078125, | |
| "logits/rejected": -0.78125, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -132.0, | |
| "loss": 16.8385, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.287109375, | |
| "rewards/margins": 1.09375, | |
| "rewards/rejected": -0.8046875, | |
| "step": 363 | |
| }, | |
| { | |
| "epoch": 0.8456512269493248, | |
| "grad_norm": 475.96575927734375, | |
| "learning_rate": 3.069767441860465e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.84375, | |
| "logps/chosen": -124.5, | |
| "logps/rejected": -153.0, | |
| "loss": 14.3564, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.33203125, | |
| "rewards/margins": 0.953125, | |
| "rewards/rejected": -0.62109375, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 0.847974444605779, | |
| "grad_norm": 376.33319091796875, | |
| "learning_rate": 3.023255813953488e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -126.0, | |
| "logps/rejected": -129.0, | |
| "loss": 13.5657, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.302734375, | |
| "rewards/margins": 1.1953125, | |
| "rewards/rejected": -0.890625, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 0.8502976622622332, | |
| "grad_norm": 366.171875, | |
| "learning_rate": 2.9767441860465116e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -117.0, | |
| "logps/rejected": -124.0, | |
| "loss": 12.0715, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.53515625, | |
| "rewards/margins": 1.203125, | |
| "rewards/rejected": -0.66796875, | |
| "step": 366 | |
| }, | |
| { | |
| "epoch": 0.8526208799186874, | |
| "grad_norm": 388.7607116699219, | |
| "learning_rate": 2.9302325581395347e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -127.0, | |
| "loss": 12.8401, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.296875, | |
| "rewards/margins": 1.0703125, | |
| "rewards/rejected": -0.7734375, | |
| "step": 367 | |
| }, | |
| { | |
| "epoch": 0.8549440975751416, | |
| "grad_norm": 359.4689025878906, | |
| "learning_rate": 2.883720930232558e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -118.0, | |
| "loss": 12.6276, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.4921875, | |
| "rewards/margins": 1.2421875, | |
| "rewards/rejected": -0.75, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 0.8572673152315957, | |
| "grad_norm": 436.34637451171875, | |
| "learning_rate": 2.837209302325581e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -119.5, | |
| "loss": 15.5687, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2734375, | |
| "rewards/margins": 0.953125, | |
| "rewards/rejected": -0.6796875, | |
| "step": 369 | |
| }, | |
| { | |
| "epoch": 0.85959053288805, | |
| "grad_norm": 460.02642822265625, | |
| "learning_rate": 2.7906976744186043e-07, | |
| "logits/chosen": -0.921875, | |
| "logits/rejected": -0.92578125, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -126.5, | |
| "loss": 14.6654, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.306640625, | |
| "rewards/margins": 1.1875, | |
| "rewards/rejected": -0.8828125, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.8619137505445041, | |
| "grad_norm": 482.4629211425781, | |
| "learning_rate": 2.744186046511628e-07, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -140.0, | |
| "logps/rejected": -137.0, | |
| "loss": 19.0223, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.2001953125, | |
| "rewards/margins": 0.64453125, | |
| "rewards/rejected": -0.443359375, | |
| "step": 371 | |
| }, | |
| { | |
| "epoch": 0.8642369682009583, | |
| "grad_norm": 430.52734375, | |
| "learning_rate": 2.6976744186046514e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -112.5, | |
| "logps/rejected": -150.0, | |
| "loss": 15.3828, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.3515625, | |
| "rewards/margins": 0.8984375, | |
| "rewards/rejected": -0.546875, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 0.8665601858574126, | |
| "grad_norm": 435.8709716796875, | |
| "learning_rate": 2.651162790697674e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -132.0, | |
| "loss": 15.0752, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.27734375, | |
| "rewards/margins": 0.92578125, | |
| "rewards/rejected": -0.6484375, | |
| "step": 373 | |
| }, | |
| { | |
| "epoch": 0.8688834035138667, | |
| "grad_norm": 341.1181335449219, | |
| "learning_rate": 2.6046511627906974e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.89453125, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -130.0, | |
| "loss": 10.693, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.44140625, | |
| "rewards/margins": 1.4921875, | |
| "rewards/rejected": -1.046875, | |
| "step": 374 | |
| }, | |
| { | |
| "epoch": 0.8712066211703209, | |
| "grad_norm": 432.8375549316406, | |
| "learning_rate": 2.558139534883721e-07, | |
| "logits/chosen": -0.82421875, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -111.0, | |
| "logps/rejected": -132.0, | |
| "loss": 16.0132, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.3828125, | |
| "rewards/margins": 0.98828125, | |
| "rewards/rejected": -0.60546875, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 0.873529838826775, | |
| "grad_norm": 496.7705993652344, | |
| "learning_rate": 2.5116279069767445e-07, | |
| "logits/chosen": -0.83203125, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -127.5, | |
| "logps/rejected": -125.5, | |
| "loss": 13.1619, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.376953125, | |
| "rewards/margins": 1.4453125, | |
| "rewards/rejected": -1.0703125, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 0.8758530564832293, | |
| "grad_norm": 475.2943420410156, | |
| "learning_rate": 2.4651162790697676e-07, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.90625, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -127.0, | |
| "loss": 17.3145, | |
| "rewards/accuracies": 0.625, | |
| "rewards/chosen": 0.31640625, | |
| "rewards/margins": 0.921875, | |
| "rewards/rejected": -0.60546875, | |
| "step": 377 | |
| }, | |
| { | |
| "epoch": 0.8781762741396835, | |
| "grad_norm": 360.33929443359375, | |
| "learning_rate": 2.4186046511627906e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.84765625, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -121.5, | |
| "loss": 12.2108, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.486328125, | |
| "rewards/margins": 1.15625, | |
| "rewards/rejected": -0.66796875, | |
| "step": 378 | |
| }, | |
| { | |
| "epoch": 0.8804994917961376, | |
| "grad_norm": 417.58416748046875, | |
| "learning_rate": 2.3720930232558139e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.8203125, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -114.0, | |
| "loss": 14.0455, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.42578125, | |
| "rewards/margins": 1.125, | |
| "rewards/rejected": -0.69921875, | |
| "step": 379 | |
| }, | |
| { | |
| "epoch": 0.8828227094525919, | |
| "grad_norm": 360.6600036621094, | |
| "learning_rate": 2.3255813953488372e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -125.5, | |
| "logps/rejected": -129.0, | |
| "loss": 11.5916, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.494140625, | |
| "rewards/margins": 1.3359375, | |
| "rewards/rejected": -0.84375, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.885145927109046, | |
| "grad_norm": 603.400390625, | |
| "learning_rate": 2.2790697674418604e-07, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -137.0, | |
| "loss": 15.2494, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.333984375, | |
| "rewards/margins": 1.0859375, | |
| "rewards/rejected": -0.74609375, | |
| "step": 381 | |
| }, | |
| { | |
| "epoch": 0.8874691447655002, | |
| "grad_norm": 387.8462829589844, | |
| "learning_rate": 2.2325581395348835e-07, | |
| "logits/chosen": -0.921875, | |
| "logits/rejected": -0.921875, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -139.0, | |
| "loss": 13.0447, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.349609375, | |
| "rewards/margins": 1.0234375, | |
| "rewards/rejected": -0.67578125, | |
| "step": 382 | |
| }, | |
| { | |
| "epoch": 0.8897923624219544, | |
| "grad_norm": 379.9131164550781, | |
| "learning_rate": 2.186046511627907e-07, | |
| "logits/chosen": -0.91015625, | |
| "logits/rejected": -0.9140625, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -128.0, | |
| "loss": 10.8182, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.39453125, | |
| "rewards/margins": 1.46875, | |
| "rewards/rejected": -1.0703125, | |
| "step": 383 | |
| }, | |
| { | |
| "epoch": 0.8921155800784086, | |
| "grad_norm": 429.8023681640625, | |
| "learning_rate": 2.13953488372093e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.90625, | |
| "logps/chosen": -115.5, | |
| "logps/rejected": -130.0, | |
| "loss": 16.3474, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.333984375, | |
| "rewards/margins": 0.90234375, | |
| "rewards/rejected": -0.56640625, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 0.8944387977348628, | |
| "grad_norm": 399.4114685058594, | |
| "learning_rate": 2.0930232558139536e-07, | |
| "logits/chosen": -0.90625, | |
| "logits/rejected": -0.92578125, | |
| "logps/chosen": -123.0, | |
| "logps/rejected": -119.5, | |
| "loss": 15.1389, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.42578125, | |
| "rewards/margins": 0.92578125, | |
| "rewards/rejected": -0.5, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 0.896762015391317, | |
| "grad_norm": 387.39788818359375, | |
| "learning_rate": 2.0465116279069766e-07, | |
| "logits/chosen": -0.91796875, | |
| "logits/rejected": -0.90234375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -130.0, | |
| "loss": 12.6393, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.447265625, | |
| "rewards/margins": 1.3203125, | |
| "rewards/rejected": -0.87109375, | |
| "step": 386 | |
| }, | |
| { | |
| "epoch": 0.8990852330477712, | |
| "grad_norm": 433.6268310546875, | |
| "learning_rate": 2e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -147.0, | |
| "loss": 16.6982, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.263671875, | |
| "rewards/margins": 0.6171875, | |
| "rewards/rejected": -0.35546875, | |
| "step": 387 | |
| }, | |
| { | |
| "epoch": 0.9014084507042254, | |
| "grad_norm": 478.2352600097656, | |
| "learning_rate": 1.9534883720930232e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -136.0, | |
| "logps/rejected": -142.0, | |
| "loss": 15.4782, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.373046875, | |
| "rewards/margins": 1.0390625, | |
| "rewards/rejected": -0.6640625, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 0.9037316683606795, | |
| "grad_norm": 321.55224609375, | |
| "learning_rate": 1.9069767441860465e-07, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.9140625, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -119.5, | |
| "loss": 11.955, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.5703125, | |
| "rewards/margins": 1.2890625, | |
| "rewards/rejected": -0.71484375, | |
| "step": 389 | |
| }, | |
| { | |
| "epoch": 0.9060548860171337, | |
| "grad_norm": 389.5977478027344, | |
| "learning_rate": 1.8604651162790698e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -120.5, | |
| "loss": 12.9778, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.60546875, | |
| "rewards/margins": 1.234375, | |
| "rewards/rejected": -0.62890625, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.908378103673588, | |
| "grad_norm": 358.9306640625, | |
| "learning_rate": 1.813953488372093e-07, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -113.5, | |
| "loss": 11.2094, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.4609375, | |
| "rewards/margins": 1.5078125, | |
| "rewards/rejected": -1.046875, | |
| "step": 391 | |
| }, | |
| { | |
| "epoch": 0.9107013213300421, | |
| "grad_norm": 554.0177612304688, | |
| "learning_rate": 1.767441860465116e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.921875, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -149.0, | |
| "loss": 20.13, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.267578125, | |
| "rewards/margins": 0.734375, | |
| "rewards/rejected": -0.46484375, | |
| "step": 392 | |
| }, | |
| { | |
| "epoch": 0.9130245389864963, | |
| "grad_norm": 366.87103271484375, | |
| "learning_rate": 1.7209302325581396e-07, | |
| "logits/chosen": -0.78125, | |
| "logits/rejected": -0.8125, | |
| "logps/chosen": -134.0, | |
| "logps/rejected": -138.0, | |
| "loss": 10.4358, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.6328125, | |
| "rewards/margins": 1.53125, | |
| "rewards/rejected": -0.89453125, | |
| "step": 393 | |
| }, | |
| { | |
| "epoch": 0.9153477566429505, | |
| "grad_norm": 392.17437744140625, | |
| "learning_rate": 1.6744186046511627e-07, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -131.0, | |
| "logps/rejected": -128.0, | |
| "loss": 13.6418, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.56640625, | |
| "rewards/margins": 1.3359375, | |
| "rewards/rejected": -0.765625, | |
| "step": 394 | |
| }, | |
| { | |
| "epoch": 0.9176709742994047, | |
| "grad_norm": 317.3909912109375, | |
| "learning_rate": 1.6279069767441862e-07, | |
| "logits/chosen": -0.859375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -146.0, | |
| "logps/rejected": -119.0, | |
| "loss": 10.7445, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.41015625, | |
| "rewards/margins": 1.2734375, | |
| "rewards/rejected": -0.86328125, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 0.9199941919558589, | |
| "grad_norm": 375.08453369140625, | |
| "learning_rate": 1.5813953488372092e-07, | |
| "logits/chosen": -0.8671875, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -123.5, | |
| "loss": 10.4174, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.431640625, | |
| "rewards/margins": 1.5078125, | |
| "rewards/rejected": -1.078125, | |
| "step": 396 | |
| }, | |
| { | |
| "epoch": 0.922317409612313, | |
| "grad_norm": 379.6015319824219, | |
| "learning_rate": 1.5348837209302325e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.91015625, | |
| "logps/chosen": -116.0, | |
| "logps/rejected": -119.0, | |
| "loss": 13.0293, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.66796875, | |
| "rewards/margins": 1.0234375, | |
| "rewards/rejected": -0.353515625, | |
| "step": 397 | |
| }, | |
| { | |
| "epoch": 0.9246406272687673, | |
| "grad_norm": 399.4117431640625, | |
| "learning_rate": 1.4883720930232558e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -121.5, | |
| "loss": 14.1611, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.6484375, | |
| "rewards/margins": 1.109375, | |
| "rewards/rejected": -0.4609375, | |
| "step": 398 | |
| }, | |
| { | |
| "epoch": 0.9269638449252214, | |
| "grad_norm": 325.7952880859375, | |
| "learning_rate": 1.441860465116279e-07, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.921875, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -125.5, | |
| "loss": 12.9187, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.54296875, | |
| "rewards/margins": 1.1171875, | |
| "rewards/rejected": -0.57421875, | |
| "step": 399 | |
| }, | |
| { | |
| "epoch": 0.9292870625816756, | |
| "grad_norm": 504.759033203125, | |
| "learning_rate": 1.3953488372093021e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.90234375, | |
| "logps/chosen": -137.0, | |
| "logps/rejected": -148.0, | |
| "loss": 13.8368, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.330078125, | |
| "rewards/margins": 1.1015625, | |
| "rewards/rejected": -0.7734375, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.9316102802381299, | |
| "grad_norm": 399.3138122558594, | |
| "learning_rate": 1.3488372093023257e-07, | |
| "logits/chosen": -0.86328125, | |
| "logits/rejected": -0.90234375, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -117.5, | |
| "loss": 14.4127, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.2490234375, | |
| "rewards/margins": 1.015625, | |
| "rewards/rejected": -0.765625, | |
| "step": 401 | |
| }, | |
| { | |
| "epoch": 0.933933497894584, | |
| "grad_norm": 487.4891357421875, | |
| "learning_rate": 1.3023255813953487e-07, | |
| "logits/chosen": -0.87890625, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -145.0, | |
| "loss": 14.2865, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.265625, | |
| "rewards/margins": 1.1328125, | |
| "rewards/rejected": -0.8671875, | |
| "step": 402 | |
| }, | |
| { | |
| "epoch": 0.9362567155510382, | |
| "grad_norm": 342.6651611328125, | |
| "learning_rate": 1.2558139534883723e-07, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -127.0, | |
| "loss": 11.4037, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.470703125, | |
| "rewards/margins": 1.4609375, | |
| "rewards/rejected": -0.98828125, | |
| "step": 403 | |
| }, | |
| { | |
| "epoch": 0.9385799332074923, | |
| "grad_norm": 398.06939697265625, | |
| "learning_rate": 1.2093023255813953e-07, | |
| "logits/chosen": -0.90625, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -124.0, | |
| "logps/rejected": -126.0, | |
| "loss": 13.7546, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.265625, | |
| "rewards/margins": 1.015625, | |
| "rewards/rejected": -0.75, | |
| "step": 404 | |
| }, | |
| { | |
| "epoch": 0.9409031508639466, | |
| "grad_norm": 298.3856201171875, | |
| "learning_rate": 1.1627906976744186e-07, | |
| "logits/chosen": -0.8515625, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -122.0, | |
| "logps/rejected": -120.5, | |
| "loss": 11.0682, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.388671875, | |
| "rewards/margins": 1.3671875, | |
| "rewards/rejected": -0.98046875, | |
| "step": 405 | |
| }, | |
| { | |
| "epoch": 0.9432263685204008, | |
| "grad_norm": 368.4793701171875, | |
| "learning_rate": 1.1162790697674417e-07, | |
| "logits/chosen": -0.796875, | |
| "logits/rejected": -0.81640625, | |
| "logps/chosen": -162.0, | |
| "logps/rejected": -133.0, | |
| "loss": 11.1848, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.65234375, | |
| "rewards/margins": 1.421875, | |
| "rewards/rejected": -0.76953125, | |
| "step": 406 | |
| }, | |
| { | |
| "epoch": 0.9455495861768549, | |
| "grad_norm": 294.15423583984375, | |
| "learning_rate": 1.069767441860465e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.83984375, | |
| "logps/chosen": -117.0, | |
| "logps/rejected": -121.0, | |
| "loss": 9.3992, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.5, | |
| "rewards/margins": 1.4609375, | |
| "rewards/rejected": -0.96484375, | |
| "step": 407 | |
| }, | |
| { | |
| "epoch": 0.9478728038333092, | |
| "grad_norm": 366.13348388671875, | |
| "learning_rate": 1.0232558139534883e-07, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -116.0, | |
| "logps/rejected": -122.0, | |
| "loss": 12.3627, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.61328125, | |
| "rewards/margins": 1.171875, | |
| "rewards/rejected": -0.55859375, | |
| "step": 408 | |
| }, | |
| { | |
| "epoch": 0.9501960214897633, | |
| "grad_norm": 424.2518310546875, | |
| "learning_rate": 9.767441860465116e-08, | |
| "logits/chosen": -0.83984375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -129.0, | |
| "logps/rejected": -138.0, | |
| "loss": 13.1234, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.51171875, | |
| "rewards/margins": 1.078125, | |
| "rewards/rejected": -0.5625, | |
| "step": 409 | |
| }, | |
| { | |
| "epoch": 0.9525192391462175, | |
| "grad_norm": 398.58087158203125, | |
| "learning_rate": 9.302325581395349e-08, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -120.0, | |
| "logps/rejected": -123.0, | |
| "loss": 13.4062, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.291015625, | |
| "rewards/margins": 1.203125, | |
| "rewards/rejected": -0.91796875, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.9548424568026717, | |
| "grad_norm": 391.4315185546875, | |
| "learning_rate": 8.83720930232558e-08, | |
| "logits/chosen": -0.828125, | |
| "logits/rejected": -0.85546875, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -152.0, | |
| "loss": 15.4103, | |
| "rewards/accuracies": 0.71875, | |
| "rewards/chosen": 0.3671875, | |
| "rewards/margins": 0.828125, | |
| "rewards/rejected": -0.4609375, | |
| "step": 411 | |
| }, | |
| { | |
| "epoch": 0.9571656744591259, | |
| "grad_norm": 391.45184326171875, | |
| "learning_rate": 8.372093023255813e-08, | |
| "logits/chosen": -0.8359375, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -128.0, | |
| "logps/rejected": -125.0, | |
| "loss": 14.7136, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.419921875, | |
| "rewards/margins": 1.015625, | |
| "rewards/rejected": -0.59765625, | |
| "step": 412 | |
| }, | |
| { | |
| "epoch": 0.9594888921155801, | |
| "grad_norm": 330.07623291015625, | |
| "learning_rate": 7.906976744186046e-08, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.8828125, | |
| "logps/chosen": -122.5, | |
| "logps/rejected": -146.0, | |
| "loss": 12.1995, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.72265625, | |
| "rewards/margins": 1.1640625, | |
| "rewards/rejected": -0.443359375, | |
| "step": 413 | |
| }, | |
| { | |
| "epoch": 0.9618121097720342, | |
| "grad_norm": 374.36016845703125, | |
| "learning_rate": 7.441860465116279e-08, | |
| "logits/chosen": -0.88671875, | |
| "logits/rejected": -0.91015625, | |
| "logps/chosen": -123.5, | |
| "logps/rejected": -130.0, | |
| "loss": 11.3741, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.63671875, | |
| "rewards/margins": 1.28125, | |
| "rewards/rejected": -0.6484375, | |
| "step": 414 | |
| }, | |
| { | |
| "epoch": 0.9641353274284885, | |
| "grad_norm": 351.6080322265625, | |
| "learning_rate": 6.976744186046511e-08, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.92578125, | |
| "logps/chosen": -123.5, | |
| "logps/rejected": -113.0, | |
| "loss": 15.8728, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.2314453125, | |
| "rewards/margins": 0.84765625, | |
| "rewards/rejected": -0.6171875, | |
| "step": 415 | |
| }, | |
| { | |
| "epoch": 0.9664585450849427, | |
| "grad_norm": 364.0675048828125, | |
| "learning_rate": 6.511627906976744e-08, | |
| "logits/chosen": -0.87109375, | |
| "logits/rejected": -0.859375, | |
| "logps/chosen": -141.0, | |
| "logps/rejected": -130.0, | |
| "loss": 10.63, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.45703125, | |
| "rewards/margins": 1.40625, | |
| "rewards/rejected": -0.9453125, | |
| "step": 416 | |
| }, | |
| { | |
| "epoch": 0.9687817627413968, | |
| "grad_norm": 329.6365051269531, | |
| "learning_rate": 6.046511627906976e-08, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -150.0, | |
| "logps/rejected": -123.5, | |
| "loss": 9.7498, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.70703125, | |
| "rewards/margins": 1.3671875, | |
| "rewards/rejected": -0.66015625, | |
| "step": 417 | |
| }, | |
| { | |
| "epoch": 0.971104980397851, | |
| "grad_norm": 351.0168151855469, | |
| "learning_rate": 5.5813953488372087e-08, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.8671875, | |
| "logps/chosen": -143.0, | |
| "logps/rejected": -138.0, | |
| "loss": 11.6222, | |
| "rewards/accuracies": 0.875, | |
| "rewards/chosen": 0.67578125, | |
| "rewards/margins": 1.3125, | |
| "rewards/rejected": -0.63671875, | |
| "step": 418 | |
| }, | |
| { | |
| "epoch": 0.9734281980543052, | |
| "grad_norm": 338.6527099609375, | |
| "learning_rate": 5.1162790697674416e-08, | |
| "logits/chosen": -0.91015625, | |
| "logits/rejected": -0.94140625, | |
| "logps/chosen": -145.0, | |
| "logps/rejected": -125.5, | |
| "loss": 12.6106, | |
| "rewards/accuracies": 0.84375, | |
| "rewards/chosen": 0.443359375, | |
| "rewards/margins": 1.2265625, | |
| "rewards/rejected": -0.78125, | |
| "step": 419 | |
| }, | |
| { | |
| "epoch": 0.9757514157107594, | |
| "grad_norm": 476.017333984375, | |
| "learning_rate": 4.6511627906976744e-08, | |
| "logits/chosen": -0.8984375, | |
| "logits/rejected": -0.8984375, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -124.0, | |
| "loss": 11.9675, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.56640625, | |
| "rewards/margins": 1.125, | |
| "rewards/rejected": -0.55859375, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.9780746333672136, | |
| "grad_norm": 597.4747314453125, | |
| "learning_rate": 4.1860465116279067e-08, | |
| "logits/chosen": -0.8828125, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -135.0, | |
| "logps/rejected": -129.0, | |
| "loss": 20.6045, | |
| "rewards/accuracies": 0.65625, | |
| "rewards/chosen": 0.140625, | |
| "rewards/margins": 0.53515625, | |
| "rewards/rejected": -0.396484375, | |
| "step": 421 | |
| }, | |
| { | |
| "epoch": 0.9803978510236678, | |
| "grad_norm": 422.0390319824219, | |
| "learning_rate": 3.7209302325581396e-08, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.86328125, | |
| "logps/chosen": -142.0, | |
| "logps/rejected": -131.0, | |
| "loss": 13.5287, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": -0.02783203125, | |
| "rewards/margins": 1.21875, | |
| "rewards/rejected": -1.2421875, | |
| "step": 422 | |
| }, | |
| { | |
| "epoch": 0.982721068680122, | |
| "grad_norm": 461.14935302734375, | |
| "learning_rate": 3.255813953488372e-08, | |
| "logits/chosen": -0.88671875, | |
| "logits/rejected": -0.87890625, | |
| "logps/chosen": -138.0, | |
| "logps/rejected": -143.0, | |
| "loss": 15.0398, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.042236328125, | |
| "rewards/margins": 0.84765625, | |
| "rewards/rejected": -0.8046875, | |
| "step": 423 | |
| }, | |
| { | |
| "epoch": 0.9850442863365761, | |
| "grad_norm": 412.094482421875, | |
| "learning_rate": 2.7906976744186043e-08, | |
| "logits/chosen": -0.85546875, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -125.0, | |
| "loss": 13.0969, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.42578125, | |
| "rewards/margins": 1.1015625, | |
| "rewards/rejected": -0.67578125, | |
| "step": 424 | |
| }, | |
| { | |
| "epoch": 0.9873675039930303, | |
| "grad_norm": 348.2117614746094, | |
| "learning_rate": 2.3255813953488372e-08, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.8515625, | |
| "logps/chosen": -127.0, | |
| "logps/rejected": -145.0, | |
| "loss": 13.7319, | |
| "rewards/accuracies": 0.90625, | |
| "rewards/chosen": 0.44921875, | |
| "rewards/margins": 1.2734375, | |
| "rewards/rejected": -0.828125, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 0.9896907216494846, | |
| "grad_norm": 383.5706787109375, | |
| "learning_rate": 1.8604651162790698e-08, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.890625, | |
| "logps/chosen": -130.0, | |
| "logps/rejected": -137.0, | |
| "loss": 13.9442, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.484375, | |
| "rewards/margins": 1.0703125, | |
| "rewards/rejected": -0.5859375, | |
| "step": 426 | |
| }, | |
| { | |
| "epoch": 0.9920139393059387, | |
| "grad_norm": 368.6072082519531, | |
| "learning_rate": 1.3953488372093022e-08, | |
| "logits/chosen": -0.875, | |
| "logits/rejected": -0.88671875, | |
| "logps/chosen": -133.0, | |
| "logps/rejected": -137.0, | |
| "loss": 15.8562, | |
| "rewards/accuracies": 0.75, | |
| "rewards/chosen": 0.279296875, | |
| "rewards/margins": 1.0390625, | |
| "rewards/rejected": -0.7578125, | |
| "step": 427 | |
| }, | |
| { | |
| "epoch": 0.9943371569623929, | |
| "grad_norm": 555.5682983398438, | |
| "learning_rate": 9.302325581395349e-09, | |
| "logits/chosen": -0.8203125, | |
| "logits/rejected": -0.8359375, | |
| "logps/chosen": -117.0, | |
| "logps/rejected": -126.0, | |
| "loss": 15.7869, | |
| "rewards/accuracies": 0.78125, | |
| "rewards/chosen": 0.283203125, | |
| "rewards/margins": 1.09375, | |
| "rewards/rejected": -0.80859375, | |
| "step": 428 | |
| }, | |
| { | |
| "epoch": 0.9966603746188472, | |
| "grad_norm": 393.66015625, | |
| "learning_rate": 4.6511627906976744e-09, | |
| "logits/chosen": -0.84765625, | |
| "logits/rejected": -0.921875, | |
| "logps/chosen": -144.0, | |
| "logps/rejected": -130.0, | |
| "loss": 13.2079, | |
| "rewards/accuracies": 0.8125, | |
| "rewards/chosen": 0.44921875, | |
| "rewards/margins": 1.25, | |
| "rewards/rejected": -0.796875, | |
| "step": 429 | |
| }, | |
| { | |
| "epoch": 0.9989835922753013, | |
| "grad_norm": 407.5803527832031, | |
| "learning_rate": 0.0, | |
| "logits/chosen": -0.84375, | |
| "logits/rejected": -0.87109375, | |
| "logps/chosen": -111.5, | |
| "logps/rejected": -123.0, | |
| "loss": 14.8324, | |
| "rewards/accuracies": 0.6875, | |
| "rewards/chosen": 0.32421875, | |
| "rewards/margins": 0.99609375, | |
| "rewards/rejected": -0.671875, | |
| "step": 430 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 430, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |