llama3.2-3b-orpo-finegrained / eval_results.json
obiwit's picture
End of training
c23f2c7 verified
Raw
History Blame Contribute Delete
731 Bytes
{
"epoch": 0.9999635926748461,
"eval_log_odds_chosen": 1.1701252460479736,
"eval_log_odds_ratio": -0.47759079933166504,
"eval_logits/chosen": -0.8645420074462891,
"eval_logits/rejected": -0.7723644971847534,
"eval_logps/chosen": -0.7588062882423401,
"eval_logps/rejected": -1.6227697134017944,
"eval_loss": 1.188714861869812,
"eval_nll_loss": 1.136938452720642,
"eval_rewards/accuracies": 0.7338129281997681,
"eval_rewards/chosen": -0.07588158547878265,
"eval_rewards/margins": 0.08640365302562714,
"eval_rewards/rejected": -0.16227255761623383,
"eval_runtime": 1369.8995,
"eval_samples": 98376,
"eval_samples_per_second": 71.429,
"eval_steps_per_second": 1.116
}