{ "best_metric": 1.2853127717971802, "best_model_checkpoint": "models/qwen2.5-3b-orpo-mini/checkpoint-5000", "epoch": 0.6458696635019053, "eval_steps": 5000, "global_step": 5000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0012917393270038106, "grad_norm": 13.57978335426149, "learning_rate": 8e-07, "log_odds_chosen": 0.7457031011581421, "log_odds_ratio": -0.582324206829071, "logits/chosen": -0.8775390386581421, "logits/rejected": -0.690625011920929, "logps/chosen": -1.5751953125, "logps/rejected": -2.2093749046325684, "loss": 2.1309, "nll_loss": 2.068359375, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.15766601264476776, "rewards/margins": 0.06313476711511612, "rewards/rejected": -0.22084960341453552, "step": 10 }, { "epoch": 0.0025834786540076212, "grad_norm": 9.015259176400363, "learning_rate": 1.6e-06, "log_odds_chosen": 0.697924792766571, "log_odds_ratio": -0.607666015625, "logits/chosen": -0.927734375, "logits/rejected": -0.7220703363418579, "logps/chosen": -1.47265625, "logps/rejected": -2.0589842796325684, "loss": 2.0202, "nll_loss": 1.851953148841858, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.14726562798023224, "rewards/margins": 0.05870361253619194, "rewards/rejected": -0.20590820908546448, "step": 20 }, { "epoch": 0.003875217981011432, "grad_norm": 6.508079183700648, "learning_rate": 2.4e-06, "log_odds_chosen": 0.41191405057907104, "log_odds_ratio": -0.6729491949081421, "logits/chosen": -0.830078125, "logits/rejected": -0.7201172113418579, "logps/chosen": -1.361328125, "logps/rejected": -1.716796875, "loss": 1.8363, "nll_loss": 1.7890625, "rewards/accuracies": 0.6499999761581421, "rewards/chosen": -0.13608399033546448, "rewards/margins": 0.03561706468462944, "rewards/rejected": -0.1717529296875, "step": 30 }, { "epoch": 0.0051669573080152425, "grad_norm": 4.1418217427341135, "learning_rate": 3.2e-06, "log_odds_chosen": 0.43736571073532104, "log_odds_ratio": -0.65234375, "logits/chosen": -0.961718738079071, "logits/rejected": -0.786914050579071, "logps/chosen": -1.343359351158142, "logps/rejected": -1.712499976158142, "loss": 1.6739, "nll_loss": 1.623046875, "rewards/accuracies": 0.6312500238418579, "rewards/chosen": -0.1343994140625, "rewards/margins": 0.03701172024011612, "rewards/rejected": -0.17136231064796448, "step": 40 }, { "epoch": 0.006458696635019053, "grad_norm": 3.891215988627372, "learning_rate": 4e-06, "log_odds_chosen": 0.39990234375, "log_odds_ratio": -0.6719726324081421, "logits/chosen": -1.0011718273162842, "logits/rejected": -0.806445300579071, "logps/chosen": -1.2794921398162842, "logps/rejected": -1.5851562023162842, "loss": 1.5865, "nll_loss": 1.547265648841858, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.12790527939796448, "rewards/margins": 0.03055114671587944, "rewards/rejected": -0.15847167372703552, "step": 50 }, { "epoch": 0.007750435962022864, "grad_norm": 4.039127205522744, "learning_rate": 4.8e-06, "log_odds_chosen": 0.506274402141571, "log_odds_ratio": -0.626757800579071, "logits/chosen": -0.980664074420929, "logits/rejected": -0.8042968511581421, "logps/chosen": -1.211328148841858, "logps/rejected": -1.630273461341858, "loss": 1.5511, "nll_loss": 1.474609375, "rewards/accuracies": 0.6312500238418579, "rewards/chosen": -0.12102051079273224, "rewards/margins": 0.04187621921300888, "rewards/rejected": -0.16311034560203552, "step": 60 }, { "epoch": 0.009042175289026674, "grad_norm": 3.8212934458361683, "learning_rate": 5.6e-06, "log_odds_chosen": 0.5448242425918579, "log_odds_ratio": -0.5633789300918579, "logits/chosen": -1.006445288658142, "logits/rejected": -0.8216797113418579, "logps/chosen": -1.113867163658142, "logps/rejected": -1.533593773841858, "loss": 1.5156, "nll_loss": 1.4289062023162842, "rewards/accuracies": 0.675000011920929, "rewards/chosen": -0.111328125, "rewards/margins": 0.04198760911822319, "rewards/rejected": -0.15329590439796448, "step": 70 }, { "epoch": 0.010333914616030485, "grad_norm": 4.139999531300743, "learning_rate": 6.4e-06, "log_odds_chosen": 0.42210692167282104, "log_odds_ratio": -0.647656261920929, "logits/chosen": -0.931445300579071, "logits/rejected": -0.792187511920929, "logps/chosen": -1.133203148841858, "logps/rejected": -1.473046898841858, "loss": 1.4818, "nll_loss": 1.534765601158142, "rewards/accuracies": 0.625, "rewards/chosen": -0.11335448920726776, "rewards/margins": 0.03402252122759819, "rewards/rejected": -0.14724120497703552, "step": 80 }, { "epoch": 0.011625653943034296, "grad_norm": 4.095742838448429, "learning_rate": 7.2e-06, "log_odds_chosen": 0.630126953125, "log_odds_ratio": -0.5445312261581421, "logits/chosen": -1.0246093273162842, "logits/rejected": -0.8226562738418579, "logps/chosen": -1.065820336341858, "logps/rejected": -1.55859375, "loss": 1.445, "nll_loss": 1.379296898841858, "rewards/accuracies": 0.668749988079071, "rewards/chosen": -0.10654296725988388, "rewards/margins": 0.04931640625, "rewards/rejected": -0.15573731064796448, "step": 90 }, { "epoch": 0.012917393270038106, "grad_norm": 3.6159578716273097, "learning_rate": 8e-06, "log_odds_chosen": 0.5294555425643921, "log_odds_ratio": -0.5914062261581421, "logits/chosen": -0.971484363079071, "logits/rejected": -0.7845703363418579, "logps/chosen": -0.984375, "logps/rejected": -1.394921898841858, "loss": 1.4029, "nll_loss": 1.2683594226837158, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.09841308742761612, "rewards/margins": 0.04103546217083931, "rewards/rejected": -0.13945312798023224, "step": 100 }, { "epoch": 0.014209132597041917, "grad_norm": 2.9958642261714714, "learning_rate": 7.627700713964738e-06, "log_odds_chosen": 0.719775378704071, "log_odds_ratio": -0.512988269329071, "logits/chosen": -0.973828136920929, "logits/rejected": -0.774218738079071, "logps/chosen": -0.896289050579071, "logps/rejected": -1.4296875, "loss": 1.3539, "nll_loss": 1.283203125, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.08962402492761612, "rewards/margins": 0.0533599853515625, "rewards/rejected": -0.14309081435203552, "step": 110 }, { "epoch": 0.015500871924045728, "grad_norm": 2.763883836653562, "learning_rate": 7.3029674334022146e-06, "log_odds_chosen": 0.669055163860321, "log_odds_ratio": -0.5625976324081421, "logits/chosen": -0.920703113079071, "logits/rejected": -0.7630859613418579, "logps/chosen": -0.8623046875, "logps/rejected": -1.3429687023162842, "loss": 1.3486, "nll_loss": 1.367578148841858, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.08620605617761612, "rewards/margins": 0.04801177978515625, "rewards/rejected": -0.13427734375, "step": 120 }, { "epoch": 0.016792611251049538, "grad_norm": 1.5794408995353049, "learning_rate": 7.016464154456233e-06, "log_odds_chosen": 0.602734386920929, "log_odds_ratio": -0.55615234375, "logits/chosen": -0.9853515625, "logits/rejected": -0.7574218511581421, "logps/chosen": -0.9164062738418579, "logps/rejected": -1.35546875, "loss": 1.2912, "nll_loss": 1.273046851158142, "rewards/accuracies": 0.6625000238418579, "rewards/chosen": -0.0916748046875, "rewards/margins": 0.0439605712890625, "rewards/rejected": -0.13557128608226776, "step": 130 }, { "epoch": 0.018084350578053347, "grad_norm": 1.5829096246432857, "learning_rate": 6.7612340378281325e-06, "log_odds_chosen": 0.6971679925918579, "log_odds_ratio": -0.5078125, "logits/chosen": -0.9798828363418579, "logits/rejected": -0.8091796636581421, "logps/chosen": -0.841992199420929, "logps/rejected": -1.327539086341858, "loss": 1.2957, "nll_loss": 1.210546851158142, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.08420410007238388, "rewards/margins": 0.04866638034582138, "rewards/rejected": -0.13288573920726776, "step": 140 }, { "epoch": 0.01937608990505716, "grad_norm": 1.432454201798768, "learning_rate": 6.531972647421809e-06, "log_odds_chosen": 0.56121826171875, "log_odds_ratio": -0.5838867425918579, "logits/chosen": -0.988085925579071, "logits/rejected": -0.792773425579071, "logps/chosen": -0.867382824420929, "logps/rejected": -1.2921874523162842, "loss": 1.282, "nll_loss": 1.230859398841858, "rewards/accuracies": 0.6499999761581421, "rewards/chosen": -0.08674316108226776, "rewards/margins": 0.04250030592083931, "rewards/rejected": -0.12910155951976776, "step": 150 }, { "epoch": 0.02066782923206097, "grad_norm": 1.4396105037255706, "learning_rate": 6.3245553203367575e-06, "log_odds_chosen": 0.723095715045929, "log_odds_ratio": -0.5807129144668579, "logits/chosen": -0.976757824420929, "logits/rejected": -0.7816406488418579, "logps/chosen": -0.910937488079071, "logps/rejected": -1.438867211341858, "loss": 1.2837, "nll_loss": 1.1925780773162842, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.09111328423023224, "rewards/margins": 0.05277099460363388, "rewards/rejected": -0.14387206733226776, "step": 160 }, { "epoch": 0.02195956855906478, "grad_norm": 1.5718553661375603, "learning_rate": 6.135719910778963e-06, "log_odds_chosen": 0.43505859375, "log_odds_ratio": -0.6630859375, "logits/chosen": -0.9906250238418579, "logits/rejected": -0.8466796875, "logps/chosen": -0.8970702886581421, "logps/rejected": -1.2218749523162842, "loss": 1.3177, "nll_loss": 1.223046898841858, "rewards/accuracies": 0.6499999761581421, "rewards/chosen": -0.08969726413488388, "rewards/margins": 0.032463837414979935, "rewards/rejected": -0.12224121391773224, "step": 170 }, { "epoch": 0.023251307886068592, "grad_norm": 1.3767240784172705, "learning_rate": 5.962847939999439e-06, "log_odds_chosen": 0.37218016386032104, "log_odds_ratio": -0.67138671875, "logits/chosen": -1.019140601158142, "logits/rejected": -0.8949218988418579, "logps/chosen": -0.876953125, "logps/rejected": -1.1736328601837158, "loss": 1.2854, "nll_loss": 1.2292969226837158, "rewards/accuracies": 0.6187499761581421, "rewards/chosen": -0.08779297024011612, "rewards/margins": 0.02956542931497097, "rewards/rejected": -0.11733398586511612, "step": 180 }, { "epoch": 0.024543047213072402, "grad_norm": 1.3134241077743467, "learning_rate": 5.803810000880094e-06, "log_odds_chosen": 0.744091808795929, "log_odds_ratio": -0.54345703125, "logits/chosen": -1.037500023841858, "logits/rejected": -0.8558593988418579, "logps/chosen": -0.856249988079071, "logps/rejected": -1.39453125, "loss": 1.2528, "nll_loss": 1.2082030773162842, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08563232421875, "rewards/margins": 0.05387268215417862, "rewards/rejected": -0.1395263671875, "step": 190 }, { "epoch": 0.02583478654007621, "grad_norm": 1.6298294179019939, "learning_rate": 5.65685424949238e-06, "log_odds_chosen": 0.714306652545929, "log_odds_ratio": -0.529980480670929, "logits/chosen": -1.020117163658142, "logits/rejected": -0.7992187738418579, "logps/chosen": -0.8050781488418579, "logps/rejected": -1.302734375, "loss": 1.2724, "nll_loss": 1.170507788658142, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.08059082180261612, "rewards/margins": 0.04983215406537056, "rewards/rejected": -0.13029785454273224, "step": 200 }, { "epoch": 0.027126525867080024, "grad_norm": 1.507921032061368, "learning_rate": 5.5205244747388325e-06, "log_odds_chosen": 0.7364257574081421, "log_odds_ratio": -0.5204101800918579, "logits/chosen": -1.0037109851837158, "logits/rejected": -0.818164050579071, "logps/chosen": -0.802539050579071, "logps/rejected": -1.3097655773162842, "loss": 1.2354, "nll_loss": 1.163476586341858, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.08029785007238388, "rewards/margins": 0.05073852464556694, "rewards/rejected": -0.13103027641773224, "step": 210 }, { "epoch": 0.028418265194083834, "grad_norm": 1.4978528887230322, "learning_rate": 5.393598899705936e-06, "log_odds_chosen": 0.698291003704071, "log_odds_ratio": -0.5777343511581421, "logits/chosen": -1.0333983898162842, "logits/rejected": -0.9166015386581421, "logps/chosen": -0.8734375238418579, "logps/rejected": -1.3830077648162842, "loss": 1.2485, "nll_loss": 1.175195336341858, "rewards/accuracies": 0.699999988079071, "rewards/chosen": -0.08736572414636612, "rewards/margins": 0.05084228515625, "rewards/rejected": -0.13820800185203552, "step": 220 }, { "epoch": 0.029710004521087643, "grad_norm": 1.3157923309930322, "learning_rate": 5.275043787166296e-06, "log_odds_chosen": 0.797985851764679, "log_odds_ratio": -0.5220702886581421, "logits/chosen": -0.968945324420929, "logits/rejected": -0.796875, "logps/chosen": -0.8003906011581421, "logps/rejected": -1.361328125, "loss": 1.2564, "nll_loss": 1.2208983898162842, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08001708984375, "rewards/margins": 0.05607910081744194, "rewards/rejected": -0.13613280653953552, "step": 230 }, { "epoch": 0.031001743848091456, "grad_norm": 1.3029095867800957, "learning_rate": 5.163977794943223e-06, "log_odds_chosen": 0.666735827922821, "log_odds_ratio": -0.5936523675918579, "logits/chosen": -0.9878906011581421, "logits/rejected": -0.7890625, "logps/chosen": -0.8501952886581421, "logps/rejected": -1.367578148841858, "loss": 1.243, "nll_loss": 1.213281273841858, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.0849609375, "rewards/margins": 0.05176391452550888, "rewards/rejected": -0.13676758110523224, "step": 240 }, { "epoch": 0.03229348317509526, "grad_norm": 1.6577406958794012, "learning_rate": 5.059644256269407e-06, "log_odds_chosen": 0.8603515625, "log_odds_ratio": -0.501757800579071, "logits/chosen": -1.0107421875, "logits/rejected": -0.782421886920929, "logps/chosen": -0.839062511920929, "logps/rejected": -1.458593726158142, "loss": 1.256, "nll_loss": 1.2488281726837158, "rewards/accuracies": 0.75, "rewards/chosen": -0.08391113579273224, "rewards/margins": 0.06190337985754013, "rewards/rejected": -0.14589843153953552, "step": 250 }, { "epoch": 0.033585222502099076, "grad_norm": 1.519776375229694, "learning_rate": 4.961389383568338e-06, "log_odds_chosen": 0.8218749761581421, "log_odds_ratio": -0.5096679925918579, "logits/chosen": -1.012304663658142, "logits/rejected": -0.8544921875, "logps/chosen": -0.8226562738418579, "logps/rejected": -1.393164038658142, "loss": 1.2413, "nll_loss": 1.154687523841858, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.08232422173023224, "rewards/margins": 0.056915283203125, "rewards/rejected": -0.13920898735523224, "step": 260 }, { "epoch": 0.03487696182910289, "grad_norm": 1.2548399290524286, "learning_rate": 4.8686449556014755e-06, "log_odds_chosen": 1.0139648914337158, "log_odds_ratio": -0.460205078125, "logits/chosen": -1.058984398841858, "logits/rejected": -0.84765625, "logps/chosen": -0.826367199420929, "logps/rejected": -1.546875, "loss": 1.2262, "nll_loss": 1.21484375, "rewards/accuracies": 0.78125, "rewards/chosen": -0.08266601711511612, "rewards/margins": 0.07209014892578125, "rewards/rejected": -0.15458984673023224, "step": 270 }, { "epoch": 0.036168701156106695, "grad_norm": 1.5984353445925055, "learning_rate": 4.780914437337574e-06, "log_odds_chosen": 0.66357421875, "log_odds_ratio": -0.5630859136581421, "logits/chosen": -1.040429711341858, "logits/rejected": -0.8501952886581421, "logps/chosen": -0.8548828363418579, "logps/rejected": -1.3201172351837158, "loss": 1.2324, "nll_loss": 1.2384765148162842, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": -0.08551025390625, "rewards/margins": 0.04647216945886612, "rewards/rejected": -0.1319580078125, "step": 280 }, { "epoch": 0.03746044048311051, "grad_norm": 1.6589910923977143, "learning_rate": 4.697761756117627e-06, "log_odds_chosen": 0.772900402545929, "log_odds_ratio": -0.536572277545929, "logits/chosen": -1.0710937976837158, "logits/rejected": -0.9033203125, "logps/chosen": -0.833203136920929, "logps/rejected": -1.399999976158142, "loss": 1.2117, "nll_loss": 1.136132836341858, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.08328857272863388, "rewards/margins": 0.05676879733800888, "rewards/rejected": -0.14006347954273224, "step": 290 }, { "epoch": 0.03875217981011432, "grad_norm": 1.52233985546576, "learning_rate": 4.618802153517006e-06, "log_odds_chosen": 0.70599365234375, "log_odds_ratio": -0.531933605670929, "logits/chosen": -1.0207030773162842, "logits/rejected": -0.893750011920929, "logps/chosen": -0.819140613079071, "logps/rejected": -1.3171875476837158, "loss": 1.2061, "nll_loss": 1.2380859851837158, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": -0.08195801079273224, "rewards/margins": 0.04980163648724556, "rewards/rejected": -0.13173827528953552, "step": 300 }, { "epoch": 0.04004391913711813, "grad_norm": 1.357780293868318, "learning_rate": 4.543694673976518e-06, "log_odds_chosen": 0.9074951410293579, "log_odds_ratio": -0.517578125, "logits/chosen": -1.0673828125, "logits/rejected": -0.87109375, "logps/chosen": -0.8226562738418579, "logps/rejected": -1.493554711341858, "loss": 1.2304, "nll_loss": 1.100000023841858, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.08225097507238388, "rewards/margins": 0.06709747016429901, "rewards/rejected": -0.14919432997703552, "step": 310 }, { "epoch": 0.04133565846412194, "grad_norm": 1.3116044732536714, "learning_rate": 4.472135954999579e-06, "log_odds_chosen": 0.7847900390625, "log_odds_ratio": -0.5294433832168579, "logits/chosen": -0.9779297113418579, "logits/rejected": -0.7958984375, "logps/chosen": -0.8515625, "logps/rejected": -1.4207031726837158, "loss": 1.2428, "nll_loss": 1.2488281726837158, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.08510742336511612, "rewards/margins": 0.056915283203125, "rewards/rejected": -0.14206543564796448, "step": 320 }, { "epoch": 0.04262739779112575, "grad_norm": 1.3217309885822108, "learning_rate": 4.403855060505443e-06, "log_odds_chosen": 0.754589855670929, "log_odds_ratio": -0.5194336175918579, "logits/chosen": -0.9449218511581421, "logits/rejected": -0.8314453363418579, "logps/chosen": -0.7962890863418579, "logps/rejected": -1.296484351158142, "loss": 1.2492, "nll_loss": 1.1677734851837158, "rewards/accuracies": 0.699999988079071, "rewards/chosen": -0.07962646335363388, "rewards/margins": 0.05009765550494194, "rewards/rejected": -0.12978515028953552, "step": 330 }, { "epoch": 0.04391913711812956, "grad_norm": 1.3450790759999323, "learning_rate": 4.338609156373123e-06, "log_odds_chosen": 0.742382824420929, "log_odds_ratio": -0.55126953125, "logits/chosen": -1.0363280773162842, "logits/rejected": -0.853320300579071, "logps/chosen": -0.8544921875, "logps/rejected": -1.3798828125, "loss": 1.1961, "nll_loss": 1.2121093273162842, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.08552245795726776, "rewards/margins": 0.052581787109375, "rewards/rejected": -0.1380615234375, "step": 340 }, { "epoch": 0.04521087644513337, "grad_norm": 1.138834104724891, "learning_rate": 4.27617987059879e-06, "log_odds_chosen": 0.912792980670929, "log_odds_ratio": -0.501269519329071, "logits/chosen": -1.0107421875, "logits/rejected": -0.852734386920929, "logps/chosen": -0.8119140863418579, "logps/rejected": -1.474023461341858, "loss": 1.2553, "nll_loss": 1.1662108898162842, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.0811767578125, "rewards/margins": 0.06629333645105362, "rewards/rejected": -0.14743652939796448, "step": 350 }, { "epoch": 0.046502615772137185, "grad_norm": 1.6315524180890024, "learning_rate": 4.216370213557839e-06, "log_odds_chosen": 0.9598633050918579, "log_odds_ratio": -0.49492186307907104, "logits/chosen": -1.030664086341858, "logits/rejected": -0.826367199420929, "logps/chosen": -0.781054675579071, "logps/rejected": -1.508398413658142, "loss": 1.2208, "nll_loss": 1.104101538658142, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.07805176079273224, "rewards/margins": 0.07277832180261612, "rewards/rejected": -0.15080566704273224, "step": 360 }, { "epoch": 0.04779435509914099, "grad_norm": 1.1630076751733809, "learning_rate": 4.15900195928029e-06, "log_odds_chosen": 0.9056152105331421, "log_odds_ratio": -0.558300793170929, "logits/chosen": -0.976367175579071, "logits/rejected": -0.818359375, "logps/chosen": -0.773632824420929, "logps/rejected": -1.421289086341858, "loss": 1.2368, "nll_loss": 1.1970703601837158, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": -0.07730712741613388, "rewards/margins": 0.06474151462316513, "rewards/rejected": -0.14208984375, "step": 370 }, { "epoch": 0.049086094426144804, "grad_norm": 1.198531705797501, "learning_rate": 4.103913408340617e-06, "log_odds_chosen": 1.035791039466858, "log_odds_ratio": -0.4349609315395355, "logits/chosen": -1.05078125, "logits/rejected": -0.8255859613418579, "logps/chosen": -0.788281261920929, "logps/rejected": -1.501953125, "loss": 1.2, "nll_loss": 1.165624976158142, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07879638671875, "rewards/margins": 0.07134399563074112, "rewards/rejected": -0.15012207627296448, "step": 380 }, { "epoch": 0.05037783375314862, "grad_norm": 1.2866984720866645, "learning_rate": 4.050957468334666e-06, "log_odds_chosen": 0.688720703125, "log_odds_ratio": -0.5982421636581421, "logits/chosen": -1.0841796398162842, "logits/rejected": -0.886914074420929, "logps/chosen": -0.839062511920929, "logps/rejected": -1.362890601158142, "loss": 1.2168, "nll_loss": 1.108984351158142, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.0838623046875, "rewards/margins": 0.05236206203699112, "rewards/rejected": -0.13623046875, "step": 390 }, { "epoch": 0.05166957308015242, "grad_norm": 1.3060742996838322, "learning_rate": 4e-06, "log_odds_chosen": 0.8260253667831421, "log_odds_ratio": -0.510058581829071, "logits/chosen": -1.0810546875, "logits/rejected": -0.869335949420929, "logps/chosen": -0.76953125, "logps/rejected": -1.3564453125, "loss": 1.2281, "nll_loss": 1.0818359851837158, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07695312798023224, "rewards/margins": 0.05866088718175888, "rewards/rejected": -0.13557128608226776, "step": 400 }, { "epoch": 0.052961312407156236, "grad_norm": 1.3232085389194796, "learning_rate": 3.950918386598359e-06, "log_odds_chosen": 0.726245105266571, "log_odds_ratio": -0.5389648675918579, "logits/chosen": -1.0363280773162842, "logits/rejected": -0.908203125, "logps/chosen": -0.8062499761581421, "logps/rejected": -1.2902343273162842, "loss": 1.2057, "nll_loss": 1.1681640148162842, "rewards/accuracies": 0.699999988079071, "rewards/chosen": -0.08051757514476776, "rewards/margins": 0.04848175123333931, "rewards/rejected": -0.12900391221046448, "step": 410 }, { "epoch": 0.05425305173416005, "grad_norm": 1.3310533920182912, "learning_rate": 3.903600291794132e-06, "log_odds_chosen": 0.7430664300918579, "log_odds_ratio": -0.568652331829071, "logits/chosen": -0.994140625, "logits/rejected": -0.8783203363418579, "logps/chosen": -0.7994140386581421, "logps/rejected": -1.33984375, "loss": 1.179, "nll_loss": 1.1482422351837158, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.07991943508386612, "rewards/margins": 0.05406494066119194, "rewards/rejected": -0.13383789360523224, "step": 420 }, { "epoch": 0.055544791061163855, "grad_norm": 1.2551346500804013, "learning_rate": 3.857942577363297e-06, "log_odds_chosen": 0.844189465045929, "log_odds_ratio": -0.5028320550918579, "logits/chosen": -1.0994141101837158, "logits/rejected": -0.923828125, "logps/chosen": -0.796679675579071, "logps/rejected": -1.405859351158142, "loss": 1.1981, "nll_loss": 1.175390601158142, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.07963867485523224, "rewards/margins": 0.06090698391199112, "rewards/rejected": -0.14060059189796448, "step": 430 }, { "epoch": 0.05683653038816767, "grad_norm": 37.25593914170561, "learning_rate": 3.813850356982369e-06, "log_odds_chosen": 1.015869140625, "log_odds_ratio": -0.4696289002895355, "logits/chosen": -1.0460937023162842, "logits/rejected": -0.838085949420929, "logps/chosen": -0.7992187738418579, "logps/rejected": -1.5291016101837158, "loss": 1.1967, "nll_loss": 1.1847655773162842, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.07993163913488388, "rewards/margins": 0.07289429008960724, "rewards/rejected": -0.15268555283546448, "step": 440 }, { "epoch": 0.05812826971517148, "grad_norm": 1.7214286466475308, "learning_rate": 3.7712361663282537e-06, "log_odds_chosen": 0.7060302495956421, "log_odds_ratio": -0.5516601800918579, "logits/chosen": -1.0437500476837158, "logits/rejected": -0.8228515386581421, "logps/chosen": -0.8017578125, "logps/rejected": -1.326171875, "loss": 1.1972, "nll_loss": 1.181054711341858, "rewards/accuracies": 0.668749988079071, "rewards/chosen": -0.08017577975988388, "rewards/margins": 0.05238189548254013, "rewards/rejected": -0.132568359375, "step": 450 }, { "epoch": 0.05942000904217529, "grad_norm": 1.231591554381852, "learning_rate": 3.730019232961255e-06, "log_odds_chosen": 1.069921851158142, "log_odds_ratio": -0.4735351502895355, "logits/chosen": -1.0460937023162842, "logits/rejected": -0.8089843988418579, "logps/chosen": -0.8062499761581421, "logps/rejected": -1.574609398841858, "loss": 1.2112, "nll_loss": 1.124609351158142, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08060302585363388, "rewards/margins": 0.07672119140625, "rewards/rejected": -0.157470703125, "step": 460 }, { "epoch": 0.0607117483691791, "grad_norm": 1.4297656309951992, "learning_rate": 3.6901248321155403e-06, "log_odds_chosen": 0.815380871295929, "log_odds_ratio": -0.552734375, "logits/chosen": -1.043554663658142, "logits/rejected": -0.9156249761581421, "logps/chosen": -0.8023437261581421, "logps/rejected": -1.3820312023162842, "loss": 1.1824, "nll_loss": 1.086328148841858, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.08028564602136612, "rewards/margins": 0.05801696702837944, "rewards/rejected": -0.13825683295726776, "step": 470 }, { "epoch": 0.06200348769618291, "grad_norm": 1.2813646787848072, "learning_rate": 3.6514837167011073e-06, "log_odds_chosen": 0.914013683795929, "log_odds_ratio": -0.515429675579071, "logits/chosen": -1.0623047351837158, "logits/rejected": -0.872265636920929, "logps/chosen": -0.80078125, "logps/rejected": -1.4591796398162842, "loss": 1.1598, "nll_loss": 1.106054663658142, "rewards/accuracies": 0.71875, "rewards/chosen": -0.080078125, "rewards/margins": 0.06585693359375, "rewards/rejected": -0.14597168564796448, "step": 480 }, { "epoch": 0.06329522702318673, "grad_norm": 1.295033903721843, "learning_rate": 3.6140316116210052e-06, "log_odds_chosen": 0.8544677495956421, "log_odds_ratio": -0.51513671875, "logits/chosen": -1.107031226158142, "logits/rejected": -0.889843761920929, "logps/chosen": -0.7835937738418579, "logps/rejected": -1.3917968273162842, "loss": 1.1979, "nll_loss": 1.1541016101837158, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.078369140625, "rewards/margins": 0.060831449925899506, "rewards/rejected": -0.13908691704273224, "step": 490 }, { "epoch": 0.06458696635019053, "grad_norm": 1.4128400593890962, "learning_rate": 3.5777087639996634e-06, "log_odds_chosen": 0.8157714605331421, "log_odds_ratio": -0.4935058653354645, "logits/chosen": -1.1017577648162842, "logits/rejected": -0.8431640863418579, "logps/chosen": -0.7777343988418579, "logps/rejected": -1.3419921398162842, "loss": 1.2128, "nll_loss": 1.0935547351837158, "rewards/accuracies": 0.699999988079071, "rewards/chosen": -0.0777587890625, "rewards/margins": 0.05640869215130806, "rewards/rejected": -0.13420410454273224, "step": 500 }, { "epoch": 0.06587870567719434, "grad_norm": 1.2852041710404891, "learning_rate": 3.5424595421603814e-06, "log_odds_chosen": 1.0095703601837158, "log_odds_ratio": -0.4862304627895355, "logits/chosen": -0.9966796636581421, "logits/rejected": -0.8529297113418579, "logps/chosen": -0.7749999761581421, "logps/rejected": -1.4890625476837158, "loss": 1.1694, "nll_loss": 1.1570312976837158, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07744140923023224, "rewards/margins": 0.07141723483800888, "rewards/rejected": -0.14890137314796448, "step": 510 }, { "epoch": 0.06717044500419815, "grad_norm": 1.4925154616120668, "learning_rate": 3.5082320772281165e-06, "log_odds_chosen": 0.9048095941543579, "log_odds_ratio": -0.53125, "logits/chosen": -1.1417968273162842, "logits/rejected": -0.8558593988418579, "logps/chosen": -0.8736327886581421, "logps/rejected": -1.535742163658142, "loss": 1.2036, "nll_loss": 1.198632836341858, "rewards/accuracies": 0.6875, "rewards/chosen": -0.08736572414636612, "rewards/margins": 0.066162109375, "rewards/rejected": -0.15361328423023224, "step": 520 }, { "epoch": 0.06846218433120196, "grad_norm": 1.423686346215787, "learning_rate": 3.474977942104555e-06, "log_odds_chosen": 0.978955090045929, "log_odds_ratio": -0.504638671875, "logits/chosen": -0.98828125, "logits/rejected": -0.845898449420929, "logps/chosen": -0.81640625, "logps/rejected": -1.526953101158142, "loss": 1.2069, "nll_loss": 1.1472656726837158, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.08162841945886612, "rewards/margins": 0.07106475532054901, "rewards/rejected": -0.15266112983226776, "step": 530 }, { "epoch": 0.06975392365820578, "grad_norm": 1.1828471125966862, "learning_rate": 3.442651863295481e-06, "log_odds_chosen": 0.994335949420929, "log_odds_ratio": -0.482421875, "logits/chosen": -1.140625, "logits/rejected": -0.908203125, "logps/chosen": -0.7484375238418579, "logps/rejected": -1.4425780773162842, "loss": 1.1964, "nll_loss": 1.115234375, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.07487793266773224, "rewards/margins": 0.06933899223804474, "rewards/rejected": -0.1441650390625, "step": 540 }, { "epoch": 0.07104566298520959, "grad_norm": 1.6322240817234488, "learning_rate": 3.4112114616897665e-06, "log_odds_chosen": 1.223242163658142, "log_odds_ratio": -0.4161132872104645, "logits/chosen": -1.0632812976837158, "logits/rejected": -0.8373047113418579, "logps/chosen": -0.7730468511581421, "logps/rejected": -1.619140625, "loss": 1.1591, "nll_loss": 1.0417969226837158, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07729492336511612, "rewards/margins": 0.08452758938074112, "rewards/rejected": -0.16171875596046448, "step": 550 }, { "epoch": 0.07233740231221339, "grad_norm": 1.1804772247297062, "learning_rate": 3.3806170189140663e-06, "log_odds_chosen": 0.835522472858429, "log_odds_ratio": -0.502636730670929, "logits/chosen": -1.0812499523162842, "logits/rejected": -0.9173828363418579, "logps/chosen": -0.8060547113418579, "logps/rejected": -1.3992187976837158, "loss": 1.1847, "nll_loss": 1.0998046398162842, "rewards/accuracies": 0.699999988079071, "rewards/chosen": -0.08054199069738388, "rewards/margins": 0.05933227390050888, "rewards/rejected": -0.13984374701976776, "step": 560 }, { "epoch": 0.0736291416392172, "grad_norm": 1.4282885925870714, "learning_rate": 3.350831266333564e-06, "log_odds_chosen": 1.1495361328125, "log_odds_ratio": -0.4527831971645355, "logits/chosen": -1.0382812023162842, "logits/rejected": -0.8695312738418579, "logps/chosen": -0.778124988079071, "logps/rejected": -1.6056640148162842, "loss": 1.166, "nll_loss": 1.134179711341858, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07785644382238388, "rewards/margins": 0.082611083984375, "rewards/rejected": -0.160400390625, "step": 570 }, { "epoch": 0.07492088096622102, "grad_norm": 1.3784310853971684, "learning_rate": 3.3218191941495984e-06, "log_odds_chosen": 0.79150390625, "log_odds_ratio": -0.52734375, "logits/chosen": -1.07421875, "logits/rejected": -0.8960937261581421, "logps/chosen": -0.839648425579071, "logps/rejected": -1.3927733898162842, "loss": 1.1531, "nll_loss": 1.116601586341858, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.083984375, "rewards/margins": 0.0552825927734375, "rewards/rejected": -0.13923339545726776, "step": 580 }, { "epoch": 0.07621262029322483, "grad_norm": 1.2078009848726674, "learning_rate": 3.293547878370473e-06, "log_odds_chosen": 0.8414062261581421, "log_odds_ratio": -0.509472668170929, "logits/chosen": -0.9970703125, "logits/rejected": -0.8374999761581421, "logps/chosen": -0.815625011920929, "logps/rejected": -1.3898437023162842, "loss": 1.1933, "nll_loss": 1.180273413658142, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.08157958835363388, "rewards/margins": 0.05731201171875, "rewards/rejected": -0.13889160752296448, "step": 590 }, { "epoch": 0.07750435962022864, "grad_norm": 1.184462715911394, "learning_rate": 3.2659863237109044e-06, "log_odds_chosen": 0.911914050579071, "log_odds_ratio": -0.49580079317092896, "logits/chosen": -1.198632836341858, "logits/rejected": -0.9507812261581421, "logps/chosen": -0.791210949420929, "logps/rejected": -1.442968726158142, "loss": 1.173, "nll_loss": 1.0109374523162842, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07911376655101776, "rewards/margins": 0.06525878608226776, "rewards/rejected": -0.1444091796875, "step": 600 }, { "epoch": 0.07879609894723245, "grad_norm": 1.6021946518723025, "learning_rate": 3.239105320715664e-06, "log_odds_chosen": 0.998486340045929, "log_odds_ratio": -0.45708006620407104, "logits/chosen": -1.095703125, "logits/rejected": -0.868359386920929, "logps/chosen": -0.8216797113418579, "logps/rejected": -1.5265624523162842, "loss": 1.1769, "nll_loss": 1.117578148841858, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.0821533203125, "rewards/margins": 0.070526123046875, "rewards/rejected": -0.15280762314796448, "step": 610 }, { "epoch": 0.08008783827423625, "grad_norm": 1.2909582175868575, "learning_rate": 3.2128773156099956e-06, "log_odds_chosen": 0.784375011920929, "log_odds_ratio": -0.502246081829071, "logits/chosen": -1.056249976158142, "logits/rejected": -0.888867199420929, "logps/chosen": -0.8443359136581421, "logps/rejected": -1.3855469226837158, "loss": 1.173, "nll_loss": 1.1560547351837158, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.08444824069738388, "rewards/margins": 0.05415039137005806, "rewards/rejected": -0.13862304389476776, "step": 620 }, { "epoch": 0.08137957760124007, "grad_norm": 1.3061074492525164, "learning_rate": 3.187276291558383e-06, "log_odds_chosen": 1.0955078601837158, "log_odds_ratio": -0.44916993379592896, "logits/chosen": -1.0593750476837158, "logits/rejected": -0.899218738079071, "logps/chosen": -0.7466796636581421, "logps/rejected": -1.5251953601837158, "loss": 1.1792, "nll_loss": 1.1199219226837158, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07469482719898224, "rewards/margins": 0.07789306342601776, "rewards/rejected": -0.152587890625, "step": 630 }, { "epoch": 0.08267131692824388, "grad_norm": 1.1987732550561676, "learning_rate": 3.1622776601683788e-06, "log_odds_chosen": 0.9761718511581421, "log_odds_ratio": -0.476806640625, "logits/chosen": -1.096093773841858, "logits/rejected": -0.8511718511581421, "logps/chosen": -0.843554675579071, "logps/rejected": -1.523828148841858, "loss": 1.169, "nll_loss": 1.141210913658142, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.08432617038488388, "rewards/margins": 0.06809081882238388, "rewards/rejected": -0.15227051079273224, "step": 640 }, { "epoch": 0.08396305625524769, "grad_norm": 1.231220076651413, "learning_rate": 3.1378581622109444e-06, "log_odds_chosen": 0.9027343988418579, "log_odds_ratio": -0.5249999761581421, "logits/chosen": -1.1154296398162842, "logits/rejected": -0.93359375, "logps/chosen": -0.7671874761581421, "logps/rejected": -1.417382836341858, "loss": 1.178, "nll_loss": 1.080078125, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.07673339545726776, "rewards/margins": 0.06498870998620987, "rewards/rejected": -0.14165039360523224, "step": 650 }, { "epoch": 0.0852547955822515, "grad_norm": 1.177895385767675, "learning_rate": 3.113995776646092e-06, "log_odds_chosen": 0.99658203125, "log_odds_ratio": -0.513134777545929, "logits/chosen": -1.125585913658142, "logits/rejected": -0.884570300579071, "logps/chosen": -0.804882824420929, "logps/rejected": -1.560937523841858, "loss": 1.1983, "nll_loss": 1.124414086341858, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.0804443359375, "rewards/margins": 0.07564697414636612, "rewards/rejected": -0.15605469048023224, "step": 660 }, { "epoch": 0.08654653490925532, "grad_norm": 1.3589749210923037, "learning_rate": 3.090669637145023e-06, "log_odds_chosen": 1.0281250476837158, "log_odds_ratio": -0.4866699278354645, "logits/chosen": -1.07421875, "logits/rejected": -0.890625, "logps/chosen": -0.7826172113418579, "logps/rejected": -1.531640648841858, "loss": 1.1615, "nll_loss": 1.0947265625, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.0782470703125, "rewards/margins": 0.07490234076976776, "rewards/rejected": -0.15314941108226776, "step": 670 }, { "epoch": 0.08783827423625912, "grad_norm": 1.3666977031934535, "learning_rate": 3.0678599553894814e-06, "log_odds_chosen": 1.055932641029358, "log_odds_ratio": -0.4605468809604645, "logits/chosen": -1.038671851158142, "logits/rejected": -0.826953113079071, "logps/chosen": -0.7533203363418579, "logps/rejected": -1.4949219226837158, "loss": 1.1771, "nll_loss": 1.1388671398162842, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07530517876148224, "rewards/margins": 0.07410278171300888, "rewards/rejected": -0.14948730170726776, "step": 680 }, { "epoch": 0.08913001356326293, "grad_norm": 1.268584413624482, "learning_rate": 3.0455479505075235e-06, "log_odds_chosen": 0.9961913824081421, "log_odds_ratio": -0.502734363079071, "logits/chosen": -1.0519530773162842, "logits/rejected": -0.849414050579071, "logps/chosen": -0.818164050579071, "logps/rejected": -1.5281250476837158, "loss": 1.1773, "nll_loss": 1.208984375, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.08179931342601776, "rewards/margins": 0.07105102390050888, "rewards/rejected": -0.15278320014476776, "step": 690 }, { "epoch": 0.09042175289026674, "grad_norm": 1.2341733102160282, "learning_rate": 3.0237157840738173e-06, "log_odds_chosen": 0.9613037109375, "log_odds_ratio": -0.513867199420929, "logits/chosen": -1.0740234851837158, "logits/rejected": -0.9253906011581421, "logps/chosen": -0.8203125, "logps/rejected": -1.5166015625, "loss": 1.1401, "nll_loss": 1.076562523841858, "rewards/accuracies": 0.71875, "rewards/chosen": -0.08194579929113388, "rewards/margins": 0.06969757378101349, "rewards/rejected": -0.15163573622703552, "step": 700 }, { "epoch": 0.09171349221727056, "grad_norm": 1.5297617000438264, "learning_rate": 3.002346500163206e-06, "log_odds_chosen": 1.1159179210662842, "log_odds_ratio": -0.45068359375, "logits/chosen": -1.1667969226837158, "logits/rejected": -0.9107421636581421, "logps/chosen": -0.8003906011581421, "logps/rejected": -1.6300780773162842, "loss": 1.1659, "nll_loss": 1.177734375, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08001708984375, "rewards/margins": 0.08297576755285263, "rewards/rejected": -0.16303710639476776, "step": 710 }, { "epoch": 0.09300523154427437, "grad_norm": 1.5977789176609785, "learning_rate": 2.9814239699997195e-06, "log_odds_chosen": 0.7395995855331421, "log_odds_ratio": -0.53271484375, "logits/chosen": -1.1212890148162842, "logits/rejected": -0.9505859613418579, "logps/chosen": -0.7992187738418579, "logps/rejected": -1.313085913658142, "loss": 1.1897, "nll_loss": 1.1154296398162842, "rewards/accuracies": 0.643750011920929, "rewards/chosen": -0.07990722358226776, "rewards/margins": 0.05129547044634819, "rewards/rejected": -0.13120117783546448, "step": 720 }, { "epoch": 0.09429697087127818, "grad_norm": 1.1867570389615867, "learning_rate": 2.9609328407904207e-06, "log_odds_chosen": 1.176123023033142, "log_odds_ratio": -0.4395996034145355, "logits/chosen": -0.9892578125, "logits/rejected": -0.856249988079071, "logps/chosen": -0.770312488079071, "logps/rejected": -1.639062523841858, "loss": 1.1576, "nll_loss": 1.115820288658142, "rewards/accuracies": 0.71875, "rewards/chosen": -0.07698974758386612, "rewards/margins": 0.0869293212890625, "rewards/rejected": -0.16386719048023224, "step": 730 }, { "epoch": 0.09558871019828198, "grad_norm": 1.2262028542430676, "learning_rate": 2.940858488375231e-06, "log_odds_chosen": 1.028906226158142, "log_odds_ratio": -0.47358399629592896, "logits/chosen": -1.176171898841858, "logits/rejected": -0.9681640863418579, "logps/chosen": -0.822070300579071, "logps/rejected": -1.5753905773162842, "loss": 1.195, "nll_loss": 1.1794922351837158, "rewards/accuracies": 0.75, "rewards/chosen": -0.08222655951976776, "rewards/margins": 0.075347900390625, "rewards/rejected": -0.15744629502296448, "step": 740 }, { "epoch": 0.0968804495252858, "grad_norm": 1.2567263809307754, "learning_rate": 2.9211869733608857e-06, "log_odds_chosen": 0.90283203125, "log_odds_ratio": -0.523242175579071, "logits/chosen": -1.0812499523162842, "logits/rejected": -0.9212890863418579, "logps/chosen": -0.8515625, "logps/rejected": -1.489843726158142, "loss": 1.1584, "nll_loss": 1.109960913658142, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.08521728217601776, "rewards/margins": 0.063720703125, "rewards/rejected": -0.14882811903953552, "step": 750 }, { "epoch": 0.09817218885228961, "grad_norm": 3.3244432009918663, "learning_rate": 2.901905000440047e-06, "log_odds_chosen": 1.102636694908142, "log_odds_ratio": -0.4515136778354645, "logits/chosen": -1.136328101158142, "logits/rejected": -0.9361327886581421, "logps/chosen": -0.7294921875, "logps/rejected": -1.5134766101837158, "loss": 1.1517, "nll_loss": 1.032617211341858, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07288818061351776, "rewards/margins": 0.07844848930835724, "rewards/rejected": -0.1514892578125, "step": 760 }, { "epoch": 0.09946392817929342, "grad_norm": 1.3972431013424784, "learning_rate": 2.8829998806257885e-06, "log_odds_chosen": 1.2353515625, "log_odds_ratio": -0.447021484375, "logits/chosen": -1.1953125, "logits/rejected": -0.8833984136581421, "logps/chosen": -0.8006836175918579, "logps/rejected": -1.703125, "loss": 1.1641, "nll_loss": 1.120703101158142, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.08011474460363388, "rewards/margins": 0.09016112983226776, "rewards/rejected": -0.17014160752296448, "step": 770 }, { "epoch": 0.10075566750629723, "grad_norm": 1.3282869052003041, "learning_rate": 2.8644594961577314e-06, "log_odds_chosen": 1.1076171398162842, "log_odds_ratio": -0.4720703065395355, "logits/chosen": -1.096289038658142, "logits/rejected": -0.905078113079071, "logps/chosen": -0.7958984375, "logps/rejected": -1.596093773841858, "loss": 1.1713, "nll_loss": 1.0832030773162842, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07962646335363388, "rewards/margins": 0.07999267429113388, "rewards/rejected": -0.15961913764476776, "step": 780 }, { "epoch": 0.10204740683330105, "grad_norm": 1.4352635500664344, "learning_rate": 2.84627226785928e-06, "log_odds_chosen": 0.95465087890625, "log_odds_ratio": -0.5184081792831421, "logits/chosen": -1.177148461341858, "logits/rejected": -0.9205077886581421, "logps/chosen": -0.8285156488418579, "logps/rejected": -1.559960961341858, "loss": 1.1289, "nll_loss": 1.1599609851837158, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08281250298023224, "rewards/margins": 0.07317809760570526, "rewards/rejected": -0.1561279296875, "step": 790 }, { "epoch": 0.10333914616030485, "grad_norm": 1.5912963583262987, "learning_rate": 2.82842712474619e-06, "log_odds_chosen": 0.859606921672821, "log_odds_ratio": -0.5381835699081421, "logits/chosen": -1.102929711341858, "logits/rejected": -0.9320312738418579, "logps/chosen": -0.807812511920929, "logps/rejected": -1.4509766101837158, "loss": 1.1634, "nll_loss": 1.1130859851837158, "rewards/accuracies": 0.643750011920929, "rewards/chosen": -0.08082275092601776, "rewards/margins": 0.06420745700597763, "rewards/rejected": -0.14492186903953552, "step": 800 }, { "epoch": 0.10463088548730866, "grad_norm": 1.4630243987866478, "learning_rate": 2.810913475705226e-06, "log_odds_chosen": 1.005957007408142, "log_odds_ratio": -0.4715820252895355, "logits/chosen": -1.104882836341858, "logits/rejected": -0.878125011920929, "logps/chosen": -0.7671874761581421, "logps/rejected": -1.484765648841858, "loss": 1.1361, "nll_loss": 1.0478515625, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.07667236030101776, "rewards/margins": 0.07175903022289276, "rewards/rejected": -0.14853516221046448, "step": 810 }, { "epoch": 0.10592262481431247, "grad_norm": 1.2872169145102348, "learning_rate": 2.7937211830783128e-06, "log_odds_chosen": 0.8750976324081421, "log_odds_ratio": -0.5582031011581421, "logits/chosen": -1.0945312976837158, "logits/rejected": -0.890820324420929, "logps/chosen": -0.8228515386581421, "logps/rejected": -1.457421898841858, "loss": 1.1461, "nll_loss": 1.187890648841858, "rewards/accuracies": 0.6812499761581421, "rewards/chosen": -0.08226318657398224, "rewards/margins": 0.06349487602710724, "rewards/rejected": -0.14582519233226776, "step": 820 }, { "epoch": 0.10721436414131628, "grad_norm": 1.3456631047705214, "learning_rate": 2.776840538002493e-06, "log_odds_chosen": 1.102148413658142, "log_odds_ratio": -0.451416015625, "logits/chosen": -1.145898461341858, "logits/rejected": -0.923828125, "logps/chosen": -0.757617175579071, "logps/rejected": -1.5544922351837158, "loss": 1.1471, "nll_loss": 1.06640625, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07579346001148224, "rewards/margins": 0.07951660454273224, "rewards/rejected": -0.15532226860523224, "step": 830 }, { "epoch": 0.1085061034683201, "grad_norm": 1.2631662398591137, "learning_rate": 2.7602622373694163e-06, "log_odds_chosen": 1.078125, "log_odds_ratio": -0.4767089784145355, "logits/chosen": -1.1144530773162842, "logits/rejected": -0.933789074420929, "logps/chosen": -0.7730468511581421, "logps/rejected": -1.5537109375, "loss": 1.1545, "nll_loss": 1.0974609851837158, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.07736816257238388, "rewards/margins": 0.07791747897863388, "rewards/rejected": -0.15524902939796448, "step": 840 }, { "epoch": 0.10979784279532391, "grad_norm": 1.3780268169491492, "learning_rate": 2.743977362280141e-06, "log_odds_chosen": 0.964648425579071, "log_odds_ratio": -0.500048816204071, "logits/chosen": -1.037500023841858, "logits/rejected": -0.889843761920929, "logps/chosen": -0.817187488079071, "logps/rejected": -1.505468726158142, "loss": 1.1425, "nll_loss": 1.1220703125, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08172607421875, "rewards/margins": 0.06888427585363388, "rewards/rejected": -0.1505126953125, "step": 850 }, { "epoch": 0.11108958212232771, "grad_norm": 1.373161695970351, "learning_rate": 2.7279773578818937e-06, "log_odds_chosen": 1.1259765625, "log_odds_ratio": -0.45576173067092896, "logits/chosen": -1.0242187976837158, "logits/rejected": -0.855664074420929, "logps/chosen": -0.7642577886581421, "logps/rejected": -1.531640648841858, "loss": 1.1499, "nll_loss": 1.2355468273162842, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07637939602136612, "rewards/margins": 0.07664184272289276, "rewards/rejected": -0.15302734076976776, "step": 860 }, { "epoch": 0.11238132144933152, "grad_norm": 1.3194128142477222, "learning_rate": 2.7122540144832417e-06, "log_odds_chosen": 1.11572265625, "log_odds_ratio": -0.4810546934604645, "logits/chosen": -1.1394531726837158, "logits/rejected": -0.940234363079071, "logps/chosen": -0.781054675579071, "logps/rejected": -1.599218726158142, "loss": 1.1465, "nll_loss": 1.1085937023162842, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.07819823920726776, "rewards/margins": 0.08179931342601776, "rewards/rejected": -0.15993651747703552, "step": 870 }, { "epoch": 0.11367306077633534, "grad_norm": 1.3699018634767623, "learning_rate": 2.696799449852968e-06, "log_odds_chosen": 0.997363269329071, "log_odds_ratio": -0.502978503704071, "logits/chosen": -1.181054711341858, "logits/rejected": -0.980664074420929, "logps/chosen": -0.7789062261581421, "logps/rejected": -1.512304663658142, "loss": 1.1613, "nll_loss": 1.1183593273162842, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07784423977136612, "rewards/margins": 0.07345886528491974, "rewards/rejected": -0.15134277939796448, "step": 880 }, { "epoch": 0.11496480010333915, "grad_norm": 1.327070907878745, "learning_rate": 2.6816060926159636e-06, "log_odds_chosen": 1.092675805091858, "log_odds_ratio": -0.4755859375, "logits/chosen": -1.0732421875, "logits/rejected": -0.883007824420929, "logps/chosen": -0.8623046875, "logps/rejected": -1.6749999523162842, "loss": 1.1307, "nll_loss": 1.1291015148162842, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.08623047173023224, "rewards/margins": 0.08126220852136612, "rewards/rejected": -0.16750487685203552, "step": 890 }, { "epoch": 0.11625653943034296, "grad_norm": 1.1915490143182448, "learning_rate": 2.6666666666666664e-06, "log_odds_chosen": 0.953857421875, "log_odds_ratio": -0.4917968809604645, "logits/chosen": -1.045507788658142, "logits/rejected": -0.915820300579071, "logps/chosen": -0.786328136920929, "logps/rejected": -1.41796875, "loss": 1.171, "nll_loss": 1.149023413658142, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07866211235523224, "rewards/margins": 0.06308440864086151, "rewards/rejected": -0.14189453423023224, "step": 900 }, { "epoch": 0.11754827875734676, "grad_norm": 1.4158282680234708, "learning_rate": 2.6519741765271837e-06, "log_odds_chosen": 1.0637328624725342, "log_odds_ratio": -0.478271484375, "logits/chosen": -1.1320312023162842, "logits/rejected": -0.941601574420929, "logps/chosen": -0.7564452886581421, "logps/rejected": -1.533593773841858, "loss": 1.1319, "nll_loss": 1.0759766101837158, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07567138969898224, "rewards/margins": 0.07762298732995987, "rewards/rejected": -0.15336914360523224, "step": 910 }, { "epoch": 0.11884001808435057, "grad_norm": 1.4979411861902598, "learning_rate": 2.637521893583148e-06, "log_odds_chosen": 1.232812523841858, "log_odds_ratio": -0.4005371034145355, "logits/chosen": -1.0720703601837158, "logits/rejected": -0.8804687261581421, "logps/chosen": -0.8119140863418579, "logps/rejected": -1.708593726158142, "loss": 1.1349, "nll_loss": 1.133203148841858, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.08122558891773224, "rewards/margins": 0.08980713039636612, "rewards/rejected": -0.1710205078125, "step": 920 }, { "epoch": 0.12013175741135439, "grad_norm": 1.4329687203340835, "learning_rate": 2.6233033431358115e-06, "log_odds_chosen": 1.117883324623108, "log_odds_ratio": -0.4404296875, "logits/chosen": -1.094335913658142, "logits/rejected": -0.8783203363418579, "logps/chosen": -0.737500011920929, "logps/rejected": -1.5349609851837158, "loss": 1.1592, "nll_loss": 1.089257836341858, "rewards/accuracies": 0.75, "rewards/chosen": -0.07379150390625, "rewards/margins": 0.07981643825769424, "rewards/rejected": -0.153564453125, "step": 930 }, { "epoch": 0.1214234967383582, "grad_norm": 1.3100609893803656, "learning_rate": 2.6093122922137685e-06, "log_odds_chosen": 1.1267821788787842, "log_odds_ratio": -0.500683605670929, "logits/chosen": -1.113671898841858, "logits/rejected": -0.943554699420929, "logps/chosen": -0.7984374761581421, "logps/rejected": -1.6189453601837158, "loss": 1.1455, "nll_loss": 1.0451171398162842, "rewards/accuracies": 0.699999988079071, "rewards/chosen": -0.07980956882238388, "rewards/margins": 0.08204193413257599, "rewards/rejected": -0.16184082627296448, "step": 940 }, { "epoch": 0.12271523606536201, "grad_norm": 1.2477819792797682, "learning_rate": 2.5955427380922006e-06, "log_odds_chosen": 1.266699194908142, "log_odds_ratio": -0.41845703125, "logits/chosen": -1.117578148841858, "logits/rejected": -0.8882812261581421, "logps/chosen": -0.7408202886581421, "logps/rejected": -1.663476586341858, "loss": 1.123, "nll_loss": 1.0281250476837158, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07415771484375, "rewards/margins": 0.092376708984375, "rewards/rejected": -0.16650390625, "step": 950 }, { "epoch": 0.12400697539236583, "grad_norm": 1.1896346898370782, "learning_rate": 2.5819888974716113e-06, "log_odds_chosen": 1.2431151866912842, "log_odds_ratio": -0.4400390684604645, "logits/chosen": -1.1259765625, "logits/rejected": -0.905468761920929, "logps/chosen": -0.7206054925918579, "logps/rejected": -1.581445336341858, "loss": 1.1184, "nll_loss": 1.0544922351837158, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07199706882238388, "rewards/margins": 0.08620300143957138, "rewards/rejected": -0.15817871689796448, "step": 960 }, { "epoch": 0.12529871471936962, "grad_norm": 1.372423060006083, "learning_rate": 2.5686451962717425e-06, "log_odds_chosen": 1.082910180091858, "log_odds_ratio": -0.503613293170929, "logits/chosen": -1.062890648841858, "logits/rejected": -0.8851562738418579, "logps/chosen": -0.8173828125, "logps/rejected": -1.6453125476837158, "loss": 1.1486, "nll_loss": 1.1298828125, "rewards/accuracies": 0.6875, "rewards/chosen": -0.08173827826976776, "rewards/margins": 0.08282165229320526, "rewards/rejected": -0.1646728515625, "step": 970 }, { "epoch": 0.12659045404637345, "grad_norm": 1.3070090355631485, "learning_rate": 2.5555062599997596e-06, "log_odds_chosen": 1.112280249595642, "log_odds_ratio": -0.4749511778354645, "logits/chosen": -1.079492211341858, "logits/rejected": -0.9228515625, "logps/chosen": -0.7783203125, "logps/rejected": -1.58203125, "loss": 1.1263, "nll_loss": 1.0712890625, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07783202826976776, "rewards/margins": 0.080352783203125, "rewards/rejected": -0.15822753310203552, "step": 980 }, { "epoch": 0.12788219337337725, "grad_norm": 1.3417780133407455, "learning_rate": 2.5425669046549126e-06, "log_odds_chosen": 1.10009765625, "log_odds_ratio": -0.4800781309604645, "logits/chosen": -1.109765648841858, "logits/rejected": -0.941601574420929, "logps/chosen": -0.780468761920929, "logps/rejected": -1.5595703125, "loss": 1.1309, "nll_loss": 1.0636718273162842, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07801513373851776, "rewards/margins": 0.077880859375, "rewards/rejected": -0.15578612685203552, "step": 990 }, { "epoch": 0.12917393270038105, "grad_norm": 1.3065765195099275, "learning_rate": 2.5298221281347034e-06, "log_odds_chosen": 1.2001953125, "log_odds_ratio": -0.46040040254592896, "logits/chosen": -1.0771484375, "logits/rejected": -0.8697265386581421, "logps/chosen": -0.7974609136581421, "logps/rejected": -1.659765601158142, "loss": 1.1659, "nll_loss": 1.142578125, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07972411811351776, "rewards/margins": 0.08632202446460724, "rewards/rejected": -0.16606445610523224, "step": 1000 }, { "epoch": 0.13046567202738488, "grad_norm": 1.3948602747639438, "learning_rate": 2.5172671021102103e-06, "log_odds_chosen": 0.920336902141571, "log_odds_ratio": -0.521435558795929, "logits/chosen": -1.177343726158142, "logits/rejected": -0.9976562261581421, "logps/chosen": -0.8033202886581421, "logps/rejected": -1.462890625, "loss": 1.1386, "nll_loss": 1.070898413658142, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": -0.08033446967601776, "rewards/margins": 0.066192626953125, "rewards/rejected": -0.14645996689796448, "step": 1010 }, { "epoch": 0.13175741135438868, "grad_norm": 1.2271648513855602, "learning_rate": 2.504897164340598e-06, "log_odds_chosen": 0.995312511920929, "log_odds_ratio": -0.502197265625, "logits/chosen": -1.111718773841858, "logits/rejected": -0.9408203363418579, "logps/chosen": -0.8228515386581421, "logps/rejected": -1.5617187023162842, "loss": 1.1403, "nll_loss": 1.115234375, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08223877102136612, "rewards/margins": 0.07394103705883026, "rewards/rejected": -0.15615233778953552, "step": 1020 }, { "epoch": 0.1330491506813925, "grad_norm": 1.3919430776507808, "learning_rate": 2.492707811399023e-06, "log_odds_chosen": 1.2410156726837158, "log_odds_ratio": -0.4007812440395355, "logits/chosen": -1.1130859851837158, "logits/rejected": -0.8775390386581421, "logps/chosen": -0.759960949420929, "logps/rejected": -1.640039086341858, "loss": 1.131, "nll_loss": 1.0763671398162842, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.0760498046875, "rewards/margins": 0.08796386420726776, "rewards/rejected": -0.16391602158546448, "step": 1030 }, { "epoch": 0.1343408900083963, "grad_norm": 1.3299014658160841, "learning_rate": 2.480694691784169e-06, "log_odds_chosen": 1.115991234779358, "log_odds_ratio": -0.476318359375, "logits/chosen": -1.0828125476837158, "logits/rejected": -0.8994140625, "logps/chosen": -0.802734375, "logps/rejected": -1.6337890625, "loss": 1.1392, "nll_loss": 1.199804663658142, "rewards/accuracies": 0.71875, "rewards/chosen": -0.08023681491613388, "rewards/margins": 0.08300018310546875, "rewards/rejected": -0.16328124701976776, "step": 1040 }, { "epoch": 0.13563262933540013, "grad_norm": 1.2762969025147817, "learning_rate": 2.4688535993934706e-06, "log_odds_chosen": 1.0980713367462158, "log_odds_ratio": -0.4600585997104645, "logits/chosen": -1.2019531726837158, "logits/rejected": -0.943554699420929, "logps/chosen": -0.759765625, "logps/rejected": -1.5626952648162842, "loss": 1.1387, "nll_loss": 1.0460937023162842, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07597656548023224, "rewards/margins": 0.08021392673254013, "rewards/rejected": -0.15622559189796448, "step": 1050 }, { "epoch": 0.13692436866240393, "grad_norm": 1.4729276168452141, "learning_rate": 2.457180467335805e-06, "log_odds_chosen": 1.1150391101837158, "log_odds_ratio": -0.4817871153354645, "logits/chosen": -1.0935547351837158, "logits/rejected": -0.8949218988418579, "logps/chosen": -0.824414074420929, "logps/rejected": -1.670507788658142, "loss": 1.1409, "nll_loss": 1.1201171875, "rewards/accuracies": 0.71875, "rewards/chosen": -0.08247070014476776, "rewards/margins": 0.08469848334789276, "rewards/rejected": -0.16704101860523224, "step": 1060 }, { "epoch": 0.13821610798940773, "grad_norm": 1.3201375381064102, "learning_rate": 2.4456713620629725e-06, "log_odds_chosen": 1.0822265148162842, "log_odds_ratio": -0.44038087129592896, "logits/chosen": -1.173828125, "logits/rejected": -0.930468738079071, "logps/chosen": -0.748046875, "logps/rejected": -1.5207030773162842, "loss": 1.1396, "nll_loss": 1.0343749523162842, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07478027045726776, "rewards/margins": 0.07741699367761612, "rewards/rejected": -0.1522216796875, "step": 1070 }, { "epoch": 0.13950784731641155, "grad_norm": 1.3273520687243323, "learning_rate": 2.4343224778007378e-06, "log_odds_chosen": 1.16357421875, "log_odds_ratio": -0.503173828125, "logits/chosen": -1.113867163658142, "logits/rejected": -0.9164062738418579, "logps/chosen": -0.807812511920929, "logps/rejected": -1.6755859851837158, "loss": 1.1062, "nll_loss": 1.0246093273162842, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.080810546875, "rewards/margins": 0.08669433742761612, "rewards/rejected": -0.16748046875, "step": 1080 }, { "epoch": 0.14079958664341535, "grad_norm": 1.3876866947546487, "learning_rate": 2.4231301312615306e-06, "log_odds_chosen": 0.9229491949081421, "log_odds_ratio": -0.517382800579071, "logits/chosen": -1.191992163658142, "logits/rejected": -0.9248046875, "logps/chosen": -0.774609386920929, "logps/rejected": -1.458984375, "loss": 1.1378, "nll_loss": 1.073632836341858, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.07744140923023224, "rewards/margins": 0.06840820610523224, "rewards/rejected": -0.14589843153953552, "step": 1090 }, { "epoch": 0.14209132597041918, "grad_norm": 1.3715284318714909, "learning_rate": 2.412090756622109e-06, "log_odds_chosen": 1.021484375, "log_odds_ratio": -0.4747070372104645, "logits/chosen": -1.0998046398162842, "logits/rejected": -0.932421863079071, "logps/chosen": -0.7935546636581421, "logps/rejected": -1.525390625, "loss": 1.1362, "nll_loss": 1.1076171398162842, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.079345703125, "rewards/margins": 0.07316283881664276, "rewards/rejected": -0.15241698920726776, "step": 1100 }, { "epoch": 0.14338306529742298, "grad_norm": 1.5924740252054508, "learning_rate": 2.401200900750657e-06, "log_odds_chosen": 1.0475585460662842, "log_odds_ratio": -0.44902342557907104, "logits/chosen": -1.0802733898162842, "logits/rejected": -0.8617187738418579, "logps/chosen": -0.7339843511581421, "logps/rejected": -1.4353516101837158, "loss": 1.0923, "nll_loss": 1.035546898841858, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07338867336511612, "rewards/margins": 0.07010497897863388, "rewards/rejected": -0.14360351860523224, "step": 1110 }, { "epoch": 0.14467480462442678, "grad_norm": 1.2358991519735072, "learning_rate": 2.390457218668787e-06, "log_odds_chosen": 1.0911133289337158, "log_odds_ratio": -0.4476562440395355, "logits/chosen": -1.1443359851837158, "logits/rejected": -0.901171863079071, "logps/chosen": -0.771289050579071, "logps/rejected": -1.518945336341858, "loss": 1.0979, "nll_loss": 0.995312511920929, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07708740234375, "rewards/margins": 0.07478637993335724, "rewards/rejected": -0.15187987685203552, "step": 1120 }, { "epoch": 0.1459665439514306, "grad_norm": 1.3488577378588829, "learning_rate": 2.379856469234918e-06, "log_odds_chosen": 1.2648437023162842, "log_odds_ratio": -0.44047850370407104, "logits/chosen": -1.0966796875, "logits/rejected": -0.9404296875, "logps/chosen": -0.806835949420929, "logps/rejected": -1.7421875, "loss": 1.1331, "nll_loss": 1.0724608898162842, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.08067627251148224, "rewards/margins": 0.09360351413488388, "rewards/rejected": -0.17421874403953552, "step": 1130 }, { "epoch": 0.1472582832784344, "grad_norm": 1.4388529655771254, "learning_rate": 2.369395511036369e-06, "log_odds_chosen": 1.0750000476837158, "log_odds_ratio": -0.48027342557907104, "logits/chosen": -1.126367211341858, "logits/rejected": -0.919921875, "logps/chosen": -0.8042968511581421, "logps/rejected": -1.564062476158142, "loss": 1.103, "nll_loss": 1.060937523841858, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08038330078125, "rewards/margins": 0.07592467963695526, "rewards/rejected": -0.15634766221046448, "step": 1140 }, { "epoch": 0.14855002260543823, "grad_norm": 1.3209082587268852, "learning_rate": 2.359071298478354e-06, "log_odds_chosen": 0.9400879144668579, "log_odds_ratio": -0.544628918170929, "logits/chosen": -1.113671898841858, "logits/rejected": -0.9183593988418579, "logps/chosen": -0.8265625238418579, "logps/rejected": -1.531640648841858, "loss": 1.1212, "nll_loss": 1.087499976158142, "rewards/accuracies": 0.71875, "rewards/chosen": -0.08259277045726776, "rewards/margins": 0.07053222507238388, "rewards/rejected": -0.15300293266773224, "step": 1150 }, { "epoch": 0.14984176193244203, "grad_norm": 1.2521610091460516, "learning_rate": 2.3488808780588137e-06, "log_odds_chosen": 1.1383788585662842, "log_odds_ratio": -0.4613281190395355, "logits/chosen": -1.117578148841858, "logits/rejected": -0.9017578363418579, "logps/chosen": -0.837109386920929, "logps/rejected": -1.6550781726837158, "loss": 1.116, "nll_loss": 1.1082031726837158, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.083740234375, "rewards/margins": 0.08187256008386612, "rewards/rejected": -0.16550293564796448, "step": 1160 }, { "epoch": 0.15113350125944586, "grad_norm": 1.2956595234243158, "learning_rate": 2.3388213848187446e-06, "log_odds_chosen": 1.450927734375, "log_odds_ratio": -0.37812501192092896, "logits/chosen": -1.171289086341858, "logits/rejected": -0.9261718988418579, "logps/chosen": -0.751953125, "logps/rejected": -1.7976562976837158, "loss": 1.1281, "nll_loss": 1.0732421875, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07520751655101776, "rewards/margins": 0.10442505031824112, "rewards/rejected": -0.17966309189796448, "step": 1170 }, { "epoch": 0.15242524058644966, "grad_norm": 1.3800768816100841, "learning_rate": 2.328890038958328e-06, "log_odds_chosen": 1.398828148841858, "log_odds_ratio": -0.3961425721645355, "logits/chosen": -1.0763671398162842, "logits/rejected": -0.8607422113418579, "logps/chosen": -0.734082043170929, "logps/rejected": -1.7453124523162842, "loss": 1.1235, "nll_loss": 0.999218761920929, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07333984225988388, "rewards/margins": 0.10135497897863388, "rewards/rejected": -0.17473144829273224, "step": 1180 }, { "epoch": 0.15371697991345346, "grad_norm": 1.4944316671133717, "learning_rate": 2.3190841426097937e-06, "log_odds_chosen": 1.2546875476837158, "log_odds_ratio": -0.45146483182907104, "logits/chosen": -1.1154296398162842, "logits/rejected": -0.932421863079071, "logps/chosen": -0.7935546636581421, "logps/rejected": -1.7121093273162842, "loss": 1.1188, "nll_loss": 1.0310547351837158, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07933349907398224, "rewards/margins": 0.09170226752758026, "rewards/rejected": -0.17104491591453552, "step": 1190 }, { "epoch": 0.15500871924045728, "grad_norm": 1.2440668732866864, "learning_rate": 2.309401076758503e-06, "log_odds_chosen": 1.306249976158142, "log_odds_ratio": -0.4134277403354645, "logits/chosen": -1.1349608898162842, "logits/rejected": -0.9248046875, "logps/chosen": -0.761523425579071, "logps/rejected": -1.6945312023162842, "loss": 1.1292, "nll_loss": 1.0949218273162842, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07615967094898224, "rewards/margins": 0.09329833835363388, "rewards/rejected": -0.16953125596046448, "step": 1200 }, { "epoch": 0.15630045856746108, "grad_norm": 1.28882495876724, "learning_rate": 2.299838298304276e-06, "log_odds_chosen": 1.199804663658142, "log_odds_ratio": -0.42622071504592896, "logits/chosen": -1.138085961341858, "logits/rejected": -0.9658203125, "logps/chosen": -0.7623046636581421, "logps/rejected": -1.6062500476837158, "loss": 1.1146, "nll_loss": 1.103515625, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07625732570886612, "rewards/margins": 0.08441162109375, "rewards/rejected": -0.16069336235523224, "step": 1210 }, { "epoch": 0.1575921978944649, "grad_norm": 1.4835488646397357, "learning_rate": 2.2903933372554728e-06, "log_odds_chosen": 1.4255859851837158, "log_odds_ratio": -0.39091795682907104, "logits/chosen": -1.2109375, "logits/rejected": -0.9652343988418579, "logps/chosen": -0.761914074420929, "logps/rejected": -1.7804687023162842, "loss": 1.1125, "nll_loss": 0.994140625, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07622070610523224, "rewards/margins": 0.10186157375574112, "rewards/rejected": -0.17824706435203552, "step": 1220 }, { "epoch": 0.1588839372214687, "grad_norm": 1.3699495727568183, "learning_rate": 2.281063794048804e-06, "log_odds_chosen": 1.237402319908142, "log_odds_ratio": -0.44575196504592896, "logits/chosen": -1.1083984375, "logits/rejected": -0.976757824420929, "logps/chosen": -0.7533203363418579, "logps/rejected": -1.6589844226837158, "loss": 1.106, "nll_loss": 1.059960961341858, "rewards/accuracies": 0.75, "rewards/chosen": -0.07528076320886612, "rewards/margins": 0.09058532863855362, "rewards/rejected": -0.16591796278953552, "step": 1230 }, { "epoch": 0.1601756765484725, "grad_norm": 1.44050030611481, "learning_rate": 2.271847336988259e-06, "log_odds_chosen": 1.083398461341858, "log_odds_ratio": -0.481689453125, "logits/chosen": -1.1033203601837158, "logits/rejected": -0.935351550579071, "logps/chosen": -0.809374988079071, "logps/rejected": -1.6017577648162842, "loss": 1.1177, "nll_loss": 1.057031273841858, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.08094482123851776, "rewards/margins": 0.07926635444164276, "rewards/rejected": -0.16030272841453552, "step": 1240 }, { "epoch": 0.16146741587547633, "grad_norm": 1.3086122074478357, "learning_rate": 2.262741699796952e-06, "log_odds_chosen": 1.234277367591858, "log_odds_ratio": -0.41997069120407104, "logits/chosen": -1.2326171398162842, "logits/rejected": -0.958789050579071, "logps/chosen": -0.767773449420929, "logps/rejected": -1.665624976158142, "loss": 1.0948, "nll_loss": 1.0517578125, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07674560695886612, "rewards/margins": 0.08981017768383026, "rewards/rejected": -0.1666259765625, "step": 1250 }, { "epoch": 0.16275915520248013, "grad_norm": 1.2936055039074432, "learning_rate": 2.253744679276044e-06, "log_odds_chosen": 1.24365234375, "log_odds_ratio": -0.4651855528354645, "logits/chosen": -1.0837891101837158, "logits/rejected": -0.9564453363418579, "logps/chosen": -0.7847656011581421, "logps/rejected": -1.728515625, "loss": 1.1105, "nll_loss": 1.072656273841858, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.07845459133386612, "rewards/margins": 0.09423675388097763, "rewards/rejected": -0.17270508408546448, "step": 1260 }, { "epoch": 0.16405089452948396, "grad_norm": 1.4266025957013813, "learning_rate": 2.244854133065255e-06, "log_odds_chosen": 1.263574242591858, "log_odds_ratio": -0.4093261659145355, "logits/chosen": -1.052343726158142, "logits/rejected": -0.895703136920929, "logps/chosen": -0.7308593988418579, "logps/rejected": -1.6142578125, "loss": 1.1341, "nll_loss": 1.201562523841858, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07308349758386612, "rewards/margins": 0.08831176906824112, "rewards/rejected": -0.1614990234375, "step": 1270 }, { "epoch": 0.16534263385648776, "grad_norm": 1.498154976991836, "learning_rate": 2.2360679774997895e-06, "log_odds_chosen": 1.291406273841858, "log_odds_ratio": -0.4771972596645355, "logits/chosen": -1.0886719226837158, "logits/rejected": -0.9515625238418579, "logps/chosen": -0.779296875, "logps/rejected": -1.754492163658142, "loss": 1.1113, "nll_loss": 1.068750023841858, "rewards/accuracies": 0.75, "rewards/chosen": -0.07791747897863388, "rewards/margins": 0.09754638373851776, "rewards/rejected": -0.17536620795726776, "step": 1280 }, { "epoch": 0.16663437318349156, "grad_norm": 1.4686616555046261, "learning_rate": 2.2273841855588183e-06, "log_odds_chosen": 1.124914526939392, "log_odds_ratio": -0.47343748807907104, "logits/chosen": -1.1814453601837158, "logits/rejected": -0.978320300579071, "logps/chosen": -0.8343750238418579, "logps/rejected": -1.6603515148162842, "loss": 1.1424, "nll_loss": 1.1671874523162842, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.08339843899011612, "rewards/margins": 0.08247070014476776, "rewards/rejected": -0.166015625, "step": 1290 }, { "epoch": 0.16792611251049538, "grad_norm": 1.3237206808679978, "learning_rate": 2.2188007849009167e-06, "log_odds_chosen": 1.2733154296875, "log_odds_ratio": -0.423828125, "logits/chosen": -1.2234375476837158, "logits/rejected": -0.94921875, "logps/chosen": -0.763671875, "logps/rejected": -1.6951172351837158, "loss": 1.1232, "nll_loss": 1.0324218273162842, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07636718451976776, "rewards/margins": 0.09322662651538849, "rewards/rejected": -0.16965332627296448, "step": 1300 }, { "epoch": 0.16921785183749918, "grad_norm": 1.4317095067575667, "learning_rate": 2.2103158559821502e-06, "log_odds_chosen": 1.0578124523162842, "log_odds_ratio": -0.47895509004592896, "logits/chosen": -1.160546898841858, "logits/rejected": -0.935351550579071, "logps/chosen": -0.822265625, "logps/rejected": -1.6296875476837158, "loss": 1.1068, "nll_loss": 1.1130859851837158, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.08221435546875, "rewards/margins": 0.0806732177734375, "rewards/rejected": -0.16289062798023224, "step": 1310 }, { "epoch": 0.170509591164503, "grad_norm": 1.3936612927296241, "learning_rate": 2.2019275302527213e-06, "log_odds_chosen": 1.143225073814392, "log_odds_ratio": -0.49067384004592896, "logits/chosen": -1.094335913658142, "logits/rejected": -0.954296886920929, "logps/chosen": -0.7623046636581421, "logps/rejected": -1.6062500476837158, "loss": 1.1001, "nll_loss": 1.01953125, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.076171875, "rewards/margins": 0.08434142917394638, "rewards/rejected": -0.16064453125, "step": 1320 }, { "epoch": 0.1718013304915068, "grad_norm": 1.3657127435779988, "learning_rate": 2.193633988428327e-06, "log_odds_chosen": 1.1318359375, "log_odds_ratio": -0.4637695252895355, "logits/chosen": -1.1541016101837158, "logits/rejected": -0.9644531011581421, "logps/chosen": -0.7568359375, "logps/rejected": -1.546484351158142, "loss": 1.1065, "nll_loss": 1.0623047351837158, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07569579780101776, "rewards/margins": 0.07891845703125, "rewards/rejected": -0.15461425483226776, "step": 1330 }, { "epoch": 0.17309306981851064, "grad_norm": 1.4254012715171065, "learning_rate": 2.185433458832612e-06, "log_odds_chosen": 1.1473267078399658, "log_odds_ratio": -0.4442382752895355, "logits/chosen": -1.151953101158142, "logits/rejected": -0.9765625, "logps/chosen": -0.798046886920929, "logps/rejected": -1.634765625, "loss": 1.1163, "nll_loss": 1.1144530773162842, "rewards/accuracies": 0.75, "rewards/chosen": -0.07978515326976776, "rewards/margins": 0.08360596001148224, "rewards/rejected": -0.16335448622703552, "step": 1340 }, { "epoch": 0.17438480914551444, "grad_norm": 1.3545870936994966, "learning_rate": 2.177324215807269e-06, "log_odds_chosen": 1.1541016101837158, "log_odds_ratio": -0.45927733182907104, "logits/chosen": -1.1435546875, "logits/rejected": -0.9658203125, "logps/chosen": -0.817578136920929, "logps/rejected": -1.654296875, "loss": 1.1295, "nll_loss": 1.066015601158142, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.08183594048023224, "rewards/margins": 0.08367309719324112, "rewards/rejected": -0.1654052734375, "step": 1350 }, { "epoch": 0.17567654847251823, "grad_norm": 1.2738765317640237, "learning_rate": 2.1693045781865616e-06, "log_odds_chosen": 1.1106445789337158, "log_odds_ratio": -0.465576171875, "logits/chosen": -1.149999976158142, "logits/rejected": -0.9623047113418579, "logps/chosen": -0.7508789300918579, "logps/rejected": -1.5535156726837158, "loss": 1.0934, "nll_loss": 1.075585961341858, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.07503662258386612, "rewards/margins": 0.08033446967601776, "rewards/rejected": -0.15537109971046448, "step": 1360 }, { "epoch": 0.17696828779952206, "grad_norm": 1.9798266333560217, "learning_rate": 2.1613729078331965e-06, "log_odds_chosen": 1.122460961341858, "log_odds_ratio": -0.4314941465854645, "logits/chosen": -1.213476538658142, "logits/rejected": -0.9369140863418579, "logps/chosen": -0.74755859375, "logps/rejected": -1.5460937023162842, "loss": 1.1118, "nll_loss": 1.090429663658142, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07467041164636612, "rewards/margins": 0.07977294921875, "rewards/rejected": -0.15446777641773224, "step": 1370 }, { "epoch": 0.17826002712652586, "grad_norm": 1.4758894451151416, "learning_rate": 2.1535276082326617e-06, "log_odds_chosen": 1.2423827648162842, "log_odds_ratio": -0.4352050721645355, "logits/chosen": -1.091796875, "logits/rejected": -0.9244140386581421, "logps/chosen": -0.7679687738418579, "logps/rejected": -1.6765625476837158, "loss": 1.0908, "nll_loss": 0.9888671636581421, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07677002251148224, "rewards/margins": 0.09089355170726776, "rewards/rejected": -0.16774901747703552, "step": 1380 }, { "epoch": 0.1795517664535297, "grad_norm": 1.4533326056703724, "learning_rate": 2.14576712314328e-06, "log_odds_chosen": 1.2523925304412842, "log_odds_ratio": -0.43720704317092896, "logits/chosen": -1.143164038658142, "logits/rejected": -0.9419921636581421, "logps/chosen": -0.720898449420929, "logps/rejected": -1.6140625476837158, "loss": 1.0937, "nll_loss": 1.039453148841858, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07209472358226776, "rewards/margins": 0.089263916015625, "rewards/rejected": -0.16130371391773224, "step": 1390 }, { "epoch": 0.1808435057805335, "grad_norm": 1.3122823944760766, "learning_rate": 2.138089935299395e-06, "log_odds_chosen": 0.9754883050918579, "log_odds_ratio": -0.510058581829071, "logits/chosen": -1.158789038658142, "logits/rejected": -0.990429699420929, "logps/chosen": -0.7818359136581421, "logps/rejected": -1.484375, "loss": 1.0846, "nll_loss": 1.0330078601837158, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07827148586511612, "rewards/margins": 0.07023315131664276, "rewards/rejected": -0.14836426079273224, "step": 1400 }, { "epoch": 0.18213524510753729, "grad_norm": 1.3244432635399115, "learning_rate": 2.1304945651652297e-06, "log_odds_chosen": 1.2722656726837158, "log_odds_ratio": -0.4310058653354645, "logits/chosen": -1.149804711341858, "logits/rejected": -0.9359375238418579, "logps/chosen": -0.8238281011581421, "logps/rejected": -1.7550780773162842, "loss": 1.1142, "nll_loss": 1.1554687023162842, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.08232422173023224, "rewards/margins": 0.09328613430261612, "rewards/rejected": -0.17570801079273224, "step": 1410 }, { "epoch": 0.1834269844345411, "grad_norm": 1.2850671452196158, "learning_rate": 2.122979569737101e-06, "log_odds_chosen": 1.105371117591858, "log_odds_ratio": -0.43339842557907104, "logits/chosen": -1.1662108898162842, "logits/rejected": -0.9847656488418579, "logps/chosen": -0.7476562261581421, "logps/rejected": -1.529296875, "loss": 1.0991, "nll_loss": 1.0300781726837158, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07478027045726776, "rewards/margins": 0.07816161960363388, "rewards/rejected": -0.1529541015625, "step": 1420 }, { "epoch": 0.1847187237615449, "grad_norm": 2.4308567192893955, "learning_rate": 2.11554354139178e-06, "log_odds_chosen": 1.1113770008087158, "log_odds_ratio": -0.44941407442092896, "logits/chosen": -1.1435546875, "logits/rejected": -0.9453125, "logps/chosen": -0.8001953363418579, "logps/rejected": -1.596289038658142, "loss": 1.1047, "nll_loss": 1.0546875, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.08002929389476776, "rewards/margins": 0.07972107082605362, "rewards/rejected": -0.15974120795726776, "step": 1430 }, { "epoch": 0.18601046308854874, "grad_norm": 1.2772233655673262, "learning_rate": 2.1081851067789196e-06, "log_odds_chosen": 1.0105469226837158, "log_odds_ratio": -0.5079101324081421, "logits/chosen": -1.118554711341858, "logits/rejected": -0.8994140625, "logps/chosen": -0.81640625, "logps/rejected": -1.540624976158142, "loss": 1.1064, "nll_loss": 1.10546875, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.0816650390625, "rewards/margins": 0.07232666015625, "rewards/rejected": -0.1539306640625, "step": 1440 }, { "epoch": 0.18730220241555254, "grad_norm": 1.5698697170646343, "learning_rate": 2.1009029257555606e-06, "log_odds_chosen": 1.3738281726837158, "log_odds_ratio": -0.40522462129592896, "logits/chosen": -1.2189452648162842, "logits/rejected": -0.9751952886581421, "logps/chosen": -0.782421886920929, "logps/rejected": -1.7888672351837158, "loss": 1.077, "nll_loss": 0.977343738079071, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07829590141773224, "rewards/margins": 0.10050048679113388, "rewards/rejected": -0.17868652939796448, "step": 1450 }, { "epoch": 0.18859394174255636, "grad_norm": 1.5025387469398077, "learning_rate": 2.0936956903608545e-06, "log_odds_chosen": 1.194799780845642, "log_odds_ratio": -0.4173339903354645, "logits/chosen": -1.068945288658142, "logits/rejected": -0.902539074420929, "logps/chosen": -0.772265613079071, "logps/rejected": -1.600000023841858, "loss": 1.1315, "nll_loss": 1.064062476158142, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.0772705078125, "rewards/margins": 0.08281020820140839, "rewards/rejected": -0.16000977158546448, "step": 1460 }, { "epoch": 0.18988568106956016, "grad_norm": 1.226791941569367, "learning_rate": 2.0865621238292046e-06, "log_odds_chosen": 0.957653820514679, "log_odds_ratio": -0.49580079317092896, "logits/chosen": -1.1462891101837158, "logits/rejected": -0.952929675579071, "logps/chosen": -0.765429675579071, "logps/rejected": -1.431249976158142, "loss": 1.0962, "nll_loss": 1.024999976158142, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.0765380859375, "rewards/margins": 0.066650390625, "rewards/rejected": -0.14291992783546448, "step": 1470 }, { "epoch": 0.19117742039656396, "grad_norm": 1.255816048846265, "learning_rate": 2.079500979640145e-06, "log_odds_chosen": 1.3544921875, "log_odds_ratio": -0.39433592557907104, "logits/chosen": -1.2179687023162842, "logits/rejected": -0.981640636920929, "logps/chosen": -0.744921863079071, "logps/rejected": -1.7136719226837158, "loss": 1.1083, "nll_loss": 1.0154297351837158, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07443847507238388, "rewards/margins": 0.09688110649585724, "rewards/rejected": -0.17136231064796448, "step": 1480 }, { "epoch": 0.1924691597235678, "grad_norm": 1.5093391663942994, "learning_rate": 2.072511040603359e-06, "log_odds_chosen": 1.44677734375, "log_odds_ratio": -0.4171386659145355, "logits/chosen": -1.064843773841858, "logits/rejected": -0.936328113079071, "logps/chosen": -0.732226550579071, "logps/rejected": -1.800390601158142, "loss": 1.093, "nll_loss": 1.03515625, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07322998344898224, "rewards/margins": 0.10672607272863388, "rewards/rejected": -0.179931640625, "step": 1490 }, { "epoch": 0.1937608990505716, "grad_norm": 1.4439729612192194, "learning_rate": 2.065591117977289e-06, "log_odds_chosen": 1.3293945789337158, "log_odds_ratio": -0.4292968809604645, "logits/chosen": -0.9779297113418579, "logits/rejected": -0.841015636920929, "logps/chosen": -0.741406261920929, "logps/rejected": -1.738867163658142, "loss": 1.0959, "nll_loss": 1.0681641101837158, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07419433444738388, "rewards/margins": 0.09969482570886612, "rewards/rejected": -0.173828125, "step": 1500 }, { "epoch": 0.19505263837757542, "grad_norm": 1.4160458169410626, "learning_rate": 2.058740050619915e-06, "log_odds_chosen": 1.3718750476837158, "log_odds_ratio": -0.4171386659145355, "logits/chosen": -1.183007836341858, "logits/rejected": -0.9681640863418579, "logps/chosen": -0.741406261920929, "logps/rejected": -1.753515601158142, "loss": 1.074, "nll_loss": 1.0636718273162842, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07413329929113388, "rewards/margins": 0.10120849311351776, "rewards/rejected": -0.17539063096046448, "step": 1510 }, { "epoch": 0.19634437770457921, "grad_norm": 1.547211341318252, "learning_rate": 2.0519567041703083e-06, "log_odds_chosen": 1.310937523841858, "log_odds_ratio": -0.4332275390625, "logits/chosen": -1.159570336341858, "logits/rejected": -0.9609375, "logps/chosen": -0.7626953125, "logps/rejected": -1.716406226158142, "loss": 1.0645, "nll_loss": 0.970898449420929, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07625732570886612, "rewards/margins": 0.095306396484375, "rewards/rejected": -0.171630859375, "step": 1520 }, { "epoch": 0.19763611703158301, "grad_norm": 1.6239989582832697, "learning_rate": 2.0452399702596544e-06, "log_odds_chosen": 1.317480444908142, "log_odds_ratio": -0.4146484434604645, "logits/chosen": -1.2160155773162842, "logits/rejected": -0.962109386920929, "logps/chosen": -0.799023449420929, "logps/rejected": -1.7570312023162842, "loss": 1.1072, "nll_loss": 1.0144531726837158, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07993163913488388, "rewards/margins": 0.09577026218175888, "rewards/rejected": -0.17578125, "step": 1530 }, { "epoch": 0.19892785635858684, "grad_norm": 1.260181584122507, "learning_rate": 2.0385887657505017e-06, "log_odds_chosen": 1.1710937023162842, "log_odds_ratio": -0.4537109434604645, "logits/chosen": -1.1357421875, "logits/rejected": -0.9947265386581421, "logps/chosen": -0.778124988079071, "logps/rejected": -1.6183593273162842, "loss": 1.0854, "nll_loss": 1.0359375476837158, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07781982421875, "rewards/margins": 0.08405761420726776, "rewards/rejected": -0.16191406548023224, "step": 1540 }, { "epoch": 0.20021959568559064, "grad_norm": 1.38588668926837, "learning_rate": 2.032002032003048e-06, "log_odds_chosen": 0.803417980670929, "log_odds_ratio": -0.5362793207168579, "logits/chosen": -1.227148413658142, "logits/rejected": -1.0226562023162842, "logps/chosen": -0.8232421875, "logps/rejected": -1.3849608898162842, "loss": 1.0894, "nll_loss": 1.074804663658142, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.08229980617761612, "rewards/margins": 0.05617370456457138, "rewards/rejected": -0.13845214247703552, "step": 1550 }, { "epoch": 0.20151133501259447, "grad_norm": 1.17909080785775, "learning_rate": 2.025478734167333e-06, "log_odds_chosen": 1.1628906726837158, "log_odds_ratio": -0.4571289122104645, "logits/chosen": -1.067968726158142, "logits/rejected": -0.9234374761581421, "logps/chosen": -0.7769531011581421, "logps/rejected": -1.620703101158142, "loss": 1.1131, "nll_loss": 1.09765625, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07758788764476776, "rewards/margins": 0.08439941704273224, "rewards/rejected": -0.16208496689796448, "step": 1560 }, { "epoch": 0.20280307433959827, "grad_norm": 1.365830710002793, "learning_rate": 2.0190178605002747e-06, "log_odds_chosen": 1.1975586414337158, "log_odds_ratio": -0.44921875, "logits/chosen": -1.120703101158142, "logits/rejected": -0.9580078125, "logps/chosen": -0.7774413824081421, "logps/rejected": -1.6437499523162842, "loss": 1.0909, "nll_loss": 1.01953125, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.0777587890625, "rewards/margins": 0.08661804348230362, "rewards/rejected": -0.16437987983226776, "step": 1570 }, { "epoch": 0.2040948136666021, "grad_norm": 1.2284103885166069, "learning_rate": 2.0126184217065104e-06, "log_odds_chosen": 1.25341796875, "log_odds_ratio": -0.47001951932907104, "logits/chosen": -1.0720703601837158, "logits/rejected": -0.8544921875, "logps/chosen": -0.793261706829071, "logps/rejected": -1.6689453125, "loss": 1.0909, "nll_loss": 1.048437476158142, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07937011867761612, "rewards/margins": 0.08757934719324112, "rewards/rejected": -0.16701659560203552, "step": 1580 }, { "epoch": 0.2053865529936059, "grad_norm": 1.3949109783939957, "learning_rate": 2.0062794503020765e-06, "log_odds_chosen": 1.168554663658142, "log_odds_ratio": -0.43212890625, "logits/chosen": -1.1531250476837158, "logits/rejected": -0.956250011920929, "logps/chosen": -0.792773425579071, "logps/rejected": -1.638671875, "loss": 1.1089, "nll_loss": 1.0662109851837158, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07928466796875, "rewards/margins": 0.08453979343175888, "rewards/rejected": -0.16379395127296448, "step": 1590 }, { "epoch": 0.2066782923206097, "grad_norm": 1.4752303000556217, "learning_rate": 2e-06, "log_odds_chosen": 1.273290991783142, "log_odds_ratio": -0.48344725370407104, "logits/chosen": -1.1076171398162842, "logits/rejected": -0.9541015625, "logps/chosen": -0.7925781011581421, "logps/rejected": -1.7683594226837158, "loss": 1.1097, "nll_loss": 1.155859351158142, "rewards/accuracies": 0.71875, "rewards/chosen": -0.07927246391773224, "rewards/margins": 0.09764709323644638, "rewards/rejected": -0.17685547471046448, "step": 1600 }, { "epoch": 0.20797003164761352, "grad_norm": 1.2875741946501222, "learning_rate": 1.993779145116907e-06, "log_odds_chosen": 1.409765601158142, "log_odds_ratio": -0.41362303495407104, "logits/chosen": -1.0955078601837158, "logits/rejected": -0.8812500238418579, "logps/chosen": -0.748046875, "logps/rejected": -1.787500023841858, "loss": 1.095, "nll_loss": 1.0285155773162842, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07480468600988388, "rewards/margins": 0.10386963188648224, "rewards/rejected": -0.17880859971046448, "step": 1610 }, { "epoch": 0.20926177097461732, "grad_norm": 1.8412910054371145, "learning_rate": 1.987615979999813e-06, "log_odds_chosen": 1.2473633289337158, "log_odds_ratio": -0.48393553495407104, "logits/chosen": -1.2087891101837158, "logits/rejected": -0.9671875238418579, "logps/chosen": -0.8089843988418579, "logps/rejected": -1.7478516101837158, "loss": 1.0864, "nll_loss": 0.991992175579071, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.08092041313648224, "rewards/margins": 0.09385375678539276, "rewards/rejected": -0.17473144829273224, "step": 1620 }, { "epoch": 0.21055351030162114, "grad_norm": 1.3907484022272254, "learning_rate": 1.9815096184722797e-06, "log_odds_chosen": 1.1614258289337158, "log_odds_ratio": -0.4903808534145355, "logits/chosen": -1.165429711341858, "logits/rejected": -1.0031249523162842, "logps/chosen": -0.828125, "logps/rejected": -1.664453148841858, "loss": 1.0795, "nll_loss": 0.991406261920929, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08277587592601776, "rewards/margins": 0.08376464992761612, "rewards/rejected": -0.16650390625, "step": 1630 }, { "epoch": 0.21184524962862494, "grad_norm": 1.558134420817283, "learning_rate": 1.9754591932991793e-06, "log_odds_chosen": 1.151879906654358, "log_odds_ratio": -0.44794923067092896, "logits/chosen": -1.160546898841858, "logits/rejected": -0.9457031488418579, "logps/chosen": -0.7603515386581421, "logps/rejected": -1.6042969226837158, "loss": 1.0688, "nll_loss": 1.0226562023162842, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07601318508386612, "rewards/margins": 0.08431701362133026, "rewards/rejected": -0.16044922173023224, "step": 1640 }, { "epoch": 0.21313698895562874, "grad_norm": 1.2617805869856145, "learning_rate": 1.9694638556693235e-06, "log_odds_chosen": 1.240991234779358, "log_odds_ratio": -0.4515136778354645, "logits/chosen": -1.166015625, "logits/rejected": -0.986523449420929, "logps/chosen": -0.828320324420929, "logps/rejected": -1.7175781726837158, "loss": 1.0827, "nll_loss": 1.0929687023162842, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.08289794623851776, "rewards/margins": 0.08886261284351349, "rewards/rejected": -0.17167969048023224, "step": 1650 }, { "epoch": 0.21442872828263257, "grad_norm": 1.3083194807094314, "learning_rate": 1.963522774695264e-06, "log_odds_chosen": 1.0681641101837158, "log_odds_ratio": -0.4775390625, "logits/chosen": -1.137109398841858, "logits/rejected": -0.9468749761581421, "logps/chosen": -0.827343761920929, "logps/rejected": -1.6203124523162842, "loss": 1.0871, "nll_loss": 1.044921875, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.08265380561351776, "rewards/margins": 0.07925720512866974, "rewards/rejected": -0.16188964247703552, "step": 1660 }, { "epoch": 0.21572046760963637, "grad_norm": 1.2852632749576811, "learning_rate": 1.9576351369295853e-06, "log_odds_chosen": 1.300537109375, "log_odds_ratio": -0.4420410096645355, "logits/chosen": -1.2527344226837158, "logits/rejected": -0.995312511920929, "logps/chosen": -0.8115234375, "logps/rejected": -1.763281226158142, "loss": 1.0617, "nll_loss": 1.0554687976837158, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.08120117336511612, "rewards/margins": 0.09511718899011612, "rewards/rejected": -0.17641600966453552, "step": 1670 }, { "epoch": 0.2170122069366402, "grad_norm": 1.332740172809499, "learning_rate": 1.951800145897066e-06, "log_odds_chosen": 1.334570288658142, "log_odds_ratio": -0.43603515625, "logits/chosen": -1.1876952648162842, "logits/rejected": -0.970898449420929, "logps/chosen": -0.8382812738418579, "logps/rejected": -1.853906273841858, "loss": 1.079, "nll_loss": 1.0261719226837158, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.08389892429113388, "rewards/margins": 0.10160522162914276, "rewards/rejected": -0.18537597358226776, "step": 1680 }, { "epoch": 0.218303946263644, "grad_norm": 1.434736589458896, "learning_rate": 1.9460170216420797e-06, "log_odds_chosen": 1.3171875476837158, "log_odds_ratio": -0.45231932401657104, "logits/chosen": -1.2048828601837158, "logits/rejected": -0.971875011920929, "logps/chosen": -0.76953125, "logps/rejected": -1.763281226158142, "loss": 1.0672, "nll_loss": 1.031640648841858, "rewards/accuracies": 0.75, "rewards/chosen": -0.07694091647863388, "rewards/margins": 0.09941406548023224, "rewards/rejected": -0.17641600966453552, "step": 1690 }, { "epoch": 0.21959568559064782, "grad_norm": 1.3325454514926989, "learning_rate": 1.9402850002906637e-06, "log_odds_chosen": 1.4177734851837158, "log_odds_ratio": -0.38520509004592896, "logits/chosen": -1.2087891101837158, "logits/rejected": -0.9681640863418579, "logps/chosen": -0.7705078125, "logps/rejected": -1.7998046875, "loss": 1.0651, "nll_loss": 1.011328101158142, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07706298679113388, "rewards/margins": 0.10270996391773224, "rewards/rejected": -0.17983397841453552, "step": 1700 }, { "epoch": 0.22088742491765162, "grad_norm": 1.4075507837221597, "learning_rate": 1.9346033336266974e-06, "log_odds_chosen": 1.2162353992462158, "log_odds_ratio": -0.468017578125, "logits/chosen": -1.0966796875, "logits/rejected": -0.903124988079071, "logps/chosen": -0.783398449420929, "logps/rejected": -1.65625, "loss": 1.0673, "nll_loss": 1.023828148841858, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07828368991613388, "rewards/margins": 0.08742675930261612, "rewards/rejected": -0.16567382216453552, "step": 1710 }, { "epoch": 0.22217916424465542, "grad_norm": 1.5811870984542153, "learning_rate": 1.9289712886816486e-06, "log_odds_chosen": 1.0413086414337158, "log_odds_ratio": -0.47832030057907104, "logits/chosen": -1.13671875, "logits/rejected": -0.9564453363418579, "logps/chosen": -0.770703136920929, "logps/rejected": -1.549414038658142, "loss": 1.0528, "nll_loss": 0.9779297113418579, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.07707519829273224, "rewards/margins": 0.07799072563648224, "rewards/rejected": -0.15488281846046448, "step": 1720 }, { "epoch": 0.22347090357165925, "grad_norm": 1.2767552843937628, "learning_rate": 1.92338814733738e-06, "log_odds_chosen": 1.3216552734375, "log_odds_ratio": -0.40937501192092896, "logits/chosen": -1.2951171398162842, "logits/rejected": -1.0041015148162842, "logps/chosen": -0.698437511920929, "logps/rejected": -1.6337890625, "loss": 1.0676, "nll_loss": 0.9791015386581421, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.06987304985523224, "rewards/margins": 0.09343872219324112, "rewards/rejected": -0.16335448622703552, "step": 1730 }, { "epoch": 0.22476264289866305, "grad_norm": 1.703654433886517, "learning_rate": 1.9178532059415367e-06, "log_odds_chosen": 1.2189452648162842, "log_odds_ratio": -0.48491209745407104, "logits/chosen": -1.108007788658142, "logits/rejected": -0.9486328363418579, "logps/chosen": -0.784375011920929, "logps/rejected": -1.6884765625, "loss": 1.0794, "nll_loss": 1.020117163658142, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07846679538488388, "rewards/margins": 0.09031982719898224, "rewards/rejected": -0.16867676377296448, "step": 1740 }, { "epoch": 0.22605438222566687, "grad_norm": 1.3197303152885576, "learning_rate": 1.9123657749350298e-06, "log_odds_chosen": 1.359375, "log_odds_ratio": -0.41845703125, "logits/chosen": -1.1828124523162842, "logits/rejected": -0.95703125, "logps/chosen": -0.707812488079071, "logps/rejected": -1.681640625, "loss": 1.0527, "nll_loss": 0.916210949420929, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07077636569738388, "rewards/margins": 0.09749756008386612, "rewards/rejected": -0.168212890625, "step": 1750 }, { "epoch": 0.22734612155267067, "grad_norm": 1.3752457761798864, "learning_rate": 1.9069251784911844e-06, "log_odds_chosen": 1.460302710533142, "log_odds_ratio": -0.4194580018520355, "logits/chosen": -1.1455078125, "logits/rejected": -0.974609375, "logps/chosen": -0.842968761920929, "logps/rejected": -1.952734351158142, "loss": 1.0929, "nll_loss": 1.1062500476837158, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.084228515625, "rewards/margins": 0.11113281548023224, "rewards/rejected": -0.19521483778953552, "step": 1760 }, { "epoch": 0.22863786087967447, "grad_norm": 1.3357777395021317, "learning_rate": 1.9015307541661132e-06, "log_odds_chosen": 1.176171898841858, "log_odds_ratio": -0.46562498807907104, "logits/chosen": -1.218359351158142, "logits/rejected": -1.0373046398162842, "logps/chosen": -0.7621093988418579, "logps/rejected": -1.5998046398162842, "loss": 1.095, "nll_loss": 1.002539038658142, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07619629055261612, "rewards/margins": 0.08369751274585724, "rewards/rejected": -0.15999755263328552, "step": 1770 }, { "epoch": 0.2299296002066783, "grad_norm": 1.3132989058982572, "learning_rate": 1.8961818525599089e-06, "log_odds_chosen": 1.2180664539337158, "log_odds_ratio": -0.4473632872104645, "logits/chosen": -1.1767578125, "logits/rejected": -0.947460949420929, "logps/chosen": -0.7367187738418579, "logps/rejected": -1.625390648841858, "loss": 1.0728, "nll_loss": 0.9925781488418579, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07366943359375, "rewards/margins": 0.08895263820886612, "rewards/rejected": -0.16269531846046448, "step": 1780 }, { "epoch": 0.2312213395336821, "grad_norm": 1.316861722581661, "learning_rate": 1.890877836988262e-06, "log_odds_chosen": 1.240820288658142, "log_odds_ratio": -0.40068358182907104, "logits/chosen": -1.1417968273162842, "logits/rejected": -0.9369140863418579, "logps/chosen": -0.746289074420929, "logps/rejected": -1.6218750476837158, "loss": 1.0663, "nll_loss": 1.0400390625, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.0745849609375, "rewards/margins": 0.08765868842601776, "rewards/rejected": -0.16218261420726776, "step": 1790 }, { "epoch": 0.23251307886068592, "grad_norm": 1.7931092708976446, "learning_rate": 1.8856180831641269e-06, "log_odds_chosen": 1.3117187023162842, "log_odds_ratio": -0.4071289002895355, "logits/chosen": -1.225000023841858, "logits/rejected": -0.9652343988418579, "logps/chosen": -0.7142578363418579, "logps/rejected": -1.6662108898162842, "loss": 1.0676, "nll_loss": 0.956250011920929, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07144775241613388, "rewards/margins": 0.0953521728515625, "rewards/rejected": -0.1666259765625, "step": 1800 }, { "epoch": 0.23380481818768972, "grad_norm": 1.3106318056930855, "learning_rate": 1.8804019788890737e-06, "log_odds_chosen": 1.5377929210662842, "log_odds_ratio": -0.3639160096645355, "logits/chosen": -1.1648437976837158, "logits/rejected": -0.8792968988418579, "logps/chosen": -0.720898449420929, "logps/rejected": -1.8449218273162842, "loss": 1.0564, "nll_loss": 1.0869140625, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.07213135063648224, "rewards/margins": 0.11234740912914276, "rewards/rejected": -0.18452148139476776, "step": 1810 }, { "epoch": 0.23509655751469352, "grad_norm": 1.4595181023876223, "learning_rate": 1.8752289237539816e-06, "log_odds_chosen": 1.2355468273162842, "log_odds_ratio": -0.45244139432907104, "logits/chosen": -1.2228515148162842, "logits/rejected": -1.011132836341858, "logps/chosen": -0.7105468511581421, "logps/rejected": -1.6240234375, "loss": 1.0574, "nll_loss": 0.9613281488418579, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07095947116613388, "rewards/margins": 0.09142456203699112, "rewards/rejected": -0.16242675483226776, "step": 1820 }, { "epoch": 0.23638829684169735, "grad_norm": 1.3966000265636949, "learning_rate": 1.8700983288487376e-06, "log_odds_chosen": 1.0509765148162842, "log_odds_ratio": -0.4830566346645355, "logits/chosen": -1.1072266101837158, "logits/rejected": -0.9283202886581421, "logps/chosen": -0.8089843988418579, "logps/rejected": -1.568750023841858, "loss": 1.0709, "nll_loss": 1.095117211341858, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.08085937798023224, "rewards/margins": 0.07611083984375, "rewards/rejected": -0.15700682997703552, "step": 1830 }, { "epoch": 0.23768003616870115, "grad_norm": 1.3894198159912972, "learning_rate": 1.8650096164806275e-06, "log_odds_chosen": 1.0227539539337158, "log_odds_ratio": -0.50341796875, "logits/chosen": -1.0837891101837158, "logits/rejected": -0.9574218988418579, "logps/chosen": -0.83203125, "logps/rejected": -1.5613281726837158, "loss": 1.0795, "nll_loss": 1.0791015625, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.08322753757238388, "rewards/margins": 0.07283325493335724, "rewards/rejected": -0.1561279296875, "step": 1840 }, { "epoch": 0.23897177549570497, "grad_norm": 1.4364656975984647, "learning_rate": 1.8599622199011084e-06, "log_odds_chosen": 1.266821265220642, "log_odds_ratio": -0.4259277284145355, "logits/chosen": -1.181249976158142, "logits/rejected": -0.9615234136581421, "logps/chosen": -0.7847656011581421, "logps/rejected": -1.7003905773162842, "loss": 1.0789, "nll_loss": 1.0439453125, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.0784912109375, "rewards/margins": 0.09159698337316513, "rewards/rejected": -0.17014160752296448, "step": 1850 }, { "epoch": 0.24026351482270877, "grad_norm": 1.6303492430495117, "learning_rate": 1.854955583040673e-06, "log_odds_chosen": 1.181738257408142, "log_odds_ratio": -0.44550782442092896, "logits/chosen": -1.158789038658142, "logits/rejected": -0.9644531011581421, "logps/chosen": -0.7568359375, "logps/rejected": -1.599023461341858, "loss": 1.0719, "nll_loss": 1.017578125, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07564697414636612, "rewards/margins": 0.08420410007238388, "rewards/rejected": -0.15993651747703552, "step": 1860 }, { "epoch": 0.2415552541497126, "grad_norm": 1.4370695114557293, "learning_rate": 1.849989160251521e-06, "log_odds_chosen": 0.994921863079071, "log_odds_ratio": -0.484375, "logits/chosen": -1.1892578601837158, "logits/rejected": -0.957812488079071, "logps/chosen": -0.8203125, "logps/rejected": -1.5419921875, "loss": 1.0772, "nll_loss": 1.005273461341858, "rewards/accuracies": 0.6937500238418579, "rewards/chosen": -0.08205566555261612, "rewards/margins": 0.07221679389476776, "rewards/rejected": -0.15427246689796448, "step": 1870 }, { "epoch": 0.2428469934767164, "grad_norm": 1.2712485063950865, "learning_rate": 1.8450624160577701e-06, "log_odds_chosen": 1.143396019935608, "log_odds_ratio": -0.4758056700229645, "logits/chosen": -1.118749976158142, "logits/rejected": -0.9794921875, "logps/chosen": -0.7958984375, "logps/rejected": -1.635156273841858, "loss": 1.074, "nll_loss": 1.043359398841858, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07965087890625, "rewards/margins": 0.083892822265625, "rewards/rejected": -0.16367188096046448, "step": 1880 }, { "epoch": 0.2441387328037202, "grad_norm": 1.5110079177651148, "learning_rate": 1.8401748249129445e-06, "log_odds_chosen": 1.0840332508087158, "log_odds_ratio": -0.4921875, "logits/chosen": -1.1482422351837158, "logits/rejected": -0.9322265386581421, "logps/chosen": -0.7978515625, "logps/rejected": -1.603515625, "loss": 1.0865, "nll_loss": 1.116601586341858, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.079833984375, "rewards/margins": 0.08058013767004013, "rewards/rejected": -0.16044922173023224, "step": 1890 }, { "epoch": 0.24543047213072403, "grad_norm": 1.2946941022031773, "learning_rate": 1.8353258709644938e-06, "log_odds_chosen": 1.1730468273162842, "log_odds_ratio": -0.4471191465854645, "logits/chosen": -1.217382788658142, "logits/rejected": -0.9847656488418579, "logps/chosen": -0.7236328125, "logps/rejected": -1.5470702648162842, "loss": 1.0934, "nll_loss": 0.953320324420929, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07232666015625, "rewards/margins": 0.08240966498851776, "rewards/rejected": -0.15468749403953552, "step": 1900 }, { "epoch": 0.24672221145772782, "grad_norm": 1.3602102605280648, "learning_rate": 1.830515047825102e-06, "log_odds_chosen": 1.148461937904358, "log_odds_ratio": -0.4573730528354645, "logits/chosen": -1.116601586341858, "logits/rejected": -0.982421875, "logps/chosen": -0.744140625, "logps/rejected": -1.5080077648162842, "loss": 1.0933, "nll_loss": 1.037500023841858, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.0743408203125, "rewards/margins": 0.07627563178539276, "rewards/rejected": -0.15083007514476776, "step": 1910 }, { "epoch": 0.24801395078473165, "grad_norm": 1.331413905721886, "learning_rate": 1.8257418583505536e-06, "log_odds_chosen": 1.2104003429412842, "log_odds_ratio": -0.45576173067092896, "logits/chosen": -1.1257812976837158, "logits/rejected": -0.9183593988418579, "logps/chosen": -0.74267578125, "logps/rejected": -1.592382788658142, "loss": 1.0579, "nll_loss": 1.063867211341858, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07421875, "rewards/margins": 0.08487548679113388, "rewards/rejected": -0.15922851860523224, "step": 1920 }, { "epoch": 0.24930569011173545, "grad_norm": 1.2763876400651855, "learning_rate": 1.8210058144239416e-06, "log_odds_chosen": 1.206640601158142, "log_odds_ratio": -0.47124022245407104, "logits/chosen": -1.147070288658142, "logits/rejected": -0.9585937261581421, "logps/chosen": -0.7783203125, "logps/rejected": -1.694726586341858, "loss": 1.0572, "nll_loss": 1.011132836341858, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.07786865532398224, "rewards/margins": 0.09166260063648224, "rewards/rejected": -0.16943359375, "step": 1930 }, { "epoch": 0.25059742943873925, "grad_norm": 1.5617480677474052, "learning_rate": 1.816306436745999e-06, "log_odds_chosen": 1.2263672351837158, "log_odds_ratio": -0.49946290254592896, "logits/chosen": -1.127539038658142, "logits/rejected": -0.9693359136581421, "logps/chosen": -0.8187500238418579, "logps/rejected": -1.736718773841858, "loss": 1.1076, "nll_loss": 1.0691406726837158, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.08187256008386612, "rewards/margins": 0.09178467094898224, "rewards/rejected": -0.173583984375, "step": 1940 }, { "epoch": 0.2518891687657431, "grad_norm": 1.2825733313227454, "learning_rate": 1.8116432546313529e-06, "log_odds_chosen": 1.30859375, "log_odds_ratio": -0.4261230528354645, "logits/chosen": -1.137304663658142, "logits/rejected": -0.9576171636581421, "logps/chosen": -0.741015613079071, "logps/rejected": -1.6667969226837158, "loss": 1.0635, "nll_loss": 0.9488281011581421, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.0740966796875, "rewards/margins": 0.09265746921300888, "rewards/rejected": -0.16665038466453552, "step": 1950 }, { "epoch": 0.2531809080927469, "grad_norm": 1.341096409932551, "learning_rate": 1.8070158058105026e-06, "log_odds_chosen": 1.140344262123108, "log_odds_ratio": -0.476806640625, "logits/chosen": -1.109765648841858, "logits/rejected": -0.9212890863418579, "logps/chosen": -0.8140624761581421, "logps/rejected": -1.639062523841858, "loss": 1.0966, "nll_loss": 1.0810546875, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.0814208984375, "rewards/margins": 0.08255767822265625, "rewards/rejected": -0.16398926079273224, "step": 1960 }, { "epoch": 0.2544726474197507, "grad_norm": 1.3760458560050721, "learning_rate": 1.8024236362373315e-06, "log_odds_chosen": 1.361883521080017, "log_odds_ratio": -0.42573243379592896, "logits/chosen": -1.138671875, "logits/rejected": -0.8843749761581421, "logps/chosen": -0.8173828125, "logps/rejected": -1.817968726158142, "loss": 1.0426, "nll_loss": 1.0187499523162842, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.08168945461511612, "rewards/margins": 0.10009308159351349, "rewards/rejected": -0.18183593451976776, "step": 1970 }, { "epoch": 0.2557643867467545, "grad_norm": 1.9365934338647697, "learning_rate": 1.7978662999019787e-06, "log_odds_chosen": 1.171411156654358, "log_odds_ratio": -0.4984374940395355, "logits/chosen": -1.1443359851837158, "logits/rejected": -0.9878906011581421, "logps/chosen": -0.839062511920929, "logps/rejected": -1.694921851158142, "loss": 1.0862, "nll_loss": 1.016015648841858, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.08388672024011612, "rewards/margins": 0.08565368503332138, "rewards/rejected": -0.16950683295726776, "step": 1980 }, { "epoch": 0.25705612607375833, "grad_norm": 1.5127076094213072, "learning_rate": 1.793343358648881e-06, "log_odds_chosen": 1.217504858970642, "log_odds_ratio": -0.44682615995407104, "logits/chosen": -1.149023413658142, "logits/rejected": -0.9585937261581421, "logps/chosen": -0.7626953125, "logps/rejected": -1.6318359375, "loss": 1.029, "nll_loss": 1.012109398841858, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07624511420726776, "rewards/margins": 0.08691100776195526, "rewards/rejected": -0.16323241591453552, "step": 1990 }, { "epoch": 0.2583478654007621, "grad_norm": 1.2773700243690813, "learning_rate": 1.7888543819998317e-06, "log_odds_chosen": 1.44482421875, "log_odds_ratio": -0.38325196504592896, "logits/chosen": -1.1619141101837158, "logits/rejected": -0.9017578363418579, "logps/chosen": -0.7593749761581421, "logps/rejected": -1.831445336341858, "loss": 1.043, "nll_loss": 0.937304675579071, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07591553032398224, "rewards/margins": 0.10738525539636612, "rewards/rejected": -0.18320313096046448, "step": 2000 }, { "epoch": 0.2596396047277659, "grad_norm": 1.3164715223864245, "learning_rate": 1.7843989469818819e-06, "log_odds_chosen": 1.339257836341858, "log_odds_ratio": -0.42207032442092896, "logits/chosen": -1.0916016101837158, "logits/rejected": -0.920703113079071, "logps/chosen": -0.791210949420929, "logps/rejected": -1.7917969226837158, "loss": 1.0776, "nll_loss": 1.115234375, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.07915039360523224, "rewards/margins": 0.10001220554113388, "rewards/rejected": -0.17917481064796448, "step": 2010 }, { "epoch": 0.26093134405476975, "grad_norm": 1.3922193226398354, "learning_rate": 1.779976637959939e-06, "log_odds_chosen": 1.28173828125, "log_odds_ratio": -0.43896484375, "logits/chosen": -1.14453125, "logits/rejected": -0.9814453125, "logps/chosen": -0.774121105670929, "logps/rejected": -1.723046898841858, "loss": 1.079, "nll_loss": 1.0144531726837158, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07741699367761612, "rewards/margins": 0.09483642876148224, "rewards/rejected": -0.17231445014476776, "step": 2020 }, { "epoch": 0.2622230833817736, "grad_norm": 1.5867735946732342, "learning_rate": 1.7755870464739012e-06, "log_odds_chosen": 1.1649901866912842, "log_odds_ratio": -0.42607420682907104, "logits/chosen": -1.136328101158142, "logits/rejected": -0.965624988079071, "logps/chosen": -0.7455078363418579, "logps/rejected": -1.5554687976837158, "loss": 1.0473, "nll_loss": 1.048828125, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07449951022863388, "rewards/margins": 0.08096160739660263, "rewards/rejected": -0.15556640923023224, "step": 2030 }, { "epoch": 0.26351482270877735, "grad_norm": 1.4962573424371364, "learning_rate": 1.7712297710801907e-06, "log_odds_chosen": 1.169531226158142, "log_odds_ratio": -0.4840331971645355, "logits/chosen": -1.218359351158142, "logits/rejected": -1.0125000476837158, "logps/chosen": -0.7705078125, "logps/rejected": -1.623437523841858, "loss": 1.0736, "nll_loss": 0.9886718988418579, "rewards/accuracies": 0.71875, "rewards/chosen": -0.07701416313648224, "rewards/margins": 0.08531494438648224, "rewards/rejected": -0.162353515625, "step": 2040 }, { "epoch": 0.2648065620357812, "grad_norm": 1.5367137020866226, "learning_rate": 1.7669044171975444e-06, "log_odds_chosen": 1.3913085460662842, "log_odds_ratio": -0.40239256620407104, "logits/chosen": -1.234765648841858, "logits/rejected": -1.016992211341858, "logps/chosen": -0.766894519329071, "logps/rejected": -1.778906226158142, "loss": 1.0515, "nll_loss": 0.9380859136581421, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07664795219898224, "rewards/margins": 0.10111083835363388, "rewards/rejected": -0.17788085341453552, "step": 2050 }, { "epoch": 0.266098301362785, "grad_norm": 1.4442294155730115, "learning_rate": 1.7626105969569268e-06, "log_odds_chosen": 1.34033203125, "log_odds_ratio": -0.4219726622104645, "logits/chosen": -1.0908203125, "logits/rejected": -0.9658203125, "logps/chosen": -0.7353515625, "logps/rejected": -1.712499976158142, "loss": 1.0659, "nll_loss": 1.110937476158142, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.07352294772863388, "rewards/margins": 0.09757690131664276, "rewards/rejected": -0.17121581733226776, "step": 2060 }, { "epoch": 0.2673900406897888, "grad_norm": 1.7331386731707017, "learning_rate": 1.758347929055432e-06, "log_odds_chosen": 1.366601586341858, "log_odds_ratio": -0.41008299589157104, "logits/chosen": -1.1552734375, "logits/rejected": -0.961718738079071, "logps/chosen": -0.7796875238418579, "logps/rejected": -1.7746093273162842, "loss": 1.0332, "nll_loss": 1.0185546875, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07795409858226776, "rewards/margins": 0.09932861477136612, "rewards/rejected": -0.17719726264476776, "step": 2070 }, { "epoch": 0.2686817800167926, "grad_norm": 1.5711426411889913, "learning_rate": 1.7541160386140582e-06, "log_odds_chosen": 1.40380859375, "log_odds_ratio": -0.36376953125, "logits/chosen": -1.2099609375, "logits/rejected": -0.9908202886581421, "logps/chosen": -0.707226574420929, "logps/rejected": -1.6857421398162842, "loss": 1.0501, "nll_loss": 1.0068359375, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.07076416164636612, "rewards/margins": 0.09784545749425888, "rewards/rejected": -0.16860350966453552, "step": 2080 }, { "epoch": 0.26997351934379643, "grad_norm": 1.37906452701969, "learning_rate": 1.7499145570392284e-06, "log_odds_chosen": 1.233007788658142, "log_odds_ratio": -0.427001953125, "logits/chosen": -1.1882812976837158, "logits/rejected": -0.9697265625, "logps/chosen": -0.701953113079071, "logps/rejected": -1.5773437023162842, "loss": 1.0535, "nll_loss": 1.002343773841858, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07008056342601776, "rewards/margins": 0.08765258640050888, "rewards/rejected": -0.15778808295726776, "step": 2090 }, { "epoch": 0.27126525867080026, "grad_norm": 1.4674573972993576, "learning_rate": 1.745743121887939e-06, "log_odds_chosen": 1.5597655773162842, "log_odds_ratio": -0.3653808534145355, "logits/chosen": -1.19921875, "logits/rejected": -0.957226574420929, "logps/chosen": -0.779101550579071, "logps/rejected": -1.916406273841858, "loss": 1.0486, "nll_loss": 0.984570324420929, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07790527492761612, "rewards/margins": 0.11383056640625, "rewards/rejected": -0.19157715141773224, "step": 2100 }, { "epoch": 0.27255699799780403, "grad_norm": 1.4652223187305242, "learning_rate": 1.7416013767364324e-06, "log_odds_chosen": 1.378881812095642, "log_odds_ratio": -0.43085938692092896, "logits/chosen": -1.1853516101837158, "logits/rejected": -1.0126953125, "logps/chosen": -0.8238281011581421, "logps/rejected": -1.8527343273162842, "loss": 1.0598, "nll_loss": 1.058007836341858, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.0823974609375, "rewards/margins": 0.10298462212085724, "rewards/rejected": -0.18537597358226776, "step": 2110 }, { "epoch": 0.27384873732480786, "grad_norm": 1.7711240330762235, "learning_rate": 1.7374889710522776e-06, "log_odds_chosen": 1.299902319908142, "log_odds_ratio": -0.4232421815395355, "logits/chosen": -1.157812476158142, "logits/rejected": -0.964062511920929, "logps/chosen": -0.732421875, "logps/rejected": -1.6749999523162842, "loss": 1.0622, "nll_loss": 1.0480468273162842, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07327880710363388, "rewards/margins": 0.09409485012292862, "rewards/rejected": -0.16745606064796448, "step": 2120 }, { "epoch": 0.2751404766518117, "grad_norm": 1.3030813369326975, "learning_rate": 1.7334055600697579e-06, "log_odds_chosen": 1.449316382408142, "log_odds_ratio": -0.40205079317092896, "logits/chosen": -1.219140648841858, "logits/rejected": -0.9908202886581421, "logps/chosen": -0.729687511920929, "logps/rejected": -1.809960961341858, "loss": 1.0731, "nll_loss": 1.0060546398162842, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07297363132238388, "rewards/margins": 0.10809326171875, "rewards/rejected": -0.18115234375, "step": 2130 }, { "epoch": 0.27643221597881545, "grad_norm": 1.464640572436433, "learning_rate": 1.7293508046684678e-06, "log_odds_chosen": 1.437353491783142, "log_odds_ratio": -0.43017578125, "logits/chosen": -1.209375023841858, "logits/rejected": -1.0234375, "logps/chosen": -0.751660168170929, "logps/rejected": -1.811914086341858, "loss": 1.0532, "nll_loss": 1.046875, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07513427734375, "rewards/margins": 0.106201171875, "rewards/rejected": -0.18129882216453552, "step": 2140 }, { "epoch": 0.2777239553058193, "grad_norm": 1.4928033483255845, "learning_rate": 1.7253243712550145e-06, "log_odds_chosen": 1.5045897960662842, "log_odds_ratio": -0.3724609315395355, "logits/chosen": -1.076171875, "logits/rejected": -0.906054675579071, "logps/chosen": -0.720019519329071, "logps/rejected": -1.7900390625, "loss": 1.0298, "nll_loss": 1.0207030773162842, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07199706882238388, "rewards/margins": 0.10687255859375, "rewards/rejected": -0.17897948622703552, "step": 2150 }, { "epoch": 0.2790156946328231, "grad_norm": 1.5632429685519984, "learning_rate": 1.7213259316477406e-06, "log_odds_chosen": 1.410058617591858, "log_odds_ratio": -0.4019531309604645, "logits/chosen": -1.174414038658142, "logits/rejected": -0.977343738079071, "logps/chosen": -0.732226550579071, "logps/rejected": -1.7531249523162842, "loss": 1.0438, "nll_loss": 1.083398461341858, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07319335639476776, "rewards/margins": 0.10199890285730362, "rewards/rejected": -0.17524413764476776, "step": 2160 }, { "epoch": 0.2803074339598269, "grad_norm": 1.4310232321792595, "learning_rate": 1.7173551629643674e-06, "log_odds_chosen": 1.403564453125, "log_odds_ratio": -0.38969725370407104, "logits/chosen": -1.287109375, "logits/rejected": -1.0421874523162842, "logps/chosen": -0.7118164300918579, "logps/rejected": -1.684179663658142, "loss": 1.0517, "nll_loss": 1.043554663658142, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07115478813648224, "rewards/margins": 0.09721069037914276, "rewards/rejected": -0.16848143935203552, "step": 2170 }, { "epoch": 0.2815991732868307, "grad_norm": 1.3435552892158844, "learning_rate": 1.713411747512477e-06, "log_odds_chosen": 1.390039086341858, "log_odds_ratio": -0.413818359375, "logits/chosen": -1.232421875, "logits/rejected": -1.023828148841858, "logps/chosen": -0.720410168170929, "logps/rejected": -1.706640601158142, "loss": 1.0531, "nll_loss": 0.954296886920929, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07198486477136612, "rewards/margins": 0.09860839694738388, "rewards/rejected": -0.17070312798023224, "step": 2180 }, { "epoch": 0.28289091261383453, "grad_norm": 1.3543097172089642, "learning_rate": 1.709495372682753e-06, "log_odds_chosen": 1.364648461341858, "log_odds_ratio": -0.41474610567092896, "logits/chosen": -1.180273413658142, "logits/rejected": -0.9876953363418579, "logps/chosen": -0.7391601800918579, "logps/rejected": -1.73046875, "loss": 1.0347, "nll_loss": 0.991406261920929, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07390137016773224, "rewards/margins": 0.099273681640625, "rewards/rejected": -0.17304687201976776, "step": 2190 }, { "epoch": 0.28418265194083836, "grad_norm": 1.450327152039063, "learning_rate": 1.7056057308448832e-06, "log_odds_chosen": 1.3577148914337158, "log_odds_ratio": -0.4122558534145355, "logits/chosen": -1.173437476158142, "logits/rejected": -0.9654296636581421, "logps/chosen": -0.7728515863418579, "logps/rejected": -1.755859375, "loss": 1.0583, "nll_loss": 1.1042969226837158, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07724609225988388, "rewards/margins": 0.09824218600988388, "rewards/rejected": -0.17539063096046448, "step": 2200 }, { "epoch": 0.28547439126784213, "grad_norm": 1.6354500208184082, "learning_rate": 1.701742519246068e-06, "log_odds_chosen": 1.3793456554412842, "log_odds_ratio": -0.40581053495407104, "logits/chosen": -1.097265601158142, "logits/rejected": -0.9345703125, "logps/chosen": -0.736328125, "logps/rejected": -1.742773413658142, "loss": 1.0481, "nll_loss": 1.067968726158142, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.0736083984375, "rewards/margins": 0.10062255710363388, "rewards/rejected": -0.17421874403953552, "step": 2210 }, { "epoch": 0.28676613059484596, "grad_norm": 1.398866809923403, "learning_rate": 1.6979054399120355e-06, "log_odds_chosen": 1.503320336341858, "log_odds_ratio": -0.4133056700229645, "logits/chosen": -1.166406273841858, "logits/rejected": -0.9244140386581421, "logps/chosen": -0.7568359375, "logps/rejected": -1.8800780773162842, "loss": 1.0551, "nll_loss": 1.0281250476837158, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07568359375, "rewards/margins": 0.11248626559972763, "rewards/rejected": -0.18818359076976776, "step": 2220 }, { "epoch": 0.2880578699218498, "grad_norm": 3.253046351692678, "learning_rate": 1.6940941995505069e-06, "log_odds_chosen": 1.4011719226837158, "log_odds_ratio": -0.40546876192092896, "logits/chosen": -1.1457030773162842, "logits/rejected": -0.936718761920929, "logps/chosen": -0.7574218511581421, "logps/rejected": -1.775781273841858, "loss": 1.0325, "nll_loss": 1.094335913658142, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07568359375, "rewards/margins": 0.10195312649011612, "rewards/rejected": -0.17766113579273224, "step": 2230 }, { "epoch": 0.28934960924885356, "grad_norm": 1.3927117003877405, "learning_rate": 1.6903085094570331e-06, "log_odds_chosen": 1.321923851966858, "log_odds_ratio": -0.4161621034145355, "logits/chosen": -1.1980469226837158, "logits/rejected": -1.0119140148162842, "logps/chosen": -0.75537109375, "logps/rejected": -1.731835961341858, "loss": 1.0522, "nll_loss": 1.0460937023162842, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07557372748851776, "rewards/margins": 0.09777526557445526, "rewards/rejected": -0.17336425185203552, "step": 2240 }, { "epoch": 0.2906413485758574, "grad_norm": 1.5831060295374126, "learning_rate": 1.6865480854231356e-06, "log_odds_chosen": 1.4000976085662842, "log_odds_ratio": -0.41240233182907104, "logits/chosen": -1.188085913658142, "logits/rejected": -0.983203113079071, "logps/chosen": -0.786914050579071, "logps/rejected": -1.790624976158142, "loss": 1.0816, "nll_loss": 1.0236327648162842, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07871093600988388, "rewards/margins": 0.10028076171875, "rewards/rejected": -0.178955078125, "step": 2250 }, { "epoch": 0.2919330879028612, "grad_norm": 1.663941379685356, "learning_rate": 1.682812647646685e-06, "log_odds_chosen": 1.664648413658142, "log_odds_ratio": -0.34648436307907104, "logits/chosen": -1.209570288658142, "logits/rejected": -0.9781249761581421, "logps/chosen": -0.6900390386581421, "logps/rejected": -1.9246094226837158, "loss": 1.028, "nll_loss": 0.960156261920929, "rewards/accuracies": 0.8125, "rewards/chosen": -0.06901855766773224, "rewards/margins": 0.12341918796300888, "rewards/rejected": -0.19233398139476776, "step": 2260 }, { "epoch": 0.29322482722986504, "grad_norm": 1.4352924893648698, "learning_rate": 1.6791019206444541e-06, "log_odds_chosen": 1.498925805091858, "log_odds_ratio": -0.45512694120407104, "logits/chosen": -1.1960937976837158, "logits/rejected": -0.9359375238418579, "logps/chosen": -0.775195300579071, "logps/rejected": -1.912500023841858, "loss": 1.0363, "nll_loss": 1.000585913658142, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.0775146484375, "rewards/margins": 0.11378173530101776, "rewards/rejected": -0.19123534858226776, "step": 2270 }, { "epoch": 0.2945165665568688, "grad_norm": 1.4049718397651765, "learning_rate": 1.675415633166782e-06, "log_odds_chosen": 1.373925805091858, "log_odds_ratio": -0.4488525390625, "logits/chosen": -1.2433593273162842, "logits/rejected": -1.0574219226837158, "logps/chosen": -0.7152343988418579, "logps/rejected": -1.710546851158142, "loss": 1.0473, "nll_loss": 0.938671886920929, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.07159423828125, "rewards/margins": 0.0995330810546875, "rewards/rejected": -0.17106933891773224, "step": 2280 }, { "epoch": 0.29580830588387264, "grad_norm": 1.430606464052193, "learning_rate": 1.6717535181142914e-06, "log_odds_chosen": 1.393408179283142, "log_odds_ratio": -0.4036621153354645, "logits/chosen": -1.149023413658142, "logits/rejected": -0.957226574420929, "logps/chosen": -0.7818359136581421, "logps/rejected": -1.805078148841858, "loss": 1.0498, "nll_loss": 1.043554663658142, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07816161960363388, "rewards/margins": 0.10239867866039276, "rewards/rejected": -0.18049316108226776, "step": 2290 }, { "epoch": 0.29710004521087646, "grad_norm": 1.464839047786352, "learning_rate": 1.668115312456598e-06, "log_odds_chosen": 1.475976586341858, "log_odds_ratio": -0.36674803495407104, "logits/chosen": -1.299414038658142, "logits/rejected": -0.9701172113418579, "logps/chosen": -0.7010742425918579, "logps/rejected": -1.742578148841858, "loss": 1.0238, "nll_loss": 0.96484375, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07010497897863388, "rewards/margins": 0.10404052585363388, "rewards/rejected": -0.17421874403953552, "step": 2300 }, { "epoch": 0.29839178453788023, "grad_norm": 1.383961073373241, "learning_rate": 1.6645007571529578e-06, "log_odds_chosen": 1.392822265625, "log_odds_ratio": -0.4227050840854645, "logits/chosen": -1.1535155773162842, "logits/rejected": -0.978320300579071, "logps/chosen": -0.816210925579071, "logps/rejected": -1.820703148841858, "loss": 1.0509, "nll_loss": 1.028906226158142, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.08172607421875, "rewards/margins": 0.10060425102710724, "rewards/rejected": -0.18220214545726776, "step": 2310 }, { "epoch": 0.29968352386488406, "grad_norm": 1.4690858074866915, "learning_rate": 1.6609095970747992e-06, "log_odds_chosen": 1.2936522960662842, "log_odds_ratio": -0.40742188692092896, "logits/chosen": -1.091210961341858, "logits/rejected": -0.9072265625, "logps/chosen": -0.720898449420929, "logps/rejected": -1.6134765148162842, "loss": 1.0573, "nll_loss": 0.9898437261581421, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07207031548023224, "rewards/margins": 0.08919677883386612, "rewards/rejected": -0.16118164360523224, "step": 2320 }, { "epoch": 0.3009752631918879, "grad_norm": 1.4149358445174556, "learning_rate": 1.6573415809300833e-06, "log_odds_chosen": 1.281835913658142, "log_odds_ratio": -0.41411131620407104, "logits/chosen": -1.1648437976837158, "logits/rejected": -1.005468726158142, "logps/chosen": -0.733593761920929, "logps/rejected": -1.634374976158142, "loss": 1.0494, "nll_loss": 1.0197265148162842, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07342529296875, "rewards/margins": 0.08999023586511612, "rewards/rejected": -0.16340331733226776, "step": 2330 }, { "epoch": 0.3022670025188917, "grad_norm": 1.3938562110076298, "learning_rate": 1.6537964611894462e-06, "log_odds_chosen": 1.2960937023162842, "log_odds_ratio": -0.4034667909145355, "logits/chosen": -1.236914038658142, "logits/rejected": -1.028710961341858, "logps/chosen": -0.771679699420929, "logps/rejected": -1.6945312023162842, "loss": 1.0385, "nll_loss": 0.9970703125, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07716064155101776, "rewards/margins": 0.09230957180261612, "rewards/rejected": -0.16938476264476776, "step": 2340 }, { "epoch": 0.3035587418458955, "grad_norm": 1.6894515563160155, "learning_rate": 1.6502739940140692e-06, "log_odds_chosen": 1.2419922351837158, "log_odds_ratio": -0.40234375, "logits/chosen": -1.1535155773162842, "logits/rejected": -0.986132800579071, "logps/chosen": -0.6810547113418579, "logps/rejected": -1.532812476158142, "loss": 1.064, "nll_loss": 1.0050780773162842, "rewards/accuracies": 0.8125, "rewards/chosen": -0.06813964992761612, "rewards/margins": 0.08524779975414276, "rewards/rejected": -0.15327148139476776, "step": 2350 }, { "epoch": 0.3048504811728993, "grad_norm": 1.4917376954340076, "learning_rate": 1.6467739391852364e-06, "log_odds_chosen": 1.118310570716858, "log_odds_ratio": -0.4642089903354645, "logits/chosen": -1.198632836341858, "logits/rejected": -1.002539038658142, "logps/chosen": -0.7500976324081421, "logps/rejected": -1.544531226158142, "loss": 1.0377, "nll_loss": 0.988476574420929, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.074951171875, "rewards/margins": 0.07948608696460724, "rewards/rejected": -0.15444335341453552, "step": 2360 }, { "epoch": 0.30614222049990314, "grad_norm": 1.9800899582075846, "learning_rate": 1.6432960600355221e-06, "log_odds_chosen": 1.436914086341858, "log_odds_ratio": -0.41191405057907104, "logits/chosen": -1.142968773841858, "logits/rejected": -0.9443359375, "logps/chosen": -0.8306640386581421, "logps/rejected": -1.9162108898162842, "loss": 1.0382, "nll_loss": 1.0291016101837158, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.08303222805261612, "rewards/margins": 0.10868225246667862, "rewards/rejected": -0.19167479872703552, "step": 2370 }, { "epoch": 0.3074339598269069, "grad_norm": 1.343456393550254, "learning_rate": 1.6398401233815756e-06, "log_odds_chosen": 1.602441430091858, "log_odds_ratio": -0.36518555879592896, "logits/chosen": -1.311132788658142, "logits/rejected": -0.9898437261581421, "logps/chosen": -0.764453113079071, "logps/rejected": -1.962890625, "loss": 1.0407, "nll_loss": 0.953125, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07648925483226776, "rewards/margins": 0.11967773735523224, "rewards/rejected": -0.19626465439796448, "step": 2380 }, { "epoch": 0.30872569915391074, "grad_norm": 1.4840370862815913, "learning_rate": 1.6364058994584524e-06, "log_odds_chosen": 1.3615233898162842, "log_odds_ratio": -0.4132324159145355, "logits/chosen": -1.1716797351837158, "logits/rejected": -0.9453125, "logps/chosen": -0.7710937261581421, "logps/rejected": -1.804296851158142, "loss": 1.0514, "nll_loss": 1.094140648841858, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07709960639476776, "rewards/margins": 0.10357666015625, "rewards/rejected": -0.1805419921875, "step": 2390 }, { "epoch": 0.31001743848091456, "grad_norm": 1.646153300373328, "learning_rate": 1.6329931618554522e-06, "log_odds_chosen": 1.5543944835662842, "log_odds_ratio": -0.4095703065395355, "logits/chosen": -1.183203101158142, "logits/rejected": -1.0109374523162842, "logps/chosen": -0.7749999761581421, "logps/rejected": -1.941015601158142, "loss": 1.094, "nll_loss": 1.0146484375, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07749023288488388, "rewards/margins": 0.1166839599609375, "rewards/rejected": -0.19414062798023224, "step": 2400 }, { "epoch": 0.31130917780791834, "grad_norm": 1.50876978762928, "learning_rate": 1.6296016874534209e-06, "log_odds_chosen": 1.3102538585662842, "log_odds_ratio": -0.43989259004592896, "logits/chosen": -1.162109375, "logits/rejected": -0.9833984375, "logps/chosen": -0.779492199420929, "logps/rejected": -1.750390648841858, "loss": 1.0635, "nll_loss": 1.0673828125, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07797851413488388, "rewards/margins": 0.09709472954273224, "rewards/rejected": -0.175048828125, "step": 2410 }, { "epoch": 0.31260091713492216, "grad_norm": 1.4433249867946605, "learning_rate": 1.6262312563634835e-06, "log_odds_chosen": 1.472070336341858, "log_odds_ratio": -0.38288575410842896, "logits/chosen": -1.1824219226837158, "logits/rejected": -0.98046875, "logps/chosen": -0.7474609613418579, "logps/rejected": -1.8054687976837158, "loss": 1.0462, "nll_loss": 1.0339844226837158, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07474365085363388, "rewards/margins": 0.10581054538488388, "rewards/rejected": -0.18051758408546448, "step": 2420 }, { "epoch": 0.313892656461926, "grad_norm": 1.4611690322509405, "learning_rate": 1.6228816518671587e-06, "log_odds_chosen": 1.360742211341858, "log_odds_ratio": -0.42255860567092896, "logits/chosen": -1.186914086341858, "logits/rejected": -0.9955078363418579, "logps/chosen": -0.7376953363418579, "logps/rejected": -1.7277343273162842, "loss": 1.0245, "nll_loss": 1.0105469226837158, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07375488430261612, "rewards/margins": 0.09897460788488388, "rewards/rejected": -0.17270508408546448, "step": 2430 }, { "epoch": 0.3151843957889298, "grad_norm": 1.4892979215794329, "learning_rate": 1.619552660357832e-06, "log_odds_chosen": 1.344091773033142, "log_odds_ratio": -0.4166503846645355, "logits/chosen": -1.1281249523162842, "logits/rejected": -0.9535156488418579, "logps/chosen": -0.783398449420929, "logps/rejected": -1.78515625, "loss": 1.0317, "nll_loss": 0.9794921875, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07840576022863388, "rewards/margins": 0.10019226372241974, "rewards/rejected": -0.178466796875, "step": 2440 }, { "epoch": 0.3164761351159336, "grad_norm": 1.5231614106480502, "learning_rate": 1.616244071283537e-06, "log_odds_chosen": 1.4494507312774658, "log_odds_ratio": -0.4336914122104645, "logits/chosen": -1.185937523841858, "logits/rejected": -0.98046875, "logps/chosen": -0.7406250238418579, "logps/rejected": -1.802343726158142, "loss": 1.0278, "nll_loss": 0.9419921636581421, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07410888373851776, "rewards/margins": 0.10613403469324112, "rewards/rejected": -0.18012695014476776, "step": 2450 }, { "epoch": 0.3177678744429374, "grad_norm": 1.6994086077204105, "learning_rate": 1.6129556770910235e-06, "log_odds_chosen": 1.408203125, "log_odds_ratio": -0.4393066465854645, "logits/chosen": -1.2296874523162842, "logits/rejected": -0.9857422113418579, "logps/chosen": -0.830273449420929, "logps/rejected": -1.896093726158142, "loss": 1.0262, "nll_loss": 1.027929663658142, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.08304443210363388, "rewards/margins": 0.10650634765625, "rewards/rejected": -0.18950195610523224, "step": 2460 }, { "epoch": 0.31905961376994124, "grad_norm": 1.4240021638150706, "learning_rate": 1.6096872731710673e-06, "log_odds_chosen": 1.3523437976837158, "log_odds_ratio": -0.4209960997104645, "logits/chosen": -1.3083984851837158, "logits/rejected": -1.0935547351837158, "logps/chosen": -0.7364257574081421, "logps/rejected": -1.703710913658142, "loss": 1.0716, "nll_loss": 1.0187499523162842, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07359619438648224, "rewards/margins": 0.09668274223804474, "rewards/rejected": -0.17038574814796448, "step": 2470 }, { "epoch": 0.320351353096945, "grad_norm": 1.8312501857733896, "learning_rate": 1.6064386578049978e-06, "log_odds_chosen": 1.3611328601837158, "log_odds_ratio": -0.4229980409145355, "logits/chosen": -1.1912109851837158, "logits/rejected": -0.983593761920929, "logps/chosen": -0.774609386920929, "logps/rejected": -1.762109398841858, "loss": 1.0292, "nll_loss": 0.977343738079071, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07742919772863388, "rewards/margins": 0.09885253757238388, "rewards/rejected": -0.17629393935203552, "step": 2480 }, { "epoch": 0.32164309242394884, "grad_norm": 1.4612159161532716, "learning_rate": 1.6032096321124046e-06, "log_odds_chosen": 1.294335961341858, "log_odds_ratio": -0.4075927734375, "logits/chosen": -1.1730468273162842, "logits/rejected": -1.015234351158142, "logps/chosen": -0.7837890386581421, "logps/rejected": -1.701171875, "loss": 1.0493, "nll_loss": 1.0441405773162842, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07840576022863388, "rewards/margins": 0.09180907905101776, "rewards/rejected": -0.17019042372703552, "step": 2490 }, { "epoch": 0.32293483175095267, "grad_norm": 1.4460549593736796, "learning_rate": 1.6e-06, "log_odds_chosen": 1.229833960533142, "log_odds_ratio": -0.45458984375, "logits/chosen": -1.2169921398162842, "logits/rejected": -1.0431640148162842, "logps/chosen": -0.7837890386581421, "logps/rejected": -1.668359398841858, "loss": 1.0188, "nll_loss": 0.958789050579071, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07844237983226776, "rewards/margins": 0.08848266303539276, "rewards/rejected": -0.16679687798023224, "step": 2500 }, { "epoch": 0.3242265710779565, "grad_norm": 1.5193996446299936, "learning_rate": 1.5968095681115984e-06, "log_odds_chosen": 1.462988257408142, "log_odds_ratio": -0.39848631620407104, "logits/chosen": -1.159765601158142, "logits/rejected": -0.9498046636581421, "logps/chosen": -0.774218738079071, "logps/rejected": -1.853124976158142, "loss": 1.0451, "nll_loss": 1.0232422351837158, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07744140923023224, "rewards/margins": 0.10784912109375, "rewards/rejected": -0.18513183295726776, "step": 2510 }, { "epoch": 0.32551831040496026, "grad_norm": 1.3876887215351676, "learning_rate": 1.5936381457791914e-06, "log_odds_chosen": 1.424218773841858, "log_odds_ratio": -0.4034179747104645, "logits/chosen": -1.2722656726837158, "logits/rejected": -1.065039038658142, "logps/chosen": -0.7193359136581421, "logps/rejected": -1.751562476158142, "loss": 1.025, "nll_loss": 0.9185546636581421, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07187499850988388, "rewards/margins": 0.10329131782054901, "rewards/rejected": -0.17526856064796448, "step": 2520 }, { "epoch": 0.3268100497319641, "grad_norm": 2.253820601782652, "learning_rate": 1.590485544975088e-06, "log_odds_chosen": 1.548730492591858, "log_odds_ratio": -0.38081055879592896, "logits/chosen": -1.2734375, "logits/rejected": -1.056640625, "logps/chosen": -0.719531238079071, "logps/rejected": -1.853515625, "loss": 1.0494, "nll_loss": 0.9873046875, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07192382961511612, "rewards/margins": 0.11336670070886612, "rewards/rejected": -0.18544921278953552, "step": 2530 }, { "epoch": 0.3281017890589679, "grad_norm": 1.3747681344638403, "learning_rate": 1.5873515802650901e-06, "log_odds_chosen": 1.33984375, "log_odds_ratio": -0.41450196504592896, "logits/chosen": -1.237890601158142, "logits/rejected": -1.0400390625, "logps/chosen": -0.7544921636581421, "logps/rejected": -1.750390648841858, "loss": 1.0303, "nll_loss": 0.9515625238418579, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07539062201976776, "rewards/margins": 0.09970702975988388, "rewards/rejected": -0.17519530653953552, "step": 2540 }, { "epoch": 0.3293935283859717, "grad_norm": 1.4181531333436277, "learning_rate": 1.584236068762679e-06, "log_odds_chosen": 1.4600098133087158, "log_odds_ratio": -0.40961915254592896, "logits/chosen": -1.2615234851837158, "logits/rejected": -1.0164062976837158, "logps/chosen": -0.7635742425918579, "logps/rejected": -1.851171851158142, "loss": 1.0298, "nll_loss": 0.9390624761581421, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07634277641773224, "rewards/margins": 0.108795166015625, "rewards/rejected": -0.18498535454273224, "step": 2550 }, { "epoch": 0.3306852677129755, "grad_norm": 1.5370784846255565, "learning_rate": 1.5811388300841894e-06, "log_odds_chosen": 1.3122069835662842, "log_odds_ratio": -0.45976561307907104, "logits/chosen": -1.178125023841858, "logits/rejected": -1.0466797351837158, "logps/chosen": -0.705273449420929, "logps/rejected": -1.6423828601837158, "loss": 1.0235, "nll_loss": 0.9564453363418579, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07044677436351776, "rewards/margins": 0.09376678615808487, "rewards/rejected": -0.16425780951976776, "step": 2560 }, { "epoch": 0.33197700703997934, "grad_norm": 1.47951200592382, "learning_rate": 1.5780596863049431e-06, "log_odds_chosen": 1.221411108970642, "log_odds_ratio": -0.4374023377895355, "logits/chosen": -1.2003905773162842, "logits/rejected": -0.991015613079071, "logps/chosen": -0.7542968988418579, "logps/rejected": -1.672460913658142, "loss": 1.0153, "nll_loss": 0.9287109375, "rewards/accuracies": 0.75, "rewards/chosen": -0.07545165717601776, "rewards/margins": 0.09169311821460724, "rewards/rejected": -0.1671142578125, "step": 2570 }, { "epoch": 0.3332687463669831, "grad_norm": 1.8432236859206257, "learning_rate": 1.5749984619163156e-06, "log_odds_chosen": 1.197241187095642, "log_odds_ratio": -0.4608398377895355, "logits/chosen": -1.240234375, "logits/rejected": -0.9732421636581421, "logps/chosen": -0.7623046636581421, "logps/rejected": -1.622460961341858, "loss": 1.0356, "nll_loss": 0.964648425579071, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07619629055261612, "rewards/margins": 0.08606567233800888, "rewards/rejected": -0.16225585341453552, "step": 2580 }, { "epoch": 0.33456048569398694, "grad_norm": 1.7574783045605753, "learning_rate": 1.5719549837837187e-06, "log_odds_chosen": 1.5114257335662842, "log_odds_ratio": -0.3783203065395355, "logits/chosen": -1.216210961341858, "logits/rejected": -1.0011718273162842, "logps/chosen": -0.7455078363418579, "logps/rejected": -1.850000023841858, "loss": 1.0331, "nll_loss": 1.0146484375, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07457275688648224, "rewards/margins": 0.11044921725988388, "rewards/rejected": -0.18508300185203552, "step": 2590 }, { "epoch": 0.33585222502099077, "grad_norm": 1.5235642516222496, "learning_rate": 1.5689290811054722e-06, "log_odds_chosen": 1.3966796398162842, "log_odds_ratio": -0.3941406309604645, "logits/chosen": -1.181054711341858, "logits/rejected": -1.017578125, "logps/chosen": -0.756640613079071, "logps/rejected": -1.760156273841858, "loss": 1.0286, "nll_loss": 0.9996093511581421, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.07568359375, "rewards/margins": 0.10050048679113388, "rewards/rejected": -0.17607422173023224, "step": 2600 }, { "epoch": 0.3371439643479946, "grad_norm": 1.5596353514751462, "learning_rate": 1.5659205853725426e-06, "log_odds_chosen": 1.3064453601837158, "log_odds_ratio": -0.44648438692092896, "logits/chosen": -1.241601586341858, "logits/rejected": -1.0642578601837158, "logps/chosen": -0.809374988079071, "logps/rejected": -1.818359375, "loss": 1.0485, "nll_loss": 1.0349609851837158, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.08096923679113388, "rewards/margins": 0.10084228217601776, "rewards/rejected": -0.18173828721046448, "step": 2610 }, { "epoch": 0.33843570367499837, "grad_norm": 1.5099100866144541, "learning_rate": 1.562929330329127e-06, "log_odds_chosen": 1.318457007408142, "log_odds_ratio": -0.477294921875, "logits/chosen": -1.249414086341858, "logits/rejected": -1.040429711341858, "logps/chosen": -0.846484363079071, "logps/rejected": -1.859375, "loss": 1.0281, "nll_loss": 0.986328125, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.08461914211511612, "rewards/margins": 0.101226806640625, "rewards/rejected": -0.18581542372703552, "step": 2620 }, { "epoch": 0.3397274430020022, "grad_norm": 1.3594384557751003, "learning_rate": 1.5599551519340636e-06, "log_odds_chosen": 1.3944823741912842, "log_odds_ratio": -0.3941406309604645, "logits/chosen": -1.3113281726837158, "logits/rejected": -1.0810546875, "logps/chosen": -0.747851550579071, "logps/rejected": -1.773828148841858, "loss": 1.0291, "nll_loss": 0.961132824420929, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07470703125, "rewards/margins": 0.10255126655101776, "rewards/rejected": -0.17724609375, "step": 2630 }, { "epoch": 0.341019182329006, "grad_norm": 1.6169140376702476, "learning_rate": 1.556997888323046e-06, "log_odds_chosen": 1.3738281726837158, "log_odds_ratio": -0.40864259004592896, "logits/chosen": -1.1798827648162842, "logits/rejected": -0.9527343511581421, "logps/chosen": -0.710644543170929, "logps/rejected": -1.657617211341858, "loss": 1.0137, "nll_loss": 0.9888671636581421, "rewards/accuracies": 0.8125, "rewards/chosen": -0.071044921875, "rewards/margins": 0.09481658786535263, "rewards/rejected": -0.16582031548023224, "step": 2640 }, { "epoch": 0.3423109216560098, "grad_norm": 1.5496554391757391, "learning_rate": 1.5540573797716226e-06, "log_odds_chosen": 1.3556640148162842, "log_odds_ratio": -0.41093748807907104, "logits/chosen": -1.2980468273162842, "logits/rejected": -1.0771484375, "logps/chosen": -0.783398449420929, "logps/rejected": -1.751562476158142, "loss": 1.0216, "nll_loss": 0.9828125238418579, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07835693657398224, "rewards/margins": 0.09660644829273224, "rewards/rejected": -0.17499999701976776, "step": 2650 }, { "epoch": 0.3436026609830136, "grad_norm": 1.5257605761637454, "learning_rate": 1.5511334686589623e-06, "log_odds_chosen": 1.259863257408142, "log_odds_ratio": -0.413330078125, "logits/chosen": -1.1994140148162842, "logits/rejected": -1.051367163658142, "logps/chosen": -0.714550793170929, "logps/rejected": -1.585546851158142, "loss": 1.0243, "nll_loss": 1.015527367591858, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07139892876148224, "rewards/margins": 0.08719329535961151, "rewards/rejected": -0.15866699814796448, "step": 2660 }, { "epoch": 0.34489440031001745, "grad_norm": 1.406882352670602, "learning_rate": 1.548225999432367e-06, "log_odds_chosen": 1.4289062023162842, "log_odds_ratio": -0.4266113340854645, "logits/chosen": -1.284765601158142, "logits/rejected": -1.0205078125, "logps/chosen": -0.7904297113418579, "logps/rejected": -1.848046898841858, "loss": 1.0515, "nll_loss": 1.0007812976837158, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07911376655101776, "rewards/margins": 0.105712890625, "rewards/rejected": -0.1849365234375, "step": 2670 }, { "epoch": 0.3461861396370213, "grad_norm": 1.5168007043821992, "learning_rate": 1.5453348185725114e-06, "log_odds_chosen": 1.562109351158142, "log_odds_ratio": -0.3645996153354645, "logits/chosen": -1.234960913658142, "logits/rejected": -1.0291016101837158, "logps/chosen": -0.75390625, "logps/rejected": -1.8937499523162842, "loss": 1.0265, "nll_loss": 0.9947265386581421, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07539062201976776, "rewards/margins": 0.11407470703125, "rewards/rejected": -0.189453125, "step": 2680 }, { "epoch": 0.34747787896402504, "grad_norm": 1.5393745432766317, "learning_rate": 1.542459774559398e-06, "log_odds_chosen": 1.302343726158142, "log_odds_ratio": -0.46269530057907104, "logits/chosen": -1.310546875, "logits/rejected": -1.095117211341858, "logps/chosen": -0.7939453125, "logps/rejected": -1.715234398841858, "loss": 1.0303, "nll_loss": 1.002539038658142, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07939453423023224, "rewards/margins": 0.09210205078125, "rewards/rejected": -0.1715087890625, "step": 2690 }, { "epoch": 0.34876961829102887, "grad_norm": 1.379322100160873, "learning_rate": 1.539600717839002e-06, "log_odds_chosen": 1.3251464366912842, "log_odds_ratio": -0.43413084745407104, "logits/chosen": -1.197265625, "logits/rejected": -0.9779297113418579, "logps/chosen": -0.760937511920929, "logps/rejected": -1.7371094226837158, "loss": 1.0159, "nll_loss": 0.99609375, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07613525539636612, "rewards/margins": 0.0975494384765625, "rewards/rejected": -0.17363281548023224, "step": 2700 }, { "epoch": 0.3500613576180327, "grad_norm": 2.601522461925953, "learning_rate": 1.536757500790597e-06, "log_odds_chosen": 1.43408203125, "log_odds_ratio": -0.4046386778354645, "logits/chosen": -1.3097655773162842, "logits/rejected": -1.0666015148162842, "logps/chosen": -0.723828136920929, "logps/rejected": -1.7900390625, "loss": 1.0355, "nll_loss": 0.9310547113418579, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07233886420726776, "rewards/margins": 0.10648803412914276, "rewards/rejected": -0.17893067002296448, "step": 2710 }, { "epoch": 0.35135309694503647, "grad_norm": 1.340594321855894, "learning_rate": 1.5339299776947407e-06, "log_odds_chosen": 1.3108398914337158, "log_odds_ratio": -0.4166015684604645, "logits/chosen": -1.176171898841858, "logits/rejected": -0.9583984613418579, "logps/chosen": -0.7547851800918579, "logps/rejected": -1.6886718273162842, "loss": 1.01, "nll_loss": 1.010156273841858, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07540283352136612, "rewards/margins": 0.0933837890625, "rewards/rejected": -0.16899414360523224, "step": 2720 }, { "epoch": 0.3526448362720403, "grad_norm": 1.6438008709360286, "learning_rate": 1.5311180047019054e-06, "log_odds_chosen": 1.527929663658142, "log_odds_ratio": -0.39677733182907104, "logits/chosen": -1.1982421875, "logits/rejected": -0.9703124761581421, "logps/chosen": -0.7738281488418579, "logps/rejected": -1.921875, "loss": 1.032, "nll_loss": 0.999804675579071, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07733154296875, "rewards/margins": 0.11467895656824112, "rewards/rejected": -0.19204100966453552, "step": 2730 }, { "epoch": 0.3539365755990441, "grad_norm": 1.8687393440252311, "learning_rate": 1.5283214398017402e-06, "log_odds_chosen": 1.238867163658142, "log_odds_ratio": -0.5, "logits/chosen": -1.2541015148162842, "logits/rejected": -1.025390625, "logps/chosen": -0.802539050579071, "logps/rejected": -1.7292969226837158, "loss": 1.0277, "nll_loss": 1.0478515625, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.08022461086511612, "rewards/margins": 0.09252776950597763, "rewards/rejected": -0.172607421875, "step": 2740 }, { "epoch": 0.35522831492604795, "grad_norm": 1.5147936009635052, "learning_rate": 1.5255401427929477e-06, "log_odds_chosen": 1.236059546470642, "log_odds_ratio": -0.43378907442092896, "logits/chosen": -1.211523413658142, "logits/rejected": -1.0498046875, "logps/chosen": -0.6805664300918579, "logps/rejected": -1.523046851158142, "loss": 1.0336, "nll_loss": 0.922656238079071, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.06805419921875, "rewards/margins": 0.08431701362133026, "rewards/rejected": -0.1524658203125, "step": 2750 }, { "epoch": 0.3565200542530517, "grad_norm": 1.5854956762156527, "learning_rate": 1.5227739752537617e-06, "log_odds_chosen": 1.560546875, "log_odds_ratio": -0.37226563692092896, "logits/chosen": -1.178320288658142, "logits/rejected": -0.9458984136581421, "logps/chosen": -0.732421875, "logps/rejected": -1.8601562976837158, "loss": 1.0424, "nll_loss": 0.9208984375, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07319335639476776, "rewards/margins": 0.11280517280101776, "rewards/rejected": -0.18608398735523224, "step": 2760 }, { "epoch": 0.35781179358005555, "grad_norm": 1.4269528294063227, "learning_rate": 1.5200228005130127e-06, "log_odds_chosen": 1.502539038658142, "log_odds_ratio": -0.3880859315395355, "logits/chosen": -1.2521483898162842, "logits/rejected": -1.0333983898162842, "logps/chosen": -0.8287109136581421, "logps/rejected": -1.955468773841858, "loss": 1.0055, "nll_loss": 1.0158202648162842, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.08286132663488388, "rewards/margins": 0.11251220852136612, "rewards/rejected": -0.19560547173023224, "step": 2770 }, { "epoch": 0.3591035329070594, "grad_norm": 1.532521391356933, "learning_rate": 1.5172864836217631e-06, "log_odds_chosen": 1.211523413658142, "log_odds_ratio": -0.46875, "logits/chosen": -1.1306641101837158, "logits/rejected": -0.9546874761581421, "logps/chosen": -0.787304699420929, "logps/rejected": -1.6687500476837158, "loss": 1.025, "nll_loss": 0.9818359613418579, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.0787353515625, "rewards/margins": 0.08814086765050888, "rewards/rejected": -0.16689452528953552, "step": 2780 }, { "epoch": 0.36039527223406315, "grad_norm": 1.5506901976608174, "learning_rate": 1.514564891325506e-06, "log_odds_chosen": 1.505859375, "log_odds_ratio": -0.39824217557907104, "logits/chosen": -1.228124976158142, "logits/rejected": -0.991015613079071, "logps/chosen": -0.740429699420929, "logps/rejected": -1.8113281726837158, "loss": 1.0235, "nll_loss": 0.9931640625, "rewards/accuracies": 0.84375, "rewards/chosen": -0.07403564453125, "rewards/margins": 0.10703124850988388, "rewards/rejected": -0.1810302734375, "step": 2790 }, { "epoch": 0.361687011561067, "grad_norm": 1.3388784430979392, "learning_rate": 1.5118578920369086e-06, "log_odds_chosen": 1.507104516029358, "log_odds_ratio": -0.398681640625, "logits/chosen": -1.1941406726837158, "logits/rejected": -0.9976562261581421, "logps/chosen": -0.748828113079071, "logps/rejected": -1.831445336341858, "loss": 1.015, "nll_loss": 0.9349609613418579, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07479248195886612, "rewards/margins": 0.10837402194738388, "rewards/rejected": -0.18308106064796448, "step": 2800 }, { "epoch": 0.3629787508880708, "grad_norm": 1.6617358254763972, "learning_rate": 1.5091653558090898e-06, "log_odds_chosen": 1.4683105945587158, "log_odds_ratio": -0.4205566346645355, "logits/chosen": -1.284765601158142, "logits/rejected": -1.062890648841858, "logps/chosen": -0.7701171636581421, "logps/rejected": -1.829492211341858, "loss": 1.0107, "nll_loss": 0.9599609375, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07709960639476776, "rewards/margins": 0.10589905083179474, "rewards/rejected": -0.182861328125, "step": 2810 }, { "epoch": 0.36427049021507457, "grad_norm": 1.448693430057611, "learning_rate": 1.506487154309419e-06, "log_odds_chosen": 1.3786132335662842, "log_odds_ratio": -0.3921875059604645, "logits/chosen": -1.16015625, "logits/rejected": -0.979296863079071, "logps/chosen": -0.687304675579071, "logps/rejected": -1.6398437023162842, "loss": 1.0153, "nll_loss": 0.91796875, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.0687255859375, "rewards/margins": 0.09523925930261612, "rewards/rejected": -0.16408690810203552, "step": 2820 }, { "epoch": 0.3655622295420784, "grad_norm": 1.4163825937690617, "learning_rate": 1.5038231607938247e-06, "log_odds_chosen": 1.44873046875, "log_odds_ratio": -0.4397949278354645, "logits/chosen": -1.1611328125, "logits/rejected": -0.991992175579071, "logps/chosen": -0.741992175579071, "logps/rejected": -1.742578148841858, "loss": 1.0058, "nll_loss": 0.9515625238418579, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07429198920726776, "rewards/margins": 0.100006103515625, "rewards/rejected": -0.17434081435203552, "step": 2830 }, { "epoch": 0.3668539688690822, "grad_norm": 1.773613483592378, "learning_rate": 1.501173250081603e-06, "log_odds_chosen": 1.4287109375, "log_odds_ratio": -0.3788085877895355, "logits/chosen": -1.2431640625, "logits/rejected": -1.025781273841858, "logps/chosen": -0.7064453363418579, "logps/rejected": -1.738867163658142, "loss": 1.0283, "nll_loss": 1.0115234851837158, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07065429538488388, "rewards/margins": 0.10333709418773651, "rewards/rejected": -0.17402343451976776, "step": 2840 }, { "epoch": 0.36814570819608605, "grad_norm": 1.5918987751394618, "learning_rate": 1.4985372985307103e-06, "log_odds_chosen": 1.2820312976837158, "log_odds_ratio": -0.4369140565395355, "logits/chosen": -1.2033202648162842, "logits/rejected": -1.0458984375, "logps/chosen": -0.7724609375, "logps/rejected": -1.717187523841858, "loss": 1.0158, "nll_loss": 0.9458984136581421, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07724609225988388, "rewards/margins": 0.094512939453125, "rewards/rejected": -0.1717529296875, "step": 2850 }, { "epoch": 0.3694374475230898, "grad_norm": 1.5245879752168185, "learning_rate": 1.4959151840135313e-06, "log_odds_chosen": 1.411474585533142, "log_odds_ratio": -0.4097656309604645, "logits/chosen": -1.1181640625, "logits/rejected": -0.9574218988418579, "logps/chosen": -0.7955077886581421, "logps/rejected": -1.8371093273162842, "loss": 1.0241, "nll_loss": 1.0597655773162842, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07957763969898224, "rewards/margins": 0.104095458984375, "rewards/rejected": -0.18366698920726776, "step": 2860 }, { "epoch": 0.37072918685009365, "grad_norm": 1.3437615394154236, "learning_rate": 1.4933067858931148e-06, "log_odds_chosen": 1.2717773914337158, "log_odds_ratio": -0.4296875, "logits/chosen": -1.278906226158142, "logits/rejected": -1.026757836341858, "logps/chosen": -0.693164050579071, "logps/rejected": -1.5900390148162842, "loss": 0.9985, "nll_loss": 0.9185546636581421, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.06931152194738388, "rewards/margins": 0.08977966010570526, "rewards/rejected": -0.15895995497703552, "step": 2870 }, { "epoch": 0.3720209261770975, "grad_norm": 1.5114703261404312, "learning_rate": 1.4907119849998597e-06, "log_odds_chosen": 1.190637230873108, "log_odds_ratio": -0.48320311307907104, "logits/chosen": -1.271875023841858, "logits/rejected": -1.0808594226837158, "logps/chosen": -0.786914050579071, "logps/rejected": -1.677148461341858, "loss": 1.021, "nll_loss": 1.005273461341858, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07872314751148224, "rewards/margins": 0.08900909125804901, "rewards/rejected": -0.16767577826976776, "step": 2880 }, { "epoch": 0.37331266550410125, "grad_norm": 1.587789549253314, "learning_rate": 1.488130663608649e-06, "log_odds_chosen": 1.495703101158142, "log_odds_ratio": -0.42597657442092896, "logits/chosen": -1.232812523841858, "logits/rejected": -1.0099608898162842, "logps/chosen": -0.717578113079071, "logps/rejected": -1.842187523841858, "loss": 1.0279, "nll_loss": 0.957226574420929, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07175292819738388, "rewards/margins": 0.11240234225988388, "rewards/rejected": -0.18413086235523224, "step": 2890 }, { "epoch": 0.3746044048311051, "grad_norm": 1.5928047512354997, "learning_rate": 1.4855627054164149e-06, "log_odds_chosen": 1.270898461341858, "log_odds_ratio": -0.4200683534145355, "logits/chosen": -1.3156249523162842, "logits/rejected": -1.067968726158142, "logps/chosen": -0.8037109375, "logps/rejected": -1.708593726158142, "loss": 1.0292, "nll_loss": 1.0212891101837158, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.08037109673023224, "rewards/margins": 0.09041748195886612, "rewards/rejected": -0.17087402939796448, "step": 2900 }, { "epoch": 0.3758961441581089, "grad_norm": 1.8110139955924969, "learning_rate": 1.4830079955201294e-06, "log_odds_chosen": 1.489843726158142, "log_odds_ratio": -0.39375001192092896, "logits/chosen": -1.272070288658142, "logits/rejected": -1.0476562976837158, "logps/chosen": -0.72998046875, "logps/rejected": -1.777929663658142, "loss": 1.0086, "nll_loss": 0.8931640386581421, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07294921576976776, "rewards/margins": 0.1048583984375, "rewards/rejected": -0.17795410752296448, "step": 2910 }, { "epoch": 0.37718788348511273, "grad_norm": 1.668166996320744, "learning_rate": 1.4804664203952103e-06, "log_odds_chosen": 1.6106445789337158, "log_odds_ratio": -0.37373048067092896, "logits/chosen": -1.293554663658142, "logits/rejected": -1.021093726158142, "logps/chosen": -0.7568359375, "logps/rejected": -1.9578125476837158, "loss": 1.0023, "nll_loss": 0.966992199420929, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07572021335363388, "rewards/margins": 0.12015380710363388, "rewards/rejected": -0.19584961235523224, "step": 2920 }, { "epoch": 0.3784796228121165, "grad_norm": 1.6791351283783518, "learning_rate": 1.4779378678743327e-06, "log_odds_chosen": 1.41796875, "log_odds_ratio": -0.4283691346645355, "logits/chosen": -1.2785155773162842, "logits/rejected": -1.065820336341858, "logps/chosen": -0.7250000238418579, "logps/rejected": -1.7253906726837158, "loss": 1.0158, "nll_loss": 0.9916015863418579, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07255859673023224, "rewards/margins": 0.099853515625, "rewards/rejected": -0.17243652045726776, "step": 2930 }, { "epoch": 0.3797713621391203, "grad_norm": 1.8648969342795538, "learning_rate": 1.4754222271266348e-06, "log_odds_chosen": 1.320898413658142, "log_odds_ratio": -0.3905029296875, "logits/chosen": -1.270898461341858, "logits/rejected": -1.0224609375, "logps/chosen": -0.7982422113418579, "logps/rejected": -1.7566406726837158, "loss": 1.0473, "nll_loss": 0.997265636920929, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07978515326976776, "rewards/margins": 0.09592285007238388, "rewards/rejected": -0.17568358778953552, "step": 2940 }, { "epoch": 0.38106310146612415, "grad_norm": 1.761201927303849, "learning_rate": 1.4729193886373175e-06, "log_odds_chosen": 1.363671898841858, "log_odds_ratio": -0.38330078125, "logits/chosen": -1.2166016101837158, "logits/rejected": -1.0730469226837158, "logps/chosen": -0.75146484375, "logps/rejected": -1.734765648841858, "loss": 0.9995, "nll_loss": 0.9400390386581421, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07514648139476776, "rewards/margins": 0.09832763671875, "rewards/rejected": -0.17338867485523224, "step": 2950 }, { "epoch": 0.3823548407931279, "grad_norm": 1.3949921314428897, "learning_rate": 1.4704292441876156e-06, "log_odds_chosen": 1.377343773841858, "log_odds_ratio": -0.43623048067092896, "logits/chosen": -1.1896483898162842, "logits/rejected": -1.06640625, "logps/chosen": -0.7225586175918579, "logps/rejected": -1.7541015148162842, "loss": 1.0266, "nll_loss": 0.9585937261581421, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07225342094898224, "rewards/margins": 0.10338135063648224, "rewards/rejected": -0.17551270127296448, "step": 2960 }, { "epoch": 0.38364658012013175, "grad_norm": 1.8030693308145072, "learning_rate": 1.4679516868351474e-06, "log_odds_chosen": 1.4705078601837158, "log_odds_ratio": -0.3963378965854645, "logits/chosen": -1.196679711341858, "logits/rejected": -1.0164062976837158, "logps/chosen": -0.740429699420929, "logps/rejected": -1.8025391101837158, "loss": 1.0231, "nll_loss": 0.937304675579071, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.0740966796875, "rewards/margins": 0.10624389350414276, "rewards/rejected": -0.18039551377296448, "step": 2970 }, { "epoch": 0.3849383194471356, "grad_norm": 1.4769906211012922, "learning_rate": 1.4654866108946234e-06, "log_odds_chosen": 1.230078101158142, "log_odds_ratio": -0.443603515625, "logits/chosen": -1.2890625, "logits/rejected": -1.11328125, "logps/chosen": -0.7509765625, "logps/rejected": -1.618749976158142, "loss": 1.0199, "nll_loss": 0.913281261920929, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07510986179113388, "rewards/margins": 0.08683471381664276, "rewards/rejected": -0.16184082627296448, "step": 2980 }, { "epoch": 0.38623005877413935, "grad_norm": 1.6965568036298624, "learning_rate": 1.4630339119189101e-06, "log_odds_chosen": 1.381445288658142, "log_odds_ratio": -0.4249023497104645, "logits/chosen": -1.1982421875, "logits/rejected": -1.0109374523162842, "logps/chosen": -0.7247070074081421, "logps/rejected": -1.727929711341858, "loss": 0.9742, "nll_loss": 0.9462890625, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07252196967601776, "rewards/margins": 0.10051269829273224, "rewards/rejected": -0.17304687201976776, "step": 2990 }, { "epoch": 0.3875217981011432, "grad_norm": 1.9339540346435529, "learning_rate": 1.4605934866804429e-06, "log_odds_chosen": 1.356201171875, "log_odds_ratio": -0.40576171875, "logits/chosen": -1.3712890148162842, "logits/rejected": -1.155664086341858, "logps/chosen": -0.681835949420929, "logps/rejected": -1.6511719226837158, "loss": 1.0077, "nll_loss": 0.918749988079071, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.06821288913488388, "rewards/margins": 0.09696350246667862, "rewards/rejected": -0.16520996391773224, "step": 3000 }, { "epoch": 0.388813537428147, "grad_norm": 1.7533317818193308, "learning_rate": 1.4581652331529784e-06, "log_odds_chosen": 1.305761694908142, "log_odds_ratio": -0.42333984375, "logits/chosen": -1.1140625476837158, "logits/rejected": -0.9781249761581421, "logps/chosen": -0.7259765863418579, "logps/rejected": -1.657812476158142, "loss": 1.006, "nll_loss": 1.0107421875, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07260742038488388, "rewards/margins": 0.09302368015050888, "rewards/rejected": -0.16555175185203552, "step": 3010 }, { "epoch": 0.39010527675515083, "grad_norm": 1.468852927176469, "learning_rate": 1.4557490504936778e-06, "log_odds_chosen": 1.431054711341858, "log_odds_ratio": -0.39836424589157104, "logits/chosen": -1.2599608898162842, "logits/rejected": -1.068750023841858, "logps/chosen": -0.801953136920929, "logps/rejected": -1.8585937023162842, "loss": 1.0284, "nll_loss": 0.974609375, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.08026123046875, "rewards/margins": 0.10570068657398224, "rewards/rejected": -0.18588867783546448, "step": 3020 }, { "epoch": 0.3913970160821546, "grad_norm": 1.5365042199375425, "learning_rate": 1.453344839025519e-06, "log_odds_chosen": 1.542871117591858, "log_odds_ratio": -0.3916015625, "logits/chosen": -1.201171875, "logits/rejected": -1.0085937976837158, "logps/chosen": -0.720507800579071, "logps/rejected": -1.81640625, "loss": 1.0042, "nll_loss": 0.9208008050918579, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07208251953125, "rewards/margins": 0.10950622707605362, "rewards/rejected": -0.18161621689796448, "step": 3030 }, { "epoch": 0.39268875540915843, "grad_norm": 1.7801592044391912, "learning_rate": 1.4509525002200234e-06, "log_odds_chosen": 1.3759765625, "log_odds_ratio": -0.41865235567092896, "logits/chosen": -1.2156250476837158, "logits/rejected": -1.0615234375, "logps/chosen": -0.736132800579071, "logps/rejected": -1.728515625, "loss": 1.0142, "nll_loss": 0.9937499761581421, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07357177883386612, "rewards/margins": 0.09931640326976776, "rewards/rejected": -0.17287597060203552, "step": 3040 }, { "epoch": 0.39398049473616226, "grad_norm": 1.6593237307277826, "learning_rate": 1.4485719366802965e-06, "log_odds_chosen": 1.5216796398162842, "log_odds_ratio": -0.378173828125, "logits/chosen": -1.2998046875, "logits/rejected": -1.0529296398162842, "logps/chosen": -0.7447265386581421, "logps/rejected": -1.880859375, "loss": 0.9992, "nll_loss": 0.9482421875, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07445068657398224, "rewards/margins": 0.1136474609375, "rewards/rejected": -0.188232421875, "step": 3050 }, { "epoch": 0.39527223406316603, "grad_norm": 1.5433039740808436, "learning_rate": 1.4462030521243742e-06, "log_odds_chosen": 1.35107421875, "log_odds_ratio": -0.4595703184604645, "logits/chosen": -1.2443358898162842, "logits/rejected": -1.0556640625, "logps/chosen": -0.7548828125, "logps/rejected": -1.7546875476837158, "loss": 1.0066, "nll_loss": 0.930859386920929, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.07548828423023224, "rewards/margins": 0.09993286430835724, "rewards/rejected": -0.17551270127296448, "step": 3060 }, { "epoch": 0.39656397339016985, "grad_norm": 30.646687219608673, "learning_rate": 1.443845751368867e-06, "log_odds_chosen": 1.623046875, "log_odds_ratio": -0.38652342557907104, "logits/chosen": -1.203710913658142, "logits/rejected": -0.9990234375, "logps/chosen": -0.7427734136581421, "logps/rejected": -1.904687523841858, "loss": 1.0121, "nll_loss": 1.058007836341858, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07425536960363388, "rewards/margins": 0.11622314155101776, "rewards/rejected": -0.19045409560203552, "step": 3070 }, { "epoch": 0.3978557127171737, "grad_norm": 3.8635557864130523, "learning_rate": 1.4414999403128943e-06, "log_odds_chosen": 1.771875023841858, "log_odds_ratio": -0.37373048067092896, "logits/chosen": -1.2492187023162842, "logits/rejected": -0.983593761920929, "logps/chosen": -0.7616211175918579, "logps/rejected": -2.075390577316284, "loss": 1.0185, "nll_loss": 0.9644531011581421, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.07620849460363388, "rewards/margins": 0.13140869140625, "rewards/rejected": -0.20766600966453552, "step": 3080 }, { "epoch": 0.3991474520441775, "grad_norm": 1.5740548084697006, "learning_rate": 1.439165525922309e-06, "log_odds_chosen": 1.757421851158142, "log_odds_ratio": -0.33479005098342896, "logits/chosen": -1.242773413658142, "logits/rejected": -1.0138671398162842, "logps/chosen": -0.7007812261581421, "logps/rejected": -2.0078125, "loss": 1.0081, "nll_loss": 0.940234363079071, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.07001952826976776, "rewards/margins": 0.13093261420726776, "rewards/rejected": -0.200927734375, "step": 3090 }, { "epoch": 0.4004391913711813, "grad_norm": 1.4410177225831737, "learning_rate": 1.4368424162141992e-06, "log_odds_chosen": 1.442773461341858, "log_odds_ratio": -0.4041503965854645, "logits/chosen": -1.208984375, "logits/rejected": -1.026953101158142, "logps/chosen": -0.7623046636581421, "logps/rejected": -1.851953148841858, "loss": 0.9811, "nll_loss": 0.9560546875, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07622070610523224, "rewards/margins": 0.10897216945886612, "rewards/rejected": -0.18522949516773224, "step": 3100 }, { "epoch": 0.4017309306981851, "grad_norm": 1.600319707869519, "learning_rate": 1.434530520241665e-06, "log_odds_chosen": 1.4052245616912842, "log_odds_ratio": -0.42792969942092896, "logits/chosen": -1.2490234375, "logits/rejected": -1.0236327648162842, "logps/chosen": -0.727734386920929, "logps/rejected": -1.755468726158142, "loss": 0.9927, "nll_loss": 0.9751952886581421, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07282714545726776, "rewards/margins": 0.1026611328125, "rewards/rejected": -0.17546387016773224, "step": 3110 }, { "epoch": 0.40302267002518893, "grad_norm": 1.997515048461857, "learning_rate": 1.4322297480788657e-06, "log_odds_chosen": 1.597802758216858, "log_odds_ratio": -0.38432615995407104, "logits/chosen": -1.3214843273162842, "logits/rejected": -1.0304687023162842, "logps/chosen": -0.730273425579071, "logps/rejected": -1.93359375, "loss": 0.9899, "nll_loss": 0.9505859613418579, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07308349758386612, "rewards/margins": 0.12014313042163849, "rewards/rejected": -0.19338378310203552, "step": 3120 }, { "epoch": 0.4043144093521927, "grad_norm": 1.7222233813060632, "learning_rate": 1.4299400108063247e-06, "log_odds_chosen": 1.6300780773162842, "log_odds_ratio": -0.3740234375, "logits/chosen": -1.316015601158142, "logits/rejected": -1.110937476158142, "logps/chosen": -0.770703136920929, "logps/rejected": -1.9806640148162842, "loss": 0.9945, "nll_loss": 0.906445324420929, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07701416313648224, "rewards/margins": 0.12120361626148224, "rewards/rejected": -0.19829101860523224, "step": 3130 }, { "epoch": 0.40560614867919653, "grad_norm": 1.4898834138623338, "learning_rate": 1.4276612204964992e-06, "log_odds_chosen": 1.4451172351837158, "log_odds_ratio": -0.401123046875, "logits/chosen": -1.208398461341858, "logits/rejected": -1.021484375, "logps/chosen": -0.7417968511581421, "logps/rejected": -1.78515625, "loss": 0.998, "nll_loss": 0.948046863079071, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07415771484375, "rewards/margins": 0.10443115234375, "rewards/rejected": -0.17854003608226776, "step": 3140 }, { "epoch": 0.40689788800620036, "grad_norm": 1.8764285052879957, "learning_rate": 1.4253932901995967e-06, "log_odds_chosen": 1.435937523841858, "log_odds_ratio": -0.3905273377895355, "logits/chosen": -1.215429663658142, "logits/rejected": -0.9873046875, "logps/chosen": -0.738476574420929, "logps/rejected": -1.7820312976837158, "loss": 1.0202, "nll_loss": 0.956835925579071, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07386474311351776, "rewards/margins": 0.10433349758386612, "rewards/rejected": -0.17812499403953552, "step": 3150 }, { "epoch": 0.4081896273332042, "grad_norm": 1.4844998195761614, "learning_rate": 1.42313613392964e-06, "log_odds_chosen": 1.8781249523162842, "log_odds_ratio": -0.33305662870407104, "logits/chosen": -1.228124976158142, "logits/rejected": -1.0353515148162842, "logps/chosen": -0.690234363079071, "logps/rejected": -2.1039061546325684, "loss": 0.9789, "nll_loss": 0.920703113079071, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.06904296576976776, "rewards/margins": 0.14133301377296448, "rewards/rejected": -0.21044921875, "step": 3160 }, { "epoch": 0.40948136666020796, "grad_norm": 1.5384722571595832, "learning_rate": 1.4208896666507756e-06, "log_odds_chosen": 1.4221680164337158, "log_odds_ratio": -0.3759765625, "logits/chosen": -1.146875023841858, "logits/rejected": -0.9697265625, "logps/chosen": -0.7386718988418579, "logps/rejected": -1.7550780773162842, "loss": 0.9971, "nll_loss": 0.936718761920929, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.0738525390625, "rewards/margins": 0.10155639797449112, "rewards/rejected": -0.17543944716453552, "step": 3170 }, { "epoch": 0.4107731059872118, "grad_norm": 1.8645588867089167, "learning_rate": 1.4186538042638173e-06, "log_odds_chosen": 1.452539086341858, "log_odds_ratio": -0.3577636778354645, "logits/chosen": -1.2380859851837158, "logits/rejected": -0.9916015863418579, "logps/chosen": -0.760546863079071, "logps/rejected": -1.8113281726837158, "loss": 1.0138, "nll_loss": 0.9955078363418579, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07600097358226776, "rewards/margins": 0.10518798977136612, "rewards/rejected": -0.18125000596046448, "step": 3180 }, { "epoch": 0.4120648453142156, "grad_norm": 2.013911821697341, "learning_rate": 1.416428463593022e-06, "log_odds_chosen": 1.6748046875, "log_odds_ratio": -0.37687987089157104, "logits/chosen": -1.255273461341858, "logits/rejected": -1.0324218273162842, "logps/chosen": -0.70458984375, "logps/rejected": -1.9296875, "loss": 1.0041, "nll_loss": 0.9306640625, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.07039795070886612, "rewards/margins": 0.12253417819738388, "rewards/rejected": -0.19296875596046448, "step": 3190 }, { "epoch": 0.4133565846412194, "grad_norm": 1.7711389963585158, "learning_rate": 1.414213562373095e-06, "log_odds_chosen": 1.500585913658142, "log_odds_ratio": -0.40410155057907104, "logits/chosen": -1.3330078125, "logits/rejected": -1.0400390625, "logps/chosen": -0.7689453363418579, "logps/rejected": -1.8917968273162842, "loss": 1.0133, "nll_loss": 0.986132800579071, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07685546576976776, "rewards/margins": 0.11232604831457138, "rewards/rejected": -0.18916015326976776, "step": 3200 }, { "epoch": 0.4146483239682232, "grad_norm": 1.4487056262222646, "learning_rate": 1.4120090192364154e-06, "log_odds_chosen": 1.649999976158142, "log_odds_ratio": -0.35148924589157104, "logits/chosen": -1.1847655773162842, "logits/rejected": -0.922656238079071, "logps/chosen": -0.73046875, "logps/rejected": -1.91015625, "loss": 0.9977, "nll_loss": 0.9173828363418579, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -0.07308349758386612, "rewards/margins": 0.11784668266773224, "rewards/rejected": -0.19096679985523224, "step": 3210 }, { "epoch": 0.41594006329522704, "grad_norm": 1.4071233375340308, "learning_rate": 1.4098147537004828e-06, "log_odds_chosen": 1.5021483898162842, "log_odds_ratio": -0.37761229276657104, "logits/chosen": -1.232031226158142, "logits/rejected": -1.021093726158142, "logps/chosen": -0.72607421875, "logps/rejected": -1.828515648841858, "loss": 1.0145, "nll_loss": 0.985156238079071, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07259521633386612, "rewards/margins": 0.11009521782398224, "rewards/rejected": -0.18288573622703552, "step": 3220 }, { "epoch": 0.4172318026222308, "grad_norm": 2.536392549878833, "learning_rate": 1.4076306861555735e-06, "log_odds_chosen": 1.250952124595642, "log_odds_ratio": -0.43413084745407104, "logits/chosen": -1.279882788658142, "logits/rejected": -1.123437523841858, "logps/chosen": -0.724414050579071, "logps/rejected": -1.6007812023162842, "loss": 0.9747, "nll_loss": 0.8988281488418579, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07242431491613388, "rewards/margins": 0.08768920600414276, "rewards/rejected": -0.16008301079273224, "step": 3230 }, { "epoch": 0.41852354194923463, "grad_norm": 1.5315128990542002, "learning_rate": 1.405456737852613e-06, "log_odds_chosen": 1.464257836341858, "log_odds_ratio": -0.43671876192092896, "logits/chosen": -1.2443358898162842, "logits/rejected": -1.0705077648162842, "logps/chosen": -0.732617199420929, "logps/rejected": -1.8230469226837158, "loss": 0.992, "nll_loss": 0.9107421636581421, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07330322265625, "rewards/margins": 0.10887451469898224, "rewards/rejected": -0.18217773735523224, "step": 3240 }, { "epoch": 0.41981528127623846, "grad_norm": 2.2011303414892787, "learning_rate": 1.4032928308912468e-06, "log_odds_chosen": 1.4099609851837158, "log_odds_ratio": -0.3797851502895355, "logits/chosen": -1.29296875, "logits/rejected": -1.0974609851837158, "logps/chosen": -0.683789074420929, "logps/rejected": -1.6769530773162842, "loss": 1.0125, "nll_loss": 0.949023425579071, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.06838379055261612, "rewards/margins": 0.09927978366613388, "rewards/rejected": -0.16757813096046448, "step": 3250 }, { "epoch": 0.4211070206032423, "grad_norm": 1.9007130940647943, "learning_rate": 1.4011388882081175e-06, "log_odds_chosen": 1.462304711341858, "log_odds_ratio": -0.4241699278354645, "logits/chosen": -1.2666015625, "logits/rejected": -1.049218773841858, "logps/chosen": -0.770312488079071, "logps/rejected": -1.822265625, "loss": 1.0176, "nll_loss": 1.009179711341858, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07703857123851776, "rewards/margins": 0.10509643703699112, "rewards/rejected": -0.18205566704273224, "step": 3260 }, { "epoch": 0.42239875993024606, "grad_norm": 1.5002841689366821, "learning_rate": 1.3989948335653378e-06, "log_odds_chosen": 1.3546874523162842, "log_odds_ratio": -0.41289061307907104, "logits/chosen": -1.197656273841858, "logits/rejected": -0.9867187738418579, "logps/chosen": -0.752734363079071, "logps/rejected": -1.7400391101837158, "loss": 1.0029, "nll_loss": 0.987500011920929, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07526855170726776, "rewards/margins": 0.098602294921875, "rewards/rejected": -0.17390136420726776, "step": 3270 }, { "epoch": 0.4236904992572499, "grad_norm": 1.7112780257285214, "learning_rate": 1.3968605915391564e-06, "log_odds_chosen": 1.649804711341858, "log_odds_ratio": -0.3883300721645355, "logits/chosen": -1.267968773841858, "logits/rejected": -1.032617211341858, "logps/chosen": -0.7740234136581421, "logps/rejected": -2.006640672683716, "loss": 0.9912, "nll_loss": 1.0107421875, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07745361328125, "rewards/margins": 0.12327881157398224, "rewards/rejected": -0.20048828423023224, "step": 3280 }, { "epoch": 0.4249822385842537, "grad_norm": 1.4277594122843376, "learning_rate": 1.3947360875088132e-06, "log_odds_chosen": 1.554296851158142, "log_odds_ratio": -0.37785643339157104, "logits/chosen": -1.3087890148162842, "logits/rejected": -1.046875, "logps/chosen": -0.743945300579071, "logps/rejected": -1.8914062976837158, "loss": 0.9939, "nll_loss": 0.8890625238418579, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07438965141773224, "rewards/margins": 0.11470947414636612, "rewards/rejected": -0.18901367485523224, "step": 3290 }, { "epoch": 0.4262739779112575, "grad_norm": 2.037220577223024, "learning_rate": 1.3926212476455828e-06, "log_odds_chosen": 1.112695336341858, "log_odds_ratio": -0.504199206829071, "logits/chosen": -1.317968726158142, "logits/rejected": -1.1056640148162842, "logps/chosen": -0.7802734375, "logps/rejected": -1.603124976158142, "loss": 0.9924, "nll_loss": 0.9869140386581421, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.07801513373851776, "rewards/margins": 0.08224181830883026, "rewards/rejected": -0.16020508110523224, "step": 3300 }, { "epoch": 0.4275657172382613, "grad_norm": 1.4860013380904586, "learning_rate": 1.3905159989019964e-06, "log_odds_chosen": 1.600195288658142, "log_odds_ratio": -0.3551269471645355, "logits/chosen": -1.240234375, "logits/rejected": -1.0125000476837158, "logps/chosen": -0.7679687738418579, "logps/rejected": -1.9558594226837158, "loss": 0.9807, "nll_loss": 0.955273449420929, "rewards/accuracies": 0.84375, "rewards/chosen": -0.0767822265625, "rewards/margins": 0.11893310397863388, "rewards/rejected": -0.19572754204273224, "step": 3310 }, { "epoch": 0.42885745656526514, "grad_norm": 1.4769956768968087, "learning_rate": 1.3884202690012465e-06, "log_odds_chosen": 1.264794945716858, "log_odds_ratio": -0.45146483182907104, "logits/chosen": -1.261328101158142, "logits/rejected": -1.101171851158142, "logps/chosen": -0.744433581829071, "logps/rejected": -1.663671851158142, "loss": 1.0005, "nll_loss": 0.939257800579071, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07441405951976776, "rewards/margins": 0.09189758449792862, "rewards/rejected": -0.16635742783546448, "step": 3320 }, { "epoch": 0.43014919589226897, "grad_norm": 1.9868726645866255, "learning_rate": 1.3863339864267636e-06, "log_odds_chosen": 1.4054687023162842, "log_odds_ratio": -0.4319824278354645, "logits/chosen": -1.2042968273162842, "logits/rejected": -1.0361328125, "logps/chosen": -0.721484363079071, "logps/rejected": -1.731054663658142, "loss": 1.0059, "nll_loss": 0.958203136920929, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.0721435546875, "rewards/margins": 0.10098876804113388, "rewards/rejected": -0.1732177734375, "step": 3330 }, { "epoch": 0.43144093521927274, "grad_norm": 1.455663891143005, "learning_rate": 1.3842570804119655e-06, "log_odds_chosen": 1.5056641101837158, "log_odds_ratio": -0.3729003965854645, "logits/chosen": -1.259765625, "logits/rejected": -1.020898461341858, "logps/chosen": -0.691699206829071, "logps/rejected": -1.7431640625, "loss": 0.9764, "nll_loss": 0.8968750238418579, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.06910400092601776, "rewards/margins": 0.10523681342601776, "rewards/rejected": -0.17431640625, "step": 3340 }, { "epoch": 0.43273267454627656, "grad_norm": 1.867354991127315, "learning_rate": 1.3821894809301763e-06, "log_odds_chosen": 1.60107421875, "log_odds_ratio": -0.35107421875, "logits/chosen": -1.3634765148162842, "logits/rejected": -1.0798828601837158, "logps/chosen": -0.756640613079071, "logps/rejected": -1.9464843273162842, "loss": 0.9949, "nll_loss": 0.896679699420929, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -0.07564697414636612, "rewards/margins": 0.11897583305835724, "rewards/rejected": -0.19462890923023224, "step": 3350 }, { "epoch": 0.4340244138732804, "grad_norm": 1.6571299514806361, "learning_rate": 1.3801311186847081e-06, "log_odds_chosen": 1.253515601158142, "log_odds_ratio": -0.43964844942092896, "logits/chosen": -1.310546875, "logits/rejected": -1.116601586341858, "logps/chosen": -0.736132800579071, "logps/rejected": -1.6316406726837158, "loss": 0.9926, "nll_loss": 0.9134765863418579, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07362060248851776, "rewards/margins": 0.0895233154296875, "rewards/rejected": -0.16318359971046448, "step": 3360 }, { "epoch": 0.43531615320028416, "grad_norm": 1.4443000732041174, "learning_rate": 1.378081925099109e-06, "log_odds_chosen": 1.5732421875, "log_odds_ratio": -0.3878417909145355, "logits/chosen": -1.1833984851837158, "logits/rejected": -0.9828125238418579, "logps/chosen": -0.7865234613418579, "logps/rejected": -1.9015624523162842, "loss": 1.0104, "nll_loss": 1.043554663658142, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.07858886569738388, "rewards/margins": 0.111572265625, "rewards/rejected": -0.19013671576976776, "step": 3370 }, { "epoch": 0.436607892527288, "grad_norm": 1.4691098191321261, "learning_rate": 1.376041832307563e-06, "log_odds_chosen": 1.4033203125, "log_odds_ratio": -0.43999022245407104, "logits/chosen": -1.224218726158142, "logits/rejected": -1.0353515148162842, "logps/chosen": -0.758593738079071, "logps/rejected": -1.730859398841858, "loss": 0.9915, "nll_loss": 0.9267578125, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07591553032398224, "rewards/margins": 0.09709472954273224, "rewards/rejected": -0.17292480170726776, "step": 3380 }, { "epoch": 0.4378996318542918, "grad_norm": 1.5769081578967865, "learning_rate": 1.3740107731454524e-06, "log_odds_chosen": 1.360107421875, "log_odds_ratio": -0.4132080078125, "logits/chosen": -1.2521483898162842, "logits/rejected": -1.025781273841858, "logps/chosen": -0.7164062261581421, "logps/rejected": -1.6728515625, "loss": 0.9721, "nll_loss": 0.9189453125, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07159423828125, "rewards/margins": 0.09572906792163849, "rewards/rejected": -0.16740722954273224, "step": 3390 }, { "epoch": 0.43919137118129564, "grad_norm": 1.5895196057493086, "learning_rate": 1.3719886811400705e-06, "log_odds_chosen": 1.4857909679412842, "log_odds_ratio": -0.43706053495407104, "logits/chosen": -1.1318359375, "logits/rejected": -1.0166015625, "logps/chosen": -0.767382800579071, "logps/rejected": -1.8742187023162842, "loss": 0.9792, "nll_loss": 0.8919922113418579, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07666015625, "rewards/margins": 0.11079101264476776, "rewards/rejected": -0.18742676079273224, "step": 3400 }, { "epoch": 0.4404831105082994, "grad_norm": 1.4264229184390609, "learning_rate": 1.3699754905014834e-06, "log_odds_chosen": 1.683984398841858, "log_odds_ratio": -0.33134764432907104, "logits/chosen": -1.313085913658142, "logits/rejected": -0.988476574420929, "logps/chosen": -0.727343738079071, "logps/rejected": -1.935156226158142, "loss": 0.9851, "nll_loss": 0.9525390863418579, "rewards/accuracies": 0.8812500238418579, "rewards/chosen": -0.07279052585363388, "rewards/margins": 0.12055663764476776, "rewards/rejected": -0.19340820610523224, "step": 3410 }, { "epoch": 0.44177484983530324, "grad_norm": 1.5944561487582725, "learning_rate": 1.3679711361135388e-06, "log_odds_chosen": 1.188867211341858, "log_odds_ratio": -0.4444824159145355, "logits/chosen": -1.158789038658142, "logits/rejected": -1.01953125, "logps/chosen": -0.7587890625, "logps/rejected": -1.613671898841858, "loss": 0.9932, "nll_loss": 0.9876953363418579, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07579346001148224, "rewards/margins": 0.08562012016773224, "rewards/rejected": -0.16147461533546448, "step": 3420 }, { "epoch": 0.44306658916230707, "grad_norm": 1.5607214327080359, "learning_rate": 1.3659755535250212e-06, "log_odds_chosen": 1.2274658679962158, "log_odds_ratio": -0.45024412870407104, "logits/chosen": -1.273046851158142, "logits/rejected": -1.0730469226837158, "logps/chosen": -0.6767578125, "logps/rejected": -1.564453125, "loss": 1.0148, "nll_loss": 0.856640636920929, "rewards/accuracies": 0.75, "rewards/chosen": -0.06768798828125, "rewards/margins": 0.08869628608226776, "rewards/rejected": -0.15639647841453552, "step": 3430 }, { "epoch": 0.44435832848931084, "grad_norm": 1.946900712613248, "learning_rate": 1.3639886789409469e-06, "log_odds_chosen": 1.2673461437225342, "log_odds_ratio": -0.4585937559604645, "logits/chosen": -1.2781250476837158, "logits/rejected": -1.0427734851837158, "logps/chosen": -0.789843738079071, "logps/rejected": -1.744140625, "loss": 1.0153, "nll_loss": 0.9462890625, "rewards/accuracies": 0.75, "rewards/chosen": -0.07900390774011612, "rewards/margins": 0.09552917629480362, "rewards/rejected": -0.17446288466453552, "step": 3440 }, { "epoch": 0.44565006781631467, "grad_norm": 1.8064466076001375, "learning_rate": 1.3620104492139977e-06, "log_odds_chosen": 1.329492211341858, "log_odds_ratio": -0.45048826932907104, "logits/chosen": -1.197265625, "logits/rejected": -0.9955078363418579, "logps/chosen": -0.748730480670929, "logps/rejected": -1.748437523841858, "loss": 1.0072, "nll_loss": 0.970703125, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07485351711511612, "rewards/margins": 0.09989013522863388, "rewards/rejected": -0.17485351860523224, "step": 3450 }, { "epoch": 0.4469418071433185, "grad_norm": 1.5834900703149317, "learning_rate": 1.3600408018360918e-06, "log_odds_chosen": 1.181542992591858, "log_odds_ratio": -0.42534178495407104, "logits/chosen": -1.3029296398162842, "logits/rejected": -1.1005859375, "logps/chosen": -0.747851550579071, "logps/rejected": -1.588281273841858, "loss": 0.9978, "nll_loss": 0.9234374761581421, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07480468600988388, "rewards/margins": 0.08403930813074112, "rewards/rejected": -0.15886230766773224, "step": 3460 }, { "epoch": 0.44823354647032226, "grad_norm": 1.6682907659008914, "learning_rate": 1.3580796749300878e-06, "log_odds_chosen": 1.4191405773162842, "log_odds_ratio": -0.41987305879592896, "logits/chosen": -1.3595702648162842, "logits/rejected": -1.1365234851837158, "logps/chosen": -0.75439453125, "logps/rejected": -1.8046875, "loss": 0.9446, "nll_loss": 0.9306640625, "rewards/accuracies": 0.75, "rewards/chosen": -0.07542724907398224, "rewards/margins": 0.10507812350988388, "rewards/rejected": -0.18061523139476776, "step": 3470 }, { "epoch": 0.4495252857973261, "grad_norm": 1.9590984426955198, "learning_rate": 1.3561270072416209e-06, "log_odds_chosen": 1.522363305091858, "log_odds_ratio": -0.38847655057907104, "logits/chosen": -1.3064453601837158, "logits/rejected": -1.1121094226837158, "logps/chosen": -0.70849609375, "logps/rejected": -1.802148461341858, "loss": 0.97, "nll_loss": 0.8902343511581421, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07088623195886612, "rewards/margins": 0.10939331352710724, "rewards/rejected": -0.18034668266773224, "step": 3480 }, { "epoch": 0.4508170251243299, "grad_norm": 1.5367845973776255, "learning_rate": 1.3541827381310652e-06, "log_odds_chosen": 1.468359351158142, "log_odds_ratio": -0.3921875059604645, "logits/chosen": -1.2546875476837158, "logits/rejected": -1.0363280773162842, "logps/chosen": -0.72900390625, "logps/rejected": -1.783203125, "loss": 0.9764, "nll_loss": 0.9673827886581421, "rewards/accuracies": 0.8125, "rewards/chosen": -0.0728759765625, "rewards/margins": 0.10546875, "rewards/rejected": -0.17841796576976776, "step": 3490 }, { "epoch": 0.45210876445133374, "grad_norm": 1.4975918544029976, "learning_rate": 1.3522468075656264e-06, "log_odds_chosen": 1.7684447765350342, "log_odds_ratio": -0.3681640625, "logits/chosen": -1.2958984375, "logits/rejected": -0.9927734136581421, "logps/chosen": -0.758593738079071, "logps/rejected": -2.089062452316284, "loss": 0.995, "nll_loss": 0.960156261920929, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07591553032398224, "rewards/margins": 0.13293762505054474, "rewards/rejected": -0.20883789658546448, "step": 3500 }, { "epoch": 0.4534005037783375, "grad_norm": 1.8392749892168345, "learning_rate": 1.3503191561115553e-06, "log_odds_chosen": 1.729101538658142, "log_odds_ratio": -0.3299316465854645, "logits/chosen": -1.3603515625, "logits/rejected": -1.070898413658142, "logps/chosen": -0.669140636920929, "logps/rejected": -1.9343750476837158, "loss": 0.9729, "nll_loss": 0.9056640863418579, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.06694336235523224, "rewards/margins": 0.12644653022289276, "rewards/rejected": -0.19345703721046448, "step": 3510 }, { "epoch": 0.45469224310534134, "grad_norm": 1.5708301563171019, "learning_rate": 1.348399724926484e-06, "log_odds_chosen": 1.309667944908142, "log_odds_ratio": -0.4463867247104645, "logits/chosen": -1.176367163658142, "logits/rejected": -1.0146484375, "logps/chosen": -0.73828125, "logps/rejected": -1.673828125, "loss": 0.9458, "nll_loss": 0.925585925579071, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07380370795726776, "rewards/margins": 0.09362182766199112, "rewards/rejected": -0.16767577826976776, "step": 3520 }, { "epoch": 0.45598398243234517, "grad_norm": 10.822215354023651, "learning_rate": 1.346488455751882e-06, "log_odds_chosen": 1.657812476158142, "log_odds_ratio": -0.3833984434604645, "logits/chosen": -1.347265601158142, "logits/rejected": -1.0673828125, "logps/chosen": -0.739453136920929, "logps/rejected": -1.965234398841858, "loss": 0.9682, "nll_loss": 0.913867175579071, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07388915866613388, "rewards/margins": 0.12266846001148224, "rewards/rejected": -0.196533203125, "step": 3530 }, { "epoch": 0.45727572175934894, "grad_norm": 1.5064817100665473, "learning_rate": 1.3445852909056286e-06, "log_odds_chosen": 1.7374999523162842, "log_odds_ratio": -0.3180175721645355, "logits/chosen": -1.299414038658142, "logits/rejected": -1.0625, "logps/chosen": -0.691601574420929, "logps/rejected": -1.9171874523162842, "loss": 0.9808, "nll_loss": 0.893359363079071, "rewards/accuracies": 0.8687499761581421, "rewards/chosen": -0.06911621242761612, "rewards/margins": 0.12258300930261612, "rewards/rejected": -0.191650390625, "step": 3540 }, { "epoch": 0.45856746108635277, "grad_norm": 2.0338982417265328, "learning_rate": 1.3426901732747024e-06, "log_odds_chosen": 1.295019507408142, "log_odds_ratio": -0.4264160096645355, "logits/chosen": -1.216796875, "logits/rejected": -1.053125023841858, "logps/chosen": -0.8638671636581421, "logps/rejected": -1.802734375, "loss": 0.9915, "nll_loss": 0.988574206829071, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.08629150688648224, "rewards/margins": 0.09398193657398224, "rewards/rejected": -0.18017578125, "step": 3550 }, { "epoch": 0.4598592004133566, "grad_norm": 1.5442721340441574, "learning_rate": 1.3408030463079818e-06, "log_odds_chosen": 1.4619140625, "log_odds_ratio": -0.415771484375, "logits/chosen": -1.31640625, "logits/rejected": -1.041406273841858, "logps/chosen": -0.796679675579071, "logps/rejected": -1.904687523841858, "loss": 0.9902, "nll_loss": 0.943164050579071, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07969971001148224, "rewards/margins": 0.11088867485523224, "rewards/rejected": -0.19074706733226776, "step": 3560 }, { "epoch": 0.4611509397403604, "grad_norm": 1.6511161926682998, "learning_rate": 1.3389238540091568e-06, "log_odds_chosen": 1.4822266101837158, "log_odds_ratio": -0.364501953125, "logits/chosen": -1.2468750476837158, "logits/rejected": -1.034570336341858, "logps/chosen": -0.7601562738418579, "logps/rejected": -1.8359375, "loss": 1.0021, "nll_loss": 0.9892578125, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -0.07597656548023224, "rewards/margins": 0.10747070610523224, "rewards/rejected": -0.18359375, "step": 3570 }, { "epoch": 0.4624426790673642, "grad_norm": 1.6704847548055055, "learning_rate": 1.337052540929751e-06, "log_odds_chosen": 1.5302734375, "log_odds_ratio": -0.36748045682907104, "logits/chosen": -1.113867163658142, "logits/rejected": -0.9564453363418579, "logps/chosen": -0.726757824420929, "logps/rejected": -1.8337891101837158, "loss": 0.9826, "nll_loss": 0.9755859375, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.0726318359375, "rewards/margins": 0.11074218899011612, "rewards/rejected": -0.18339844048023224, "step": 3580 }, { "epoch": 0.463734418394368, "grad_norm": 1.7927372955274787, "learning_rate": 1.33518905216225e-06, "log_odds_chosen": 1.5802733898162842, "log_odds_ratio": -0.3642578125, "logits/chosen": -1.251953125, "logits/rejected": -1.0265624523162842, "logps/chosen": -0.715624988079071, "logps/rejected": -1.8503906726837158, "loss": 0.9714, "nll_loss": 0.960156261920929, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.071533203125, "rewards/margins": 0.11337890475988388, "rewards/rejected": -0.18496093153953552, "step": 3590 }, { "epoch": 0.46502615772137185, "grad_norm": 1.6464046185979526, "learning_rate": 1.3333333333333332e-06, "log_odds_chosen": 1.6052734851837158, "log_odds_ratio": -0.3460449278354645, "logits/chosen": -1.400781273841858, "logits/rejected": -1.055078148841858, "logps/chosen": -0.718554675579071, "logps/rejected": -1.877343773841858, "loss": 0.9996, "nll_loss": 0.916015625, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07185058295726776, "rewards/margins": 0.11573486030101776, "rewards/rejected": -0.18759766221046448, "step": 3600 }, { "epoch": 0.4663178970483756, "grad_norm": 1.9312834775052827, "learning_rate": 1.3314853305972122e-06, "log_odds_chosen": 1.324121117591858, "log_odds_ratio": -0.41923826932907104, "logits/chosen": -1.13671875, "logits/rejected": -0.9970703125, "logps/chosen": -0.7392578125, "logps/rejected": -1.653710961341858, "loss": 0.9768, "nll_loss": 0.9449218511581421, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07392577826976776, "rewards/margins": 0.09138794243335724, "rewards/rejected": -0.165283203125, "step": 3610 }, { "epoch": 0.46760963637537944, "grad_norm": 1.9891494392053055, "learning_rate": 1.3296449906290671e-06, "log_odds_chosen": 1.204980492591858, "log_odds_ratio": -0.4417480528354645, "logits/chosen": -1.2517578601837158, "logits/rejected": -1.107812523841858, "logps/chosen": -0.758984386920929, "logps/rejected": -1.648828148841858, "loss": 0.9986, "nll_loss": 1.002539038658142, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07586669921875, "rewards/margins": 0.088958740234375, "rewards/rejected": -0.16494140028953552, "step": 3620 }, { "epoch": 0.46890137570238327, "grad_norm": 9.661617872243768, "learning_rate": 1.3278122606185844e-06, "log_odds_chosen": 1.480078101158142, "log_odds_ratio": -0.394287109375, "logits/chosen": -1.2937500476837158, "logits/rejected": -1.0714843273162842, "logps/chosen": -0.710156261920929, "logps/rejected": -1.78515625, "loss": 0.9949, "nll_loss": 0.9234374761581421, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.07099609076976776, "rewards/margins": 0.10740967094898224, "rewards/rejected": -0.17841796576976776, "step": 3630 }, { "epoch": 0.47019311502938704, "grad_norm": 1.563972260148418, "learning_rate": 1.3259870882635918e-06, "log_odds_chosen": 1.7492187023162842, "log_odds_ratio": -0.3333496153354645, "logits/chosen": -1.3972656726837158, "logits/rejected": -1.099218726158142, "logps/chosen": -0.727246105670929, "logps/rejected": -2.0238280296325684, "loss": 0.9828, "nll_loss": 0.922656238079071, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -0.07277832180261612, "rewards/margins": 0.12969970703125, "rewards/rejected": -0.202392578125, "step": 3640 }, { "epoch": 0.47148485435639087, "grad_norm": 1.6261822344604553, "learning_rate": 1.3241694217637886e-06, "log_odds_chosen": 1.506250023841858, "log_odds_ratio": -0.35009765625, "logits/chosen": -1.2687499523162842, "logits/rejected": -1.046289086341858, "logps/chosen": -0.686816394329071, "logps/rejected": -1.73828125, "loss": 0.9811, "nll_loss": 0.902539074420929, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.06868896633386612, "rewards/margins": 0.10502929985523224, "rewards/rejected": -0.17390136420726776, "step": 3650 }, { "epoch": 0.4727765936833947, "grad_norm": 1.5306094079513928, "learning_rate": 1.3223592098145723e-06, "log_odds_chosen": 1.362890601158142, "log_odds_ratio": -0.4374023377895355, "logits/chosen": -1.264062523841858, "logits/rejected": -1.050195336341858, "logps/chosen": -0.7564452886581421, "logps/rejected": -1.7625000476837158, "loss": 0.9631, "nll_loss": 0.930468738079071, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07564697414636612, "rewards/margins": 0.10084228217601776, "rewards/rejected": -0.1763916015625, "step": 3660 }, { "epoch": 0.4740683330103985, "grad_norm": 1.9890572232639956, "learning_rate": 1.3205564016009555e-06, "log_odds_chosen": 1.374609351158142, "log_odds_ratio": -0.436767578125, "logits/chosen": -1.2498047351837158, "logits/rejected": -1.08203125, "logps/chosen": -0.767773449420929, "logps/rejected": -1.7785155773162842, "loss": 0.9848, "nll_loss": 0.943554699420929, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07679443061351776, "rewards/margins": 0.10096435248851776, "rewards/rejected": -0.17768554389476776, "step": 3670 }, { "epoch": 0.4753600723374023, "grad_norm": 1.6751524808376392, "learning_rate": 1.318760946791574e-06, "log_odds_chosen": 1.462499976158142, "log_odds_ratio": -0.42333984375, "logits/chosen": -1.1130859851837158, "logits/rejected": -1.001562476158142, "logps/chosen": -0.7181640863418579, "logps/rejected": -1.8195312023162842, "loss": 0.9776, "nll_loss": 0.8794921636581421, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07185058295726776, "rewards/margins": 0.11024780571460724, "rewards/rejected": -0.181884765625, "step": 3680 }, { "epoch": 0.4766518116644061, "grad_norm": 1.4818300146646157, "learning_rate": 1.316972795532786e-06, "log_odds_chosen": 1.6818358898162842, "log_odds_ratio": -0.33989256620407104, "logits/chosen": -1.283593773841858, "logits/rejected": -1.0583984851837158, "logps/chosen": -0.71923828125, "logps/rejected": -1.9562499523162842, "loss": 0.9722, "nll_loss": 0.9150390625, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07188721001148224, "rewards/margins": 0.12364502251148224, "rewards/rejected": -0.19562987983226776, "step": 3690 }, { "epoch": 0.47794355099140995, "grad_norm": 1.6905819193403553, "learning_rate": 1.3151918984428582e-06, "log_odds_chosen": 1.639257788658142, "log_odds_ratio": -0.3614257872104645, "logits/chosen": -1.27734375, "logits/rejected": -1.065039038658142, "logps/chosen": -0.740234375, "logps/rejected": -1.932031273841858, "loss": 0.9599, "nll_loss": 0.8980468511581421, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07399902492761612, "rewards/margins": 0.11922607570886612, "rewards/rejected": -0.19321289658546448, "step": 3700 }, { "epoch": 0.4792352903184137, "grad_norm": 1.5854113641156875, "learning_rate": 1.313418206606237e-06, "log_odds_chosen": 1.3996093273162842, "log_odds_ratio": -0.414306640625, "logits/chosen": -1.2830078601837158, "logits/rejected": -1.0802733898162842, "logps/chosen": -0.684374988079071, "logps/rejected": -1.662500023841858, "loss": 0.9791, "nll_loss": 0.8685547113418579, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.06844482570886612, "rewards/margins": 0.09786377102136612, "rewards/rejected": -0.16630859673023224, "step": 3710 }, { "epoch": 0.48052702964541755, "grad_norm": 1.6239080007040285, "learning_rate": 1.3116516715679057e-06, "log_odds_chosen": 1.3839843273162842, "log_odds_ratio": -0.40498048067092896, "logits/chosen": -1.289453148841858, "logits/rejected": -1.112890601158142, "logps/chosen": -0.745312511920929, "logps/rejected": -1.7216796875, "loss": 0.9557, "nll_loss": 0.949414074420929, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.074462890625, "rewards/margins": 0.09761963039636612, "rewards/rejected": -0.172119140625, "step": 3720 }, { "epoch": 0.4818187689724214, "grad_norm": 1.6771426969508356, "learning_rate": 1.3098922453278258e-06, "log_odds_chosen": 1.171972632408142, "log_odds_ratio": -0.43574219942092896, "logits/chosen": -1.291601538658142, "logits/rejected": -1.116796851158142, "logps/chosen": -0.7010742425918579, "logps/rejected": -1.496484398841858, "loss": 0.9386, "nll_loss": 0.903515636920929, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07011719048023224, "rewards/margins": 0.07961425930261612, "rewards/rejected": -0.149658203125, "step": 3730 }, { "epoch": 0.4831105082994252, "grad_norm": 4.290459544391673, "learning_rate": 1.3081398803354573e-06, "log_odds_chosen": 1.739843726158142, "log_odds_ratio": -0.36572265625, "logits/chosen": -1.2585937976837158, "logits/rejected": -1.087890625, "logps/chosen": -0.7457031011581421, "logps/rejected": -2.0406250953674316, "loss": 0.9685, "nll_loss": 0.9154297113418579, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.07463379204273224, "rewards/margins": 0.12946777045726776, "rewards/rejected": -0.20419922471046448, "step": 3740 }, { "epoch": 0.484402247626429, "grad_norm": 1.8444294877099479, "learning_rate": 1.3063945294843617e-06, "log_odds_chosen": 1.2117919921875, "log_odds_ratio": -0.44316405057907104, "logits/chosen": -1.278710961341858, "logits/rejected": -1.074804663658142, "logps/chosen": -0.7578125, "logps/rejected": -1.6457030773162842, "loss": 0.9453, "nll_loss": 0.922070324420929, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07585449516773224, "rewards/margins": 0.08876800537109375, "rewards/rejected": -0.16459961235523224, "step": 3750 }, { "epoch": 0.4856939869534328, "grad_norm": 2.100214613837535, "learning_rate": 1.3046561461068843e-06, "log_odds_chosen": 1.4404296875, "log_odds_ratio": -0.42402344942092896, "logits/chosen": -1.270898461341858, "logits/rejected": -1.0693359375, "logps/chosen": -0.737109363079071, "logps/rejected": -1.79296875, "loss": 0.9706, "nll_loss": 0.994824230670929, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07366943359375, "rewards/margins": 0.10550536960363388, "rewards/rejected": -0.17922362685203552, "step": 3760 }, { "epoch": 0.4869857262804366, "grad_norm": 1.7129865512806293, "learning_rate": 1.3029246839689124e-06, "log_odds_chosen": 1.615234375, "log_odds_ratio": -0.390625, "logits/chosen": -1.353124976158142, "logits/rejected": -1.149999976158142, "logps/chosen": -0.7398437261581421, "logps/rejected": -1.9230468273162842, "loss": 0.9636, "nll_loss": 0.90625, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07401122897863388, "rewards/margins": 0.11821899563074112, "rewards/rejected": -0.19223633408546448, "step": 3770 }, { "epoch": 0.4882774656074404, "grad_norm": 2.0378856053337464, "learning_rate": 1.3012000972647109e-06, "log_odds_chosen": 1.659082055091858, "log_odds_ratio": -0.38300782442092896, "logits/chosen": -1.26171875, "logits/rejected": -1.0486328601837158, "logps/chosen": -0.726757824420929, "logps/rejected": -1.970703125, "loss": 0.9932, "nll_loss": 0.9671875238418579, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07269287109375, "rewards/margins": 0.124481201171875, "rewards/rejected": -0.19716796278953552, "step": 3780 }, { "epoch": 0.4895692049344442, "grad_norm": 1.6560517751635104, "learning_rate": 1.299482340611832e-06, "log_odds_chosen": 1.6589844226837158, "log_odds_ratio": -0.3722167909145355, "logits/chosen": -1.2373046875, "logits/rejected": -1.021093726158142, "logps/chosen": -0.732617199420929, "logps/rejected": -1.9382812976837158, "loss": 0.991, "nll_loss": 0.9781249761581421, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07326660305261612, "rewards/margins": 0.12054443359375, "rewards/rejected": -0.19377441704273224, "step": 3790 }, { "epoch": 0.49086094426144805, "grad_norm": 7.633727592655389, "learning_rate": 1.2977713690461003e-06, "log_odds_chosen": 1.539697289466858, "log_odds_ratio": -0.4036621153354645, "logits/chosen": -1.259765625, "logits/rejected": -1.078125, "logps/chosen": -0.8271484375, "logps/rejected": -1.990234375, "loss": 0.9671, "nll_loss": 1.021093726158142, "rewards/accuracies": 0.78125, "rewards/chosen": -0.08278808742761612, "rewards/margins": 0.11631164699792862, "rewards/rejected": -0.198974609375, "step": 3800 }, { "epoch": 0.4921526835884519, "grad_norm": 1.6293300737992338, "learning_rate": 1.296067138016669e-06, "log_odds_chosen": 1.5295898914337158, "log_odds_ratio": -0.3731933534145355, "logits/chosen": -1.3302733898162842, "logits/rejected": -1.094335913658142, "logps/chosen": -0.669140636920929, "logps/rejected": -1.7859375476837158, "loss": 0.9839, "nll_loss": 0.8970702886581421, "rewards/accuracies": 0.8125, "rewards/chosen": -0.06694336235523224, "rewards/margins": 0.11159972846508026, "rewards/rejected": -0.17856445908546448, "step": 3810 }, { "epoch": 0.49344442291545565, "grad_norm": 1.8527145758168402, "learning_rate": 1.294369603381147e-06, "log_odds_chosen": 1.337304711341858, "log_odds_ratio": -0.4295410215854645, "logits/chosen": -1.29296875, "logits/rejected": -1.0671875476837158, "logps/chosen": -0.7134765386581421, "logps/rejected": -1.667578101158142, "loss": 0.9588, "nll_loss": 0.90625, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07133789360523224, "rewards/margins": 0.09539184719324112, "rewards/rejected": -0.16669921576976776, "step": 3820 }, { "epoch": 0.4947361622424595, "grad_norm": 1.5132568465612, "learning_rate": 1.2926787214007981e-06, "log_odds_chosen": 1.443945288658142, "log_odds_ratio": -0.3914550840854645, "logits/chosen": -1.3347656726837158, "logits/rejected": -1.1123046875, "logps/chosen": -0.6856445074081421, "logps/rejected": -1.7091796398162842, "loss": 0.9792, "nll_loss": 0.947460949420929, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.06854248046875, "rewards/margins": 0.10241089016199112, "rewards/rejected": -0.17097167670726776, "step": 3830 }, { "epoch": 0.4960279015694633, "grad_norm": 1.5774562875666789, "learning_rate": 1.2909944487358056e-06, "log_odds_chosen": 1.307836890220642, "log_odds_ratio": -0.41044920682907104, "logits/chosen": -1.1892578601837158, "logits/rejected": -1.013281226158142, "logps/chosen": -0.71533203125, "logps/rejected": -1.6201171875, "loss": 0.9634, "nll_loss": 0.931445300579071, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07154540717601776, "rewards/margins": 0.09071274101734161, "rewards/rejected": -0.16230468451976776, "step": 3840 }, { "epoch": 0.4973196408964671, "grad_norm": 1.6710527826349575, "learning_rate": 1.2893167424406084e-06, "log_odds_chosen": 1.5478515625, "log_odds_ratio": -0.37836915254592896, "logits/chosen": -1.216796875, "logits/rejected": -0.9771484136581421, "logps/chosen": -0.720703125, "logps/rejected": -1.855078101158142, "loss": 0.9396, "nll_loss": 0.9150390625, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07196044921875, "rewards/margins": 0.11341552436351776, "rewards/rejected": -0.18540039658546448, "step": 3850 }, { "epoch": 0.4986113802234709, "grad_norm": 1.654640734200055, "learning_rate": 1.2876455599593008e-06, "log_odds_chosen": 1.214746117591858, "log_odds_ratio": -0.4530273377895355, "logits/chosen": -1.2744140625, "logits/rejected": -1.093164086341858, "logps/chosen": -0.7601562738418579, "logps/rejected": -1.651953101158142, "loss": 0.9607, "nll_loss": 0.953906238079071, "rewards/accuracies": 0.75, "rewards/chosen": -0.0760498046875, "rewards/margins": 0.08902587741613388, "rewards/rejected": -0.16513672471046448, "step": 3860 }, { "epoch": 0.49990311955047473, "grad_norm": 1.794492198439638, "learning_rate": 1.285980859121099e-06, "log_odds_chosen": 1.396484375, "log_odds_ratio": -0.40141600370407104, "logits/chosen": -1.1886718273162842, "logits/rejected": -1.044921875, "logps/chosen": -0.7486327886581421, "logps/rejected": -1.72265625, "loss": 0.9691, "nll_loss": 1.0076172351837158, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07480468600988388, "rewards/margins": 0.09727325290441513, "rewards/rejected": -0.17209473252296448, "step": 3870 }, { "epoch": 0.5011948588774785, "grad_norm": 1.9048132737433332, "learning_rate": 1.2843225981358712e-06, "log_odds_chosen": 1.25146484375, "log_odds_ratio": -0.4400878846645355, "logits/chosen": -1.186914086341858, "logits/rejected": -1.027929663658142, "logps/chosen": -0.754687488079071, "logps/rejected": -1.629296898841858, "loss": 0.9612, "nll_loss": 0.9076172113418579, "rewards/accuracies": 0.75, "rewards/chosen": -0.07550048828125, "rewards/margins": 0.08762817084789276, "rewards/rejected": -0.16313476860523224, "step": 3880 }, { "epoch": 0.5024865982044824, "grad_norm": 1.723197788437254, "learning_rate": 1.2826707355897317e-06, "log_odds_chosen": 1.443750023841858, "log_odds_ratio": -0.383056640625, "logits/chosen": -1.3359375, "logits/rejected": -1.10546875, "logps/chosen": -0.7367187738418579, "logps/rejected": -1.764062523841858, "loss": 0.9326, "nll_loss": 0.9017578363418579, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07366943359375, "rewards/margins": 0.10273437201976776, "rewards/rejected": -0.17656250298023224, "step": 3890 }, { "epoch": 0.5037783375314862, "grad_norm": 1.921703740563146, "learning_rate": 1.281025230440697e-06, "log_odds_chosen": 1.5695312023162842, "log_odds_ratio": -0.3865722715854645, "logits/chosen": -1.1396484375, "logits/rejected": -0.989453136920929, "logps/chosen": -0.745312511920929, "logps/rejected": -1.8605468273162842, "loss": 0.9646, "nll_loss": 0.9380859136581421, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07454834133386612, "rewards/margins": 0.11152343451976776, "rewards/rejected": -0.18598632514476776, "step": 3900 }, { "epoch": 0.5050700768584899, "grad_norm": 1.5901434623404858, "learning_rate": 1.2793860420144025e-06, "log_odds_chosen": 1.3917968273162842, "log_odds_ratio": -0.4380859434604645, "logits/chosen": -1.132226586341858, "logits/rejected": -0.9947265386581421, "logps/chosen": -0.7291015386581421, "logps/rejected": -1.7470703125, "loss": 0.971, "nll_loss": 0.8880859613418579, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07292480766773224, "rewards/margins": 0.10167236626148224, "rewards/rejected": -0.174560546875, "step": 3910 }, { "epoch": 0.5063618161854938, "grad_norm": 1.6583533669306973, "learning_rate": 1.2777531299998798e-06, "log_odds_chosen": 1.51953125, "log_odds_ratio": -0.37822264432907104, "logits/chosen": -1.324609398841858, "logits/rejected": -1.132226586341858, "logps/chosen": -0.7906249761581421, "logps/rejected": -1.9191405773162842, "loss": 0.9573, "nll_loss": 0.9593750238418579, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07908935844898224, "rewards/margins": 0.11300048977136612, "rewards/rejected": -0.19189453125, "step": 3920 }, { "epoch": 0.5076535555124976, "grad_norm": 1.759715289142672, "learning_rate": 1.2761264544453928e-06, "log_odds_chosen": 1.302343726158142, "log_odds_ratio": -0.40727537870407104, "logits/chosen": -1.267578125, "logits/rejected": -1.1169922351837158, "logps/chosen": -0.739453136920929, "logps/rejected": -1.648046851158142, "loss": 0.9887, "nll_loss": 0.8998047113418579, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07391357421875, "rewards/margins": 0.09085693210363388, "rewards/rejected": -0.1649169921875, "step": 3930 }, { "epoch": 0.5089452948395013, "grad_norm": 1.702777392436381, "learning_rate": 1.2745059757543324e-06, "log_odds_chosen": 1.4255859851837158, "log_odds_ratio": -0.40361326932907104, "logits/chosen": -1.313085913658142, "logits/rejected": -1.052734375, "logps/chosen": -0.7525390386581421, "logps/rejected": -1.7800781726837158, "loss": 1.0051, "nll_loss": 0.9945312738418579, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07530517876148224, "rewards/margins": 0.10268554836511612, "rewards/rejected": -0.17795410752296448, "step": 3940 }, { "epoch": 0.5102370341665052, "grad_norm": 1.708938372854009, "learning_rate": 1.272891654681168e-06, "log_odds_chosen": 1.4802734851837158, "log_odds_ratio": -0.40239256620407104, "logits/chosen": -1.2628905773162842, "logits/rejected": -1.1023437976837158, "logps/chosen": -0.734570324420929, "logps/rejected": -1.7761719226837158, "loss": 0.9565, "nll_loss": 0.921679675579071, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.07351074367761612, "rewards/margins": 0.10418701171875, "rewards/rejected": -0.17753906548023224, "step": 3950 }, { "epoch": 0.511528773493509, "grad_norm": 1.664215034166162, "learning_rate": 1.2712834523274563e-06, "log_odds_chosen": 1.6281859874725342, "log_odds_ratio": -0.4032226502895355, "logits/chosen": -1.2742187976837158, "logits/rejected": -1.0419921875, "logps/chosen": -0.789843738079071, "logps/rejected": -2.0283203125, "loss": 0.9736, "nll_loss": 1.003515601158142, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07895507663488388, "rewards/margins": 0.12362518161535263, "rewards/rejected": -0.20263671875, "step": 3960 }, { "epoch": 0.5128205128205128, "grad_norm": 1.5671953083599743, "learning_rate": 1.2696813301379032e-06, "log_odds_chosen": 1.3952147960662842, "log_odds_ratio": -0.38935548067092896, "logits/chosen": -1.2724609375, "logits/rejected": -1.0867187976837158, "logps/chosen": -0.7577148675918579, "logps/rejected": -1.7587890625, "loss": 0.9498, "nll_loss": 0.900585949420929, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07583007961511612, "rewards/margins": 0.1000518798828125, "rewards/rejected": -0.17600098252296448, "step": 3970 }, { "epoch": 0.5141122521475167, "grad_norm": 1.6899342194702278, "learning_rate": 1.2680852498964829e-06, "log_odds_chosen": 1.682226538658142, "log_odds_ratio": -0.3612304627895355, "logits/chosen": -1.324804663658142, "logits/rejected": -1.0380859375, "logps/chosen": -0.747851550579071, "logps/rejected": -2.001171827316284, "loss": 0.9795, "nll_loss": 0.896679699420929, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.07484130561351776, "rewards/margins": 0.12528076767921448, "rewards/rejected": -0.20012207329273224, "step": 3980 }, { "epoch": 0.5154039914745204, "grad_norm": 2.308014510578964, "learning_rate": 1.266495173722607e-06, "log_odds_chosen": 1.508142113685608, "log_odds_ratio": -0.419921875, "logits/chosen": -1.404687523841858, "logits/rejected": -1.166406273841858, "logps/chosen": -0.726855456829071, "logps/rejected": -1.833984375, "loss": 0.9486, "nll_loss": 0.836132824420929, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07266845554113388, "rewards/margins": 0.11069945991039276, "rewards/rejected": -0.18325194716453552, "step": 3990 }, { "epoch": 0.5166957308015242, "grad_norm": 1.9106146843217657, "learning_rate": 1.2649110640673517e-06, "log_odds_chosen": 1.5413086414337158, "log_odds_ratio": -0.4026855528354645, "logits/chosen": -1.2267577648162842, "logits/rejected": -0.9599609375, "logps/chosen": -0.7193359136581421, "logps/rejected": -1.845312476158142, "loss": 0.9347, "nll_loss": 0.910351574420929, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07187499850988388, "rewards/margins": 0.11249389499425888, "rewards/rejected": -0.1844482421875, "step": 4000 }, { "epoch": 0.5179874701285281, "grad_norm": 1.8268150921521455, "learning_rate": 1.2633328837097308e-06, "log_odds_chosen": 1.5032227039337158, "log_odds_ratio": -0.39741212129592896, "logits/chosen": -1.285546898841858, "logits/rejected": -1.0578124523162842, "logps/chosen": -0.7796875238418579, "logps/rejected": -1.870703101158142, "loss": 0.969, "nll_loss": 1.003515601158142, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07799072563648224, "rewards/margins": 0.10906372219324112, "rewards/rejected": -0.18691405653953552, "step": 4010 }, { "epoch": 0.5192792094555319, "grad_norm": 1.7339150863080335, "learning_rate": 1.2617605957530233e-06, "log_odds_chosen": 1.6003906726837158, "log_odds_ratio": -0.3857421875, "logits/chosen": -1.2353515625, "logits/rejected": -0.9755859375, "logps/chosen": -0.7574218511581421, "logps/rejected": -1.9578125476837158, "loss": 0.9557, "nll_loss": 0.9638671875, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07564697414636612, "rewards/margins": 0.12000732123851776, "rewards/rejected": -0.19558104872703552, "step": 4020 }, { "epoch": 0.5205709487825357, "grad_norm": 1.7986431899614321, "learning_rate": 1.2601941636211516e-06, "log_odds_chosen": 1.5583984851837158, "log_odds_ratio": -0.3858886659145355, "logits/chosen": -1.289453148841858, "logits/rejected": -1.0568358898162842, "logps/chosen": -0.7880859375, "logps/rejected": -1.968359351158142, "loss": 0.9681, "nll_loss": 0.869921863079071, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07882080227136612, "rewards/margins": 0.11789550632238388, "rewards/rejected": -0.1968994140625, "step": 4030 }, { "epoch": 0.5218626881095395, "grad_norm": 1.7077146069754672, "learning_rate": 1.2586335510551052e-06, "log_odds_chosen": 1.4246094226837158, "log_odds_ratio": -0.3975585997104645, "logits/chosen": -1.326562523841858, "logits/rejected": -1.1326172351837158, "logps/chosen": -0.7496093511581421, "logps/rejected": -1.7341797351837158, "loss": 0.9741, "nll_loss": 0.8863281011581421, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07490234076976776, "rewards/margins": 0.09852294623851776, "rewards/rejected": -0.17341308295726776, "step": 4040 }, { "epoch": 0.5231544274365433, "grad_norm": 1.6564549248139329, "learning_rate": 1.2570787221094177e-06, "log_odds_chosen": 1.673730492591858, "log_odds_ratio": -0.34833985567092896, "logits/chosen": -1.3253905773162842, "logits/rejected": -1.048437476158142, "logps/chosen": -0.737988293170929, "logps/rejected": -1.968359351158142, "loss": 0.972, "nll_loss": 0.946484386920929, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07375488430261612, "rewards/margins": 0.12316284328699112, "rewards/rejected": -0.19677734375, "step": 4050 }, { "epoch": 0.5244461667635472, "grad_norm": 1.6262938515864036, "learning_rate": 1.255529641148689e-06, "log_odds_chosen": 1.52899169921875, "log_odds_ratio": -0.435791015625, "logits/chosen": -1.325781226158142, "logits/rejected": -1.1218750476837158, "logps/chosen": -0.791015625, "logps/rejected": -1.91796875, "loss": 0.9353, "nll_loss": 0.873828113079071, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07912597805261612, "rewards/margins": 0.11279296875, "rewards/rejected": -0.19194336235523224, "step": 4060 }, { "epoch": 0.5257379060905509, "grad_norm": 1.69390125026409, "learning_rate": 1.2539862728441536e-06, "log_odds_chosen": 1.677734375, "log_odds_ratio": -0.3800292909145355, "logits/chosen": -1.252539038658142, "logits/rejected": -1.0242187976837158, "logps/chosen": -0.725390613079071, "logps/rejected": -1.9845702648162842, "loss": 0.9479, "nll_loss": 0.9478515386581421, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07258300483226776, "rewards/margins": 0.1258544921875, "rewards/rejected": -0.1983642578125, "step": 4070 }, { "epoch": 0.5270296454175547, "grad_norm": 1.7134731561175889, "learning_rate": 1.252448582170299e-06, "log_odds_chosen": 1.720703125, "log_odds_ratio": -0.39306640625, "logits/chosen": -1.2724609375, "logits/rejected": -1.0857422351837158, "logps/chosen": -0.7416015863418579, "logps/rejected": -2.0308594703674316, "loss": 0.9515, "nll_loss": 0.9937499761581421, "rewards/accuracies": 0.8125, "rewards/chosen": -0.0740966796875, "rewards/margins": 0.12897948920726776, "rewards/rejected": -0.20310059189796448, "step": 4080 }, { "epoch": 0.5283213847445586, "grad_norm": 2.160268363756649, "learning_rate": 1.2509165344015243e-06, "log_odds_chosen": 1.555078148841858, "log_odds_ratio": -0.37983399629592896, "logits/chosen": -1.3503906726837158, "logits/rejected": -1.1496093273162842, "logps/chosen": -0.6973632574081421, "logps/rejected": -1.7999999523162842, "loss": 0.9247, "nll_loss": 0.865527331829071, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.06976318359375, "rewards/margins": 0.11015625298023224, "rewards/rejected": -0.17990723252296448, "step": 4090 }, { "epoch": 0.5296131240715624, "grad_norm": 1.8550735513065018, "learning_rate": 1.2493900951088486e-06, "log_odds_chosen": 1.506250023841858, "log_odds_ratio": -0.3660888671875, "logits/chosen": -1.259179711341858, "logits/rejected": -1.0925781726837158, "logps/chosen": -0.6998046636581421, "logps/rejected": -1.802734375, "loss": 0.9579, "nll_loss": 0.8716796636581421, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.06998290866613388, "rewards/margins": 0.11025390774011612, "rewards/rejected": -0.18020018935203552, "step": 4100 }, { "epoch": 0.5309048633985661, "grad_norm": 15.531161135006124, "learning_rate": 1.2478692301566601e-06, "log_odds_chosen": 1.513671875, "log_odds_ratio": -0.3691650331020355, "logits/chosen": -1.29296875, "logits/rejected": -1.1248047351837158, "logps/chosen": -0.7320312261581421, "logps/rejected": -1.83203125, "loss": 0.975, "nll_loss": 0.9072265625, "rewards/accuracies": 0.84375, "rewards/chosen": -0.0732421875, "rewards/margins": 0.10983886569738388, "rewards/rejected": -0.18305663764476776, "step": 4110 }, { "epoch": 0.53219660272557, "grad_norm": 1.6684823411584337, "learning_rate": 1.2463539056995116e-06, "log_odds_chosen": 1.465429663658142, "log_odds_ratio": -0.35991209745407104, "logits/chosen": -1.2927734851837158, "logits/rejected": -1.0927734375, "logps/chosen": -0.7080078125, "logps/rejected": -1.75, "loss": 0.9715, "nll_loss": 0.9478515386581421, "rewards/accuracies": 0.84375, "rewards/chosen": -0.07083740085363388, "rewards/margins": 0.10416259616613388, "rewards/rejected": -0.17487792670726776, "step": 4120 }, { "epoch": 0.5334883420525738, "grad_norm": 1.754161482071051, "learning_rate": 1.2448440881789541e-06, "log_odds_chosen": 1.450585961341858, "log_odds_ratio": -0.4059081971645355, "logits/chosen": -1.228906273841858, "logits/rejected": -1.047460913658142, "logps/chosen": -0.7691406011581421, "logps/rejected": -1.799218773841858, "loss": 0.972, "nll_loss": 0.896484375, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.076904296875, "rewards/margins": 0.10286865383386612, "rewards/rejected": -0.18002930283546448, "step": 4130 }, { "epoch": 0.5347800813795776, "grad_norm": 1.7108940328604167, "learning_rate": 1.2433397443204184e-06, "log_odds_chosen": 1.389013648033142, "log_odds_ratio": -0.46796876192092896, "logits/chosen": -1.354882836341858, "logits/rejected": -1.122460961341858, "logps/chosen": -0.7403320074081421, "logps/rejected": -1.755273461341858, "loss": 0.9602, "nll_loss": 0.8814452886581421, "rewards/accuracies": 0.75, "rewards/chosen": -0.07404784858226776, "rewards/margins": 0.10133972018957138, "rewards/rejected": -0.17546387016773224, "step": 4140 }, { "epoch": 0.5360718207065814, "grad_norm": 1.7068325338172095, "learning_rate": 1.2418408411301324e-06, "log_odds_chosen": 1.453515648841858, "log_odds_ratio": -0.4480957090854645, "logits/chosen": -1.256250023841858, "logits/rejected": -1.087304711341858, "logps/chosen": -0.7826172113418579, "logps/rejected": -1.8806641101837158, "loss": 0.9486, "nll_loss": 0.88037109375, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07828368991613388, "rewards/margins": 0.10976562649011612, "rewards/rejected": -0.18801268935203552, "step": 4150 }, { "epoch": 0.5373635600335852, "grad_norm": 1.8369552525918529, "learning_rate": 1.2403473458920844e-06, "log_odds_chosen": 1.718164086341858, "log_odds_ratio": -0.3936523497104645, "logits/chosen": -1.3250000476837158, "logits/rejected": -1.0945312976837158, "logps/chosen": -0.743359386920929, "logps/rejected": -2.033984422683716, "loss": 0.9849, "nll_loss": 0.911425769329071, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07429198920726776, "rewards/margins": 0.129150390625, "rewards/rejected": -0.2034912109375, "step": 4160 }, { "epoch": 0.538655299360589, "grad_norm": 3.355249074580041, "learning_rate": 1.2388592261650217e-06, "log_odds_chosen": 1.226709008216858, "log_odds_ratio": -0.4769043028354645, "logits/chosen": -1.2345702648162842, "logits/rejected": -1.0197265148162842, "logps/chosen": -0.7232421636581421, "logps/rejected": -1.5974609851837158, "loss": 0.9414, "nll_loss": 0.930859386920929, "rewards/accuracies": 0.75, "rewards/chosen": -0.07230224460363388, "rewards/margins": 0.08745422214269638, "rewards/rejected": -0.15971679985523224, "step": 4170 }, { "epoch": 0.5399470386875929, "grad_norm": 1.5913611596440715, "learning_rate": 1.2373764497794918e-06, "log_odds_chosen": 1.4685547351837158, "log_odds_ratio": -0.4230712950229645, "logits/chosen": -1.3689453601837158, "logits/rejected": -1.123632788658142, "logps/chosen": -0.7645508050918579, "logps/rejected": -1.821874976158142, "loss": 0.944, "nll_loss": 0.832226574420929, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07645263522863388, "rewards/margins": 0.10562743991613388, "rewards/rejected": -0.18215331435203552, "step": 4180 }, { "epoch": 0.5412387780145966, "grad_norm": 1.7352052444388062, "learning_rate": 1.2358989848349217e-06, "log_odds_chosen": 1.512304663658142, "log_odds_ratio": -0.40620118379592896, "logits/chosen": -1.3876953125, "logits/rejected": -1.1759765148162842, "logps/chosen": -0.7337890863418579, "logps/rejected": -1.819921851158142, "loss": 0.9578, "nll_loss": 0.9482421875, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07333984225988388, "rewards/margins": 0.10850830376148224, "rewards/rejected": -0.181884765625, "step": 4190 }, { "epoch": 0.5425305173416005, "grad_norm": 1.898054555657517, "learning_rate": 1.2344267996967353e-06, "log_odds_chosen": 1.500390648841858, "log_odds_ratio": -0.42182618379592896, "logits/chosen": -1.2314453125, "logits/rejected": -1.0320312976837158, "logps/chosen": -0.7984374761581421, "logps/rejected": -1.886328101158142, "loss": 0.9512, "nll_loss": 0.9468749761581421, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07988281548023224, "rewards/margins": 0.10878906399011612, "rewards/rejected": -0.18862304091453552, "step": 4200 }, { "epoch": 0.5438222566686043, "grad_norm": 2.396807389377443, "learning_rate": 1.2329598629935076e-06, "log_odds_chosen": 1.3772461414337158, "log_odds_ratio": -0.4112792909145355, "logits/chosen": -1.2751953601837158, "logits/rejected": -1.117773413658142, "logps/chosen": -0.785351574420929, "logps/rejected": -1.7878906726837158, "loss": 0.9621, "nll_loss": 0.875, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07851562649011612, "rewards/margins": 0.10018310695886612, "rewards/rejected": -0.17866210639476776, "step": 4210 }, { "epoch": 0.5451139959956081, "grad_norm": 1.6609247306659123, "learning_rate": 1.2314981436141583e-06, "log_odds_chosen": 1.4660155773162842, "log_odds_ratio": -0.42109376192092896, "logits/chosen": -1.3015625476837158, "logits/rejected": -1.1359374523162842, "logps/chosen": -0.756640613079071, "logps/rejected": -1.8621094226837158, "loss": 0.9654, "nll_loss": 0.885937511920929, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07553710788488388, "rewards/margins": 0.11065368354320526, "rewards/rejected": -0.18632812798023224, "step": 4220 }, { "epoch": 0.5464057353226119, "grad_norm": 1.6499107825260557, "learning_rate": 1.2300416107051802e-06, "log_odds_chosen": 1.591406226158142, "log_odds_ratio": -0.3929199278354645, "logits/chosen": -1.341796875, "logits/rejected": -1.0964844226837158, "logps/chosen": -0.735156238079071, "logps/rejected": -1.9308593273162842, "loss": 0.9433, "nll_loss": 0.9150390625, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07354736328125, "rewards/margins": 0.1195068359375, "rewards/rejected": -0.19291992485523224, "step": 4230 }, { "epoch": 0.5476974746496157, "grad_norm": 1.7219099630672494, "learning_rate": 1.2285902336679024e-06, "log_odds_chosen": 1.3551757335662842, "log_odds_ratio": -0.424072265625, "logits/chosen": -1.2333984375, "logits/rejected": -1.0771484375, "logps/chosen": -0.749218761920929, "logps/rejected": -1.746484398841858, "loss": 0.9381, "nll_loss": 0.9624999761581421, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.07486572116613388, "rewards/margins": 0.09979248046875, "rewards/rejected": -0.17475585639476776, "step": 4240 }, { "epoch": 0.5489892139766195, "grad_norm": 2.2717361755641443, "learning_rate": 1.2271439821557926e-06, "log_odds_chosen": 1.736718773841858, "log_odds_ratio": -0.345703125, "logits/chosen": -1.2970702648162842, "logits/rejected": -1.0935547351837158, "logps/chosen": -0.713085949420929, "logps/rejected": -2.0142579078674316, "loss": 0.9433, "nll_loss": 0.85546875, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07127685844898224, "rewards/margins": 0.13004150986671448, "rewards/rejected": -0.20131835341453552, "step": 4250 }, { "epoch": 0.5502809533036234, "grad_norm": 1.6711203087525692, "learning_rate": 1.225702826071791e-06, "log_odds_chosen": 1.5569336414337158, "log_odds_ratio": -0.38579100370407104, "logits/chosen": -1.3537108898162842, "logits/rejected": -1.1496093273162842, "logps/chosen": -0.748046875, "logps/rejected": -1.888671875, "loss": 0.9537, "nll_loss": 0.892382800579071, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07471923530101776, "rewards/margins": 0.11398925632238388, "rewards/rejected": -0.18891601264476776, "step": 4260 }, { "epoch": 0.5515726926306271, "grad_norm": 1.9465195082907079, "learning_rate": 1.2242667355656797e-06, "log_odds_chosen": 1.61328125, "log_odds_ratio": -0.37275391817092896, "logits/chosen": -1.3542969226837158, "logits/rejected": -1.0812499523162842, "logps/chosen": -0.722460925579071, "logps/rejected": -1.923437476158142, "loss": 0.964, "nll_loss": 0.8935546875, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07229004055261612, "rewards/margins": 0.12009277194738388, "rewards/rejected": -0.19240722060203552, "step": 4270 }, { "epoch": 0.5528644319576309, "grad_norm": 1.794022416802587, "learning_rate": 1.2228356810314862e-06, "log_odds_chosen": 1.548120141029358, "log_odds_ratio": -0.38994139432907104, "logits/chosen": -1.158789038658142, "logits/rejected": -1.0666015148162842, "logps/chosen": -0.7455078363418579, "logps/rejected": -1.8976562023162842, "loss": 0.9748, "nll_loss": 0.9507812261581421, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.0745849609375, "rewards/margins": 0.11509399116039276, "rewards/rejected": -0.18984374403953552, "step": 4280 }, { "epoch": 0.5541561712846348, "grad_norm": 1.667794541601779, "learning_rate": 1.2214096331049186e-06, "log_odds_chosen": 1.586572289466858, "log_odds_ratio": -0.42426759004592896, "logits/chosen": -1.2902343273162842, "logits/rejected": -1.0851562023162842, "logps/chosen": -0.7464843988418579, "logps/rejected": -1.9328124523162842, "loss": 0.9303, "nll_loss": 0.8729492425918579, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.07462158054113388, "rewards/margins": 0.11842040717601776, "rewards/rejected": -0.19316406548023224, "step": 4290 }, { "epoch": 0.5554479106116386, "grad_norm": 5.7679672973402765, "learning_rate": 1.2199885626608373e-06, "log_odds_chosen": 1.5720703601837158, "log_odds_ratio": -0.37666016817092896, "logits/chosen": -1.191796898841858, "logits/rejected": -1.029687523841858, "logps/chosen": -0.739453136920929, "logps/rejected": -1.881250023841858, "loss": 0.9693, "nll_loss": 0.884570300579071, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -0.07392577826976776, "rewards/margins": 0.11418457329273224, "rewards/rejected": -0.18825682997703552, "step": 4300 }, { "epoch": 0.5567396499386423, "grad_norm": 2.352795709971135, "learning_rate": 1.2185724408107546e-06, "log_odds_chosen": 1.9900391101837158, "log_odds_ratio": -0.3060058653354645, "logits/chosen": -1.398828148841858, "logits/rejected": -1.124414086341858, "logps/chosen": -0.694140613079071, "logps/rejected": -2.139843702316284, "loss": 0.9342, "nll_loss": 0.896484375, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -0.06944580376148224, "rewards/margins": 0.14444580674171448, "rewards/rejected": -0.21389159560203552, "step": 4310 }, { "epoch": 0.5580313892656462, "grad_norm": 1.8931088376604501, "learning_rate": 1.2171612389003689e-06, "log_odds_chosen": 1.6291015148162842, "log_odds_ratio": -0.37236326932907104, "logits/chosen": -1.2666015625, "logits/rejected": -1.081445336341858, "logps/chosen": -0.675488293170929, "logps/rejected": -1.8025391101837158, "loss": 0.9251, "nll_loss": 0.8734375238418579, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.06755371391773224, "rewards/margins": 0.11271362006664276, "rewards/rejected": -0.18020018935203552, "step": 4320 }, { "epoch": 0.55932312859265, "grad_norm": 1.591707692558663, "learning_rate": 1.2157549285071297e-06, "log_odds_chosen": 1.5688965320587158, "log_odds_ratio": -0.37128907442092896, "logits/chosen": -1.2509765625, "logits/rejected": -1.032617211341858, "logps/chosen": -0.707226574420929, "logps/rejected": -1.838281273841858, "loss": 0.9799, "nll_loss": 0.903515636920929, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07075195014476776, "rewards/margins": 0.11311187595129013, "rewards/rejected": -0.18386229872703552, "step": 4330 }, { "epoch": 0.5606148679196538, "grad_norm": 1.5906474756638334, "learning_rate": 1.2143534814378327e-06, "log_odds_chosen": 1.462890625, "log_odds_ratio": -0.3943847715854645, "logits/chosen": -1.361328125, "logits/rejected": -1.0583984851837158, "logps/chosen": -0.775585949420929, "logps/rejected": -1.8507812023162842, "loss": 0.9685, "nll_loss": 0.9234374761581421, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.0775146484375, "rewards/margins": 0.10768432915210724, "rewards/rejected": -0.18525390326976776, "step": 4340 }, { "epoch": 0.5619066072466576, "grad_norm": 1.5883088992798324, "learning_rate": 1.2129568697262454e-06, "log_odds_chosen": 1.5482177734375, "log_odds_ratio": -0.4226318299770355, "logits/chosen": -1.2458984851837158, "logits/rejected": -1.0382812023162842, "logps/chosen": -0.7261718511581421, "logps/rejected": -1.8603515625, "loss": 0.9546, "nll_loss": 0.9345703125, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07260742038488388, "rewards/margins": 0.11366577446460724, "rewards/rejected": -0.18620605766773224, "step": 4350 }, { "epoch": 0.5631983465736614, "grad_norm": 1.88948530137162, "learning_rate": 1.2115650656307653e-06, "log_odds_chosen": 1.5812499523162842, "log_odds_ratio": -0.39936524629592896, "logits/chosen": -1.4187500476837158, "logits/rejected": -1.186914086341858, "logps/chosen": -0.7251952886581421, "logps/rejected": -1.8468749523162842, "loss": 0.9145, "nll_loss": 0.8501952886581421, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07243652641773224, "rewards/margins": 0.11224365234375, "rewards/rejected": -0.18479004502296448, "step": 4360 }, { "epoch": 0.5644900859006653, "grad_norm": 1.585683218221428, "learning_rate": 1.210178041632103e-06, "log_odds_chosen": 1.537988305091858, "log_odds_ratio": -0.390869140625, "logits/chosen": -1.225195288658142, "logits/rejected": -1.0779297351837158, "logps/chosen": -0.7337890863418579, "logps/rejected": -1.8644530773162842, "loss": 0.9384, "nll_loss": 0.992382824420929, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07340087741613388, "rewards/margins": 0.11305542290210724, "rewards/rejected": -0.1864013671875, "step": 4370 }, { "epoch": 0.5657818252276691, "grad_norm": 2.710797695816908, "learning_rate": 1.2087957704309988e-06, "log_odds_chosen": 1.834570288658142, "log_odds_ratio": -0.3258056640625, "logits/chosen": -1.393945336341858, "logits/rejected": -1.110742211341858, "logps/chosen": -0.7353515625, "logps/rejected": -2.06640625, "loss": 0.9275, "nll_loss": 0.8570312261581421, "rewards/accuracies": 0.862500011920929, "rewards/chosen": -0.07349853217601776, "rewards/margins": 0.13310547173023224, "rewards/rejected": -0.20668944716453552, "step": 4380 }, { "epoch": 0.5670735645546728, "grad_norm": 1.6428952259274932, "learning_rate": 1.2074182249459642e-06, "log_odds_chosen": 1.867578148841858, "log_odds_ratio": -0.311767578125, "logits/chosen": -1.3224608898162842, "logits/rejected": -1.067968726158142, "logps/chosen": -0.703320324420929, "logps/rejected": -2.083203077316284, "loss": 0.9314, "nll_loss": 0.874218761920929, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07038573920726776, "rewards/margins": 0.13797608017921448, "rewards/rejected": -0.20842285454273224, "step": 4390 }, { "epoch": 0.5683653038816767, "grad_norm": 1.6735372722272903, "learning_rate": 1.2060453783110545e-06, "log_odds_chosen": 1.7418944835662842, "log_odds_ratio": -0.387939453125, "logits/chosen": -1.257421851158142, "logits/rejected": -1.0076172351837158, "logps/chosen": -0.6776367425918579, "logps/rejected": -1.98046875, "loss": 0.9327, "nll_loss": 0.9339843988418579, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.0677490234375, "rewards/margins": 0.13032837212085724, "rewards/rejected": -0.19802245497703552, "step": 4400 }, { "epoch": 0.5696570432086805, "grad_norm": 1.9883383046376895, "learning_rate": 1.2046772038736682e-06, "log_odds_chosen": 1.7687499523162842, "log_odds_ratio": -0.3750244081020355, "logits/chosen": -1.3603515625, "logits/rejected": -1.196874976158142, "logps/chosen": -0.792773425579071, "logps/rejected": -2.0894532203674316, "loss": 0.9221, "nll_loss": 0.8646484613418579, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07923583686351776, "rewards/margins": 0.12967529892921448, "rewards/rejected": -0.208984375, "step": 4410 }, { "epoch": 0.5709487825356843, "grad_norm": 2.0432023907066434, "learning_rate": 1.2033136751923736e-06, "log_odds_chosen": 1.441430687904358, "log_odds_ratio": -0.42192381620407104, "logits/chosen": -1.253320336341858, "logits/rejected": -1.0900390148162842, "logps/chosen": -0.7984374761581421, "logps/rejected": -1.90234375, "loss": 0.9264, "nll_loss": 0.8695312738418579, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07988281548023224, "rewards/margins": 0.11024627834558487, "rewards/rejected": -0.19028320908546448, "step": 4420 }, { "epoch": 0.5722405218626881, "grad_norm": 1.709445948911892, "learning_rate": 1.201954766034762e-06, "log_odds_chosen": 1.551855444908142, "log_odds_ratio": -0.40380859375, "logits/chosen": -1.279687523841858, "logits/rejected": -1.1318359375, "logps/chosen": -0.7669922113418579, "logps/rejected": -1.897851586341858, "loss": 0.9682, "nll_loss": 0.917187511920929, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07667236030101776, "rewards/margins": 0.11307372897863388, "rewards/rejected": -0.1898193359375, "step": 4430 }, { "epoch": 0.5735322611896919, "grad_norm": 1.4798049494038241, "learning_rate": 1.2006004503753285e-06, "log_odds_chosen": 1.487695336341858, "log_odds_ratio": -0.41552734375, "logits/chosen": -1.2332031726837158, "logits/rejected": -1.080468773841858, "logps/chosen": -0.755078136920929, "logps/rejected": -1.828515648841858, "loss": 0.9445, "nll_loss": 0.9351562261581421, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07550048828125, "rewards/margins": 0.10734252631664276, "rewards/rejected": -0.18293456733226776, "step": 4440 }, { "epoch": 0.5748240005166957, "grad_norm": 2.771084764429539, "learning_rate": 1.1992507023933782e-06, "log_odds_chosen": 1.721289038658142, "log_odds_ratio": -0.38969725370407104, "logits/chosen": -1.3406250476837158, "logits/rejected": -1.025976538658142, "logps/chosen": -0.7347656488418579, "logps/rejected": -2.0511717796325684, "loss": 0.9442, "nll_loss": 0.931835949420929, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07351074367761612, "rewards/margins": 0.13165283203125, "rewards/rejected": -0.20510253310203552, "step": 4450 }, { "epoch": 0.5761157398436996, "grad_norm": 1.7271424290403872, "learning_rate": 1.1979054964709597e-06, "log_odds_chosen": 1.4455077648162842, "log_odds_ratio": -0.4397216737270355, "logits/chosen": -1.1970703601837158, "logits/rejected": -1.0613281726837158, "logps/chosen": -0.72021484375, "logps/rejected": -1.765234351158142, "loss": 0.9, "nll_loss": 0.875195324420929, "rewards/accuracies": 0.7437499761581421, "rewards/chosen": -0.07203368842601776, "rewards/margins": 0.10458984225988388, "rewards/rejected": -0.17653807997703552, "step": 4460 }, { "epoch": 0.5774074791707033, "grad_norm": 2.0017667214720296, "learning_rate": 1.1965648071908207e-06, "log_odds_chosen": 1.65582275390625, "log_odds_ratio": -0.39360350370407104, "logits/chosen": -1.3914062976837158, "logits/rejected": -1.145898461341858, "logps/chosen": -0.713085949420929, "logps/rejected": -1.9562499523162842, "loss": 0.9397, "nll_loss": 0.8662109375, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07130126655101776, "rewards/margins": 0.12435150146484375, "rewards/rejected": -0.19558104872703552, "step": 4470 }, { "epoch": 0.5786992184977071, "grad_norm": 1.6552600794243664, "learning_rate": 1.1952286093343935e-06, "log_odds_chosen": 1.548828125, "log_odds_ratio": -0.39306640625, "logits/chosen": -1.339453101158142, "logits/rejected": -1.1443359851837158, "logps/chosen": -0.7134765386581421, "logps/rejected": -1.857031226158142, "loss": 0.9312, "nll_loss": 0.866406261920929, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07139892876148224, "rewards/margins": 0.11435546725988388, "rewards/rejected": -0.18581542372703552, "step": 4480 }, { "epoch": 0.579990957824711, "grad_norm": 1.5780722160872864, "learning_rate": 1.1938968778798005e-06, "log_odds_chosen": 1.529882788658142, "log_odds_ratio": -0.38593751192092896, "logits/chosen": -1.2482421398162842, "logits/rejected": -1.052148461341858, "logps/chosen": -0.7484375238418579, "logps/rejected": -1.857421875, "loss": 0.9343, "nll_loss": 0.923632800579071, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07489013671875, "rewards/margins": 0.11077880859375, "rewards/rejected": -0.18557128310203552, "step": 4490 }, { "epoch": 0.5812826971517148, "grad_norm": 1.6172753868208591, "learning_rate": 1.1925695879998878e-06, "log_odds_chosen": 1.399511694908142, "log_odds_ratio": -0.4425048828125, "logits/chosen": -1.297460913658142, "logits/rejected": -1.0802733898162842, "logps/chosen": -0.810742199420929, "logps/rejected": -1.8859374523162842, "loss": 0.9451, "nll_loss": 0.9740234613418579, "rewards/accuracies": 0.78125, "rewards/chosen": -0.08107910305261612, "rewards/margins": 0.10748291015625, "rewards/rejected": -0.1885986328125, "step": 4500 }, { "epoch": 0.5825744364787186, "grad_norm": 1.9126350428215306, "learning_rate": 1.1912467150602794e-06, "log_odds_chosen": 1.795507788658142, "log_odds_ratio": -0.3241943418979645, "logits/chosen": -1.3220703601837158, "logits/rejected": -1.0419921875, "logps/chosen": -0.720898449420929, "logps/rejected": -2.0542969703674316, "loss": 0.9168, "nll_loss": 0.90087890625, "rewards/accuracies": 0.84375, "rewards/chosen": -0.07216797024011612, "rewards/margins": 0.13309936225414276, "rewards/rejected": -0.205322265625, "step": 4510 }, { "epoch": 0.5838661758057224, "grad_norm": 1.8376299963777751, "learning_rate": 1.189928234617459e-06, "log_odds_chosen": 1.4835937023162842, "log_odds_ratio": -0.43798828125, "logits/chosen": -1.2980468273162842, "logits/rejected": -1.058007836341858, "logps/chosen": -0.7933593988418579, "logps/rejected": -1.8576171398162842, "loss": 0.9321, "nll_loss": 0.8760741949081421, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.079345703125, "rewards/margins": 0.1065673828125, "rewards/rejected": -0.18576660752296448, "step": 4520 }, { "epoch": 0.5851579151327262, "grad_norm": 1.7383810518158855, "learning_rate": 1.1886141224168716e-06, "log_odds_chosen": 1.754492163658142, "log_odds_ratio": -0.33447265625, "logits/chosen": -1.2548828125, "logits/rejected": -1.0558593273162842, "logps/chosen": -0.7138671875, "logps/rejected": -2.014453172683716, "loss": 0.9516, "nll_loss": 0.865039050579071, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -0.07133789360523224, "rewards/margins": 0.13015136122703552, "rewards/rejected": -0.20161132514476776, "step": 4530 }, { "epoch": 0.5864496544597301, "grad_norm": 1.9270731836682518, "learning_rate": 1.1873043543910495e-06, "log_odds_chosen": 1.409326195716858, "log_odds_ratio": -0.42426759004592896, "logits/chosen": -1.2667968273162842, "logits/rejected": -1.130273461341858, "logps/chosen": -0.7564452886581421, "logps/rejected": -1.765625, "loss": 0.9565, "nll_loss": 0.9164062738418579, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.07564697414636612, "rewards/margins": 0.10087432712316513, "rewards/rejected": -0.17641600966453552, "step": 4540 }, { "epoch": 0.5877413937867338, "grad_norm": 2.0481071458390323, "learning_rate": 1.1859989066577617e-06, "log_odds_chosen": 1.7667968273162842, "log_odds_ratio": -0.36767578125, "logits/chosen": -1.3308594226837158, "logits/rejected": -1.044921875, "logps/chosen": -0.7632812261581421, "logps/rejected": -2.0738282203674316, "loss": 0.9183, "nll_loss": 0.9144531488418579, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.07630614936351776, "rewards/margins": 0.13126221299171448, "rewards/rejected": -0.20742186903953552, "step": 4550 }, { "epoch": 0.5890331331137376, "grad_norm": 1.7883800871026392, "learning_rate": 1.1846977555181846e-06, "log_odds_chosen": 1.733789086341858, "log_odds_ratio": -0.3633789122104645, "logits/chosen": -1.287500023841858, "logits/rejected": -1.088281273841858, "logps/chosen": -0.69677734375, "logps/rejected": -1.9375, "loss": 0.9448, "nll_loss": 0.8607422113418579, "rewards/accuracies": 0.793749988079071, "rewards/chosen": -0.06968994438648224, "rewards/margins": 0.12413330376148224, "rewards/rejected": -0.19401855766773224, "step": 4560 }, { "epoch": 0.5903248724407415, "grad_norm": 5.853994795389135, "learning_rate": 1.1834008774550946e-06, "log_odds_chosen": 1.587304711341858, "log_odds_ratio": -0.3641601502895355, "logits/chosen": -1.375, "logits/rejected": -1.1164062023162842, "logps/chosen": -0.6874023675918579, "logps/rejected": -1.845703125, "loss": 0.9285, "nll_loss": 0.7808593511581421, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.06873778998851776, "rewards/margins": 0.11588134616613388, "rewards/rejected": -0.18459472060203552, "step": 4570 }, { "epoch": 0.5916166117677453, "grad_norm": 1.6588117029178708, "learning_rate": 1.1821082491310835e-06, "log_odds_chosen": 1.680273413658142, "log_odds_ratio": -0.39702147245407104, "logits/chosen": -1.396875023841858, "logits/rejected": -1.162109375, "logps/chosen": -0.7720702886581421, "logps/rejected": -2.0433592796325684, "loss": 0.9621, "nll_loss": 0.951367199420929, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07716064155101776, "rewards/margins": 0.12718506157398224, "rewards/rejected": -0.20424804091453552, "step": 4580 }, { "epoch": 0.592908351094749, "grad_norm": 1.7284757683678504, "learning_rate": 1.1808198473867937e-06, "log_odds_chosen": 1.6033203601837158, "log_odds_ratio": -0.3680664002895355, "logits/chosen": -1.314453125, "logits/rejected": -1.118749976158142, "logps/chosen": -0.715039074420929, "logps/rejected": -1.8933594226837158, "loss": 0.9396, "nll_loss": 0.826367199420929, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07149658352136612, "rewards/margins": 0.11781005561351776, "rewards/rejected": -0.189453125, "step": 4590 }, { "epoch": 0.5942000904217529, "grad_norm": 1.8571080585729525, "learning_rate": 1.179535649239177e-06, "log_odds_chosen": 1.8361327648162842, "log_odds_ratio": -0.3235839903354645, "logits/chosen": -1.361914038658142, "logits/rejected": -1.0947265625, "logps/chosen": -0.735058605670929, "logps/rejected": -2.10546875, "loss": 0.9338, "nll_loss": 0.938281238079071, "rewards/accuracies": 0.84375, "rewards/chosen": -0.07351074367761612, "rewards/margins": 0.13679198920726776, "rewards/rejected": -0.21040038764476776, "step": 4600 }, { "epoch": 0.5954918297487567, "grad_norm": 1.6600973267590446, "learning_rate": 1.178255631879771e-06, "log_odds_chosen": 1.449853539466858, "log_odds_ratio": -0.4580078125, "logits/chosen": -1.2898437976837158, "logits/rejected": -1.120703101158142, "logps/chosen": -0.7720702886581421, "logps/rejected": -1.820703148841858, "loss": 0.9408, "nll_loss": 0.9009765386581421, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.07707519829273224, "rewards/margins": 0.10495300590991974, "rewards/rejected": -0.18203124403953552, "step": 4610 }, { "epoch": 0.5967835690757605, "grad_norm": 1.8433355547136911, "learning_rate": 1.1769797726729992e-06, "log_odds_chosen": 1.3949463367462158, "log_odds_ratio": -0.40888673067092896, "logits/chosen": -1.4402344226837158, "logits/rejected": -1.2185547351837158, "logps/chosen": -0.705859363079071, "logps/rejected": -1.7117187976837158, "loss": 0.9033, "nll_loss": 0.8785156011581421, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.07056884467601776, "rewards/margins": 0.10054321587085724, "rewards/rejected": -0.17124024033546448, "step": 4620 }, { "epoch": 0.5980753084027643, "grad_norm": 2.1071194219845824, "learning_rate": 1.1757080491544881e-06, "log_odds_chosen": 1.3976562023162842, "log_odds_ratio": -0.38671875, "logits/chosen": -1.275390625, "logits/rejected": -1.058984398841858, "logps/chosen": -0.7533203363418579, "logps/rejected": -1.750390648841858, "loss": 0.9568, "nll_loss": 0.961621105670929, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07528076320886612, "rewards/margins": 0.09956512600183487, "rewards/rejected": -0.17487792670726776, "step": 4630 }, { "epoch": 0.5993670477297681, "grad_norm": 1.7164512041798885, "learning_rate": 1.1744404390294068e-06, "log_odds_chosen": 1.392431616783142, "log_odds_ratio": -0.4547363221645355, "logits/chosen": -1.377539038658142, "logits/rejected": -1.187890648841858, "logps/chosen": -0.775585949420929, "logps/rejected": -1.8341796398162842, "loss": 0.9576, "nll_loss": 0.8851562738418579, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -0.07756347954273224, "rewards/margins": 0.10582885891199112, "rewards/rejected": -0.18354491889476776, "step": 4640 }, { "epoch": 0.6006587870567719, "grad_norm": 1.7598338518007444, "learning_rate": 1.1731769201708264e-06, "log_odds_chosen": 1.6369140148162842, "log_odds_ratio": -0.3788818418979645, "logits/chosen": -1.3781249523162842, "logits/rejected": -1.095312476158142, "logps/chosen": -0.7300781011581421, "logps/rejected": -1.9070312976837158, "loss": 0.9299, "nll_loss": 0.854687511920929, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.072998046875, "rewards/margins": 0.11772765964269638, "rewards/rejected": -0.19052734971046448, "step": 4650 }, { "epoch": 0.6019505263837758, "grad_norm": 1.8652940546569594, "learning_rate": 1.1719174706180952e-06, "log_odds_chosen": 1.6630859375, "log_odds_ratio": -0.36518555879592896, "logits/chosen": -1.259374976158142, "logits/rejected": -1.073632836341858, "logps/chosen": -0.712695300579071, "logps/rejected": -1.9132812023162842, "loss": 0.9401, "nll_loss": 0.902539074420929, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07132568210363388, "rewards/margins": 0.12020263820886612, "rewards/rejected": -0.1912841796875, "step": 4660 }, { "epoch": 0.6032422657107795, "grad_norm": 1.6835402672395174, "learning_rate": 1.1706620685752386e-06, "log_odds_chosen": 1.418359398841858, "log_odds_ratio": -0.3988281190395355, "logits/chosen": -1.347265601158142, "logits/rejected": -1.161718726158142, "logps/chosen": -0.8218749761581421, "logps/rejected": -1.883203148841858, "loss": 0.9281, "nll_loss": 0.9017578363418579, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.08214111626148224, "rewards/margins": 0.10606689751148224, "rewards/rejected": -0.18825682997703552, "step": 4670 }, { "epoch": 0.6045340050377834, "grad_norm": 1.6475924030731275, "learning_rate": 1.1694106924093723e-06, "log_odds_chosen": 1.669335961341858, "log_odds_ratio": -0.3777099549770355, "logits/chosen": -1.3615233898162842, "logits/rejected": -1.145898461341858, "logps/chosen": -0.7308593988418579, "logps/rejected": -1.9775390625, "loss": 0.9672, "nll_loss": 0.929492175579071, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07308349758386612, "rewards/margins": 0.1246337890625, "rewards/rejected": -0.19775390625, "step": 4680 }, { "epoch": 0.6058257443647872, "grad_norm": 2.1634850586313457, "learning_rate": 1.1681633206491381e-06, "log_odds_chosen": 1.429296851158142, "log_odds_ratio": -0.4195312559604645, "logits/chosen": -1.3583984375, "logits/rejected": -1.16015625, "logps/chosen": -0.7787109613418579, "logps/rejected": -1.825781226158142, "loss": 0.9211, "nll_loss": 0.863085925579071, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07784423977136612, "rewards/margins": 0.10484619438648224, "rewards/rejected": -0.18264159560203552, "step": 4690 }, { "epoch": 0.607117483691791, "grad_norm": 1.9414226751309138, "learning_rate": 1.1669199319831564e-06, "log_odds_chosen": 1.534277319908142, "log_odds_ratio": -0.38422852754592896, "logits/chosen": -1.3107421398162842, "logits/rejected": -1.0558593273162842, "logps/chosen": -0.830273449420929, "logps/rejected": -1.962499976158142, "loss": 0.929, "nll_loss": 0.931640625, "rewards/accuracies": 0.768750011920929, "rewards/chosen": -0.08302001655101776, "rewards/margins": 0.11324463039636612, "rewards/rejected": -0.19624023139476776, "step": 4700 }, { "epoch": 0.6084092230187949, "grad_norm": 1.9269438778221415, "learning_rate": 1.1656805052584958e-06, "log_odds_chosen": 1.4923827648162842, "log_odds_ratio": -0.398193359375, "logits/chosen": -1.2468750476837158, "logits/rejected": -1.097265601158142, "logps/chosen": -0.7474609613418579, "logps/rejected": -1.818359375, "loss": 0.9337, "nll_loss": 0.889453113079071, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07470703125, "rewards/margins": 0.10718993842601776, "rewards/rejected": -0.18181152641773224, "step": 4710 }, { "epoch": 0.6097009623457986, "grad_norm": 1.4827038793621574, "learning_rate": 1.164445019479164e-06, "log_odds_chosen": 1.3251464366912842, "log_odds_ratio": -0.44194334745407104, "logits/chosen": -1.3642578125, "logits/rejected": -1.1603515148162842, "logps/chosen": -0.7841796875, "logps/rejected": -1.741796851158142, "loss": 0.9373, "nll_loss": 0.8958984613418579, "rewards/accuracies": 0.75, "rewards/chosen": -0.07841797173023224, "rewards/margins": 0.0958709716796875, "rewards/rejected": -0.17421874403953552, "step": 4720 }, { "epoch": 0.6109927016728024, "grad_norm": 1.521194017145698, "learning_rate": 1.1632134538046105e-06, "log_odds_chosen": 1.294335961341858, "log_odds_ratio": -0.4267578125, "logits/chosen": -1.423242211341858, "logits/rejected": -1.2599608898162842, "logps/chosen": -0.6556640863418579, "logps/rejected": -1.562109351158142, "loss": 0.9216, "nll_loss": 0.846386730670929, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.06552734225988388, "rewards/margins": 0.09072265774011612, "rewards/rejected": -0.15622559189796448, "step": 4730 }, { "epoch": 0.6122844409998063, "grad_norm": 1.5106667448677706, "learning_rate": 1.1619857875482536e-06, "log_odds_chosen": 1.4130859375, "log_odds_ratio": -0.4093261659145355, "logits/chosen": -1.2595703601837158, "logits/rejected": -1.0859375, "logps/chosen": -0.748046875, "logps/rejected": -1.7863280773162842, "loss": 0.954, "nll_loss": 0.9212890863418579, "rewards/accuracies": 0.84375, "rewards/chosen": -0.07484130561351776, "rewards/margins": 0.10380248725414276, "rewards/rejected": -0.17868652939796448, "step": 4740 }, { "epoch": 0.61357618032681, "grad_norm": 1.5678402091733594, "learning_rate": 1.1607620001760185e-06, "log_odds_chosen": 1.454003930091858, "log_odds_ratio": -0.4056152403354645, "logits/chosen": -1.4031250476837158, "logits/rejected": -1.168554663658142, "logps/chosen": -0.693359375, "logps/rejected": -1.738671898841858, "loss": 0.9266, "nll_loss": 0.8882812261581421, "rewards/accuracies": 0.8125, "rewards/chosen": -0.06936035305261612, "rewards/margins": 0.10445556789636612, "rewards/rejected": -0.17375488579273224, "step": 4750 }, { "epoch": 0.6148679196538138, "grad_norm": 2.0045427333252657, "learning_rate": 1.1595420713048968e-06, "log_odds_chosen": 1.432031273841858, "log_odds_ratio": -0.4193359315395355, "logits/chosen": -1.325781226158142, "logits/rejected": -1.18359375, "logps/chosen": -0.7109375, "logps/rejected": -1.766015648841858, "loss": 0.9417, "nll_loss": 0.8802734613418579, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.07110595703125, "rewards/margins": 0.10545654594898224, "rewards/rejected": -0.17666015028953552, "step": 4760 }, { "epoch": 0.6161596589808177, "grad_norm": 1.7544758887761251, "learning_rate": 1.1583259807015182e-06, "log_odds_chosen": 1.470117211341858, "log_odds_ratio": -0.39306640625, "logits/chosen": -1.330664038658142, "logits/rejected": -1.078515648841858, "logps/chosen": -0.6883789300918579, "logps/rejected": -1.7570312023162842, "loss": 0.9147, "nll_loss": 0.8861328363418579, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.06884765625, "rewards/margins": 0.10677490383386612, "rewards/rejected": -0.17558594048023224, "step": 4770 }, { "epoch": 0.6174513983078215, "grad_norm": 2.061701028402448, "learning_rate": 1.1571137082807434e-06, "log_odds_chosen": 1.318212866783142, "log_odds_ratio": -0.446044921875, "logits/chosen": -1.3771483898162842, "logits/rejected": -1.1638672351837158, "logps/chosen": -0.768359363079071, "logps/rejected": -1.713281273841858, "loss": 0.9151, "nll_loss": 0.9048827886581421, "rewards/accuracies": 0.75, "rewards/chosen": -0.07685546576976776, "rewards/margins": 0.09467468410730362, "rewards/rejected": -0.17148438096046448, "step": 4780 }, { "epoch": 0.6187431376348252, "grad_norm": 2.40147734398139, "learning_rate": 1.155905234104269e-06, "log_odds_chosen": 1.7833983898162842, "log_odds_ratio": -0.3466796875, "logits/chosen": -1.274804711341858, "logits/rejected": -1.042382836341858, "logps/chosen": -0.700390636920929, "logps/rejected": -2.0082030296325684, "loss": 0.965, "nll_loss": 0.974609375, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -0.07001952826976776, "rewards/margins": 0.13078613579273224, "rewards/rejected": -0.20083007216453552, "step": 4790 }, { "epoch": 0.6200348769618291, "grad_norm": 1.725765911582742, "learning_rate": 1.1547005383792516e-06, "log_odds_chosen": 1.4757201671600342, "log_odds_ratio": -0.38720703125, "logits/chosen": -1.3132812976837158, "logits/rejected": -1.1369140148162842, "logps/chosen": -0.701171875, "logps/rejected": -1.736328125, "loss": 0.9109, "nll_loss": 0.807910144329071, "rewards/accuracies": 0.8062499761581421, "rewards/chosen": -0.07010497897863388, "rewards/margins": 0.10360107570886612, "rewards/rejected": -0.17365722358226776, "step": 4800 }, { "epoch": 0.6213266162888329, "grad_norm": 1.8623256582275152, "learning_rate": 1.1534996014569446e-06, "log_odds_chosen": 1.824609398841858, "log_odds_ratio": -0.34953612089157104, "logits/chosen": -1.308007836341858, "logits/rejected": -1.0634765625, "logps/chosen": -0.6854492425918579, "logps/rejected": -2.0171875953674316, "loss": 0.912, "nll_loss": 0.8739258050918579, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.06857910007238388, "rewards/margins": 0.13327637314796448, "rewards/rejected": -0.20195312798023224, "step": 4810 }, { "epoch": 0.6226183556158367, "grad_norm": 1.5125635922009868, "learning_rate": 1.1523024038313547e-06, "log_odds_chosen": 1.3976562023162842, "log_odds_ratio": -0.4427246153354645, "logits/chosen": -1.2775390148162842, "logits/rejected": -1.1337890625, "logps/chosen": -0.7425781488418579, "logps/rejected": -1.7410156726837158, "loss": 0.9233, "nll_loss": 0.8642578125, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0743408203125, "rewards/margins": 0.09991455078125, "rewards/rejected": -0.17429199814796448, "step": 4820 }, { "epoch": 0.6239100949428406, "grad_norm": 2.9032916169658813, "learning_rate": 1.1511089261379083e-06, "log_odds_chosen": 1.6281249523162842, "log_odds_ratio": -0.3427734375, "logits/chosen": -1.2488281726837158, "logits/rejected": -1.0564453601837158, "logps/chosen": -0.7388671636581421, "logps/rejected": -1.913671851158142, "loss": 0.9456, "nll_loss": 0.945507824420929, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07386474311351776, "rewards/margins": 0.11735840141773224, "rewards/rejected": -0.19140625, "step": 4830 }, { "epoch": 0.6252018342698443, "grad_norm": 1.6858719081790596, "learning_rate": 1.149919149152138e-06, "log_odds_chosen": 1.564453125, "log_odds_ratio": -0.3506103456020355, "logits/chosen": -1.3107421398162842, "logits/rejected": -1.106054663658142, "logps/chosen": -0.7552734613418579, "logps/rejected": -1.869531273841858, "loss": 0.925, "nll_loss": 0.938281238079071, "rewards/accuracies": 0.831250011920929, "rewards/chosen": -0.07559814304113388, "rewards/margins": 0.11140136420726776, "rewards/rejected": -0.18698731064796448, "step": 4840 }, { "epoch": 0.6264935735968482, "grad_norm": 1.6596285003405842, "learning_rate": 1.148733053788381e-06, "log_odds_chosen": 1.460351586341858, "log_odds_ratio": -0.4163574278354645, "logits/chosen": -1.324609398841858, "logits/rejected": -1.123437523841858, "logps/chosen": -0.741406261920929, "logps/rejected": -1.80859375, "loss": 0.9518, "nll_loss": 0.8597656488418579, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.07415771484375, "rewards/margins": 0.10672607272863388, "rewards/rejected": -0.180908203125, "step": 4850 }, { "epoch": 0.627785312923852, "grad_norm": 1.5765557894306583, "learning_rate": 1.1475506210984938e-06, "log_odds_chosen": 1.466796875, "log_odds_ratio": -0.39924317598342896, "logits/chosen": -1.2951171398162842, "logits/rejected": -1.0642578601837158, "logps/chosen": -0.7203124761581421, "logps/rejected": -1.7648437023162842, "loss": 0.9128, "nll_loss": 0.860546886920929, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07208251953125, "rewards/margins": 0.10435791313648224, "rewards/rejected": -0.17636719346046448, "step": 4860 }, { "epoch": 0.6290770522508558, "grad_norm": 1.9706962212948955, "learning_rate": 1.1463718322705807e-06, "log_odds_chosen": 1.881250023841858, "log_odds_ratio": -0.31660157442092896, "logits/chosen": -1.3005859851837158, "logits/rejected": -1.0642578601837158, "logps/chosen": -0.6656249761581421, "logps/rejected": -2.049999952316284, "loss": 0.9037, "nll_loss": 0.836230456829071, "rewards/accuracies": 0.856249988079071, "rewards/chosen": -0.06660155951976776, "rewards/margins": 0.13835449516773224, "rewards/rejected": -0.20498046278953552, "step": 4870 }, { "epoch": 0.6303687915778596, "grad_norm": 1.8196724461562912, "learning_rate": 1.1451966686277364e-06, "log_odds_chosen": 1.4851562976837158, "log_odds_ratio": -0.46043699979782104, "logits/chosen": -1.2919921875, "logits/rejected": -1.0734374523162842, "logps/chosen": -0.7691406011581421, "logps/rejected": -1.9207031726837158, "loss": 0.9505, "nll_loss": 0.948046863079071, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.07692871242761612, "rewards/margins": 0.11520004272460938, "rewards/rejected": -0.19221191108226776, "step": 4880 }, { "epoch": 0.6316605309048634, "grad_norm": 2.042375933031292, "learning_rate": 1.1440251116268034e-06, "log_odds_chosen": 1.6767578125, "log_odds_ratio": -0.3396972715854645, "logits/chosen": -1.413671851158142, "logits/rejected": -1.1681640148162842, "logps/chosen": -0.684765636920929, "logps/rejected": -1.8796875476837158, "loss": 0.9386, "nll_loss": 0.8746093511581421, "rewards/accuracies": 0.8374999761581421, "rewards/chosen": -0.06845702975988388, "rewards/margins": 0.11943359673023224, "rewards/rejected": -0.1878662109375, "step": 4890 }, { "epoch": 0.6329522702318672, "grad_norm": 2.0118674144529534, "learning_rate": 1.1428571428571428e-06, "log_odds_chosen": 1.6550781726837158, "log_odds_ratio": -0.40385740995407104, "logits/chosen": -1.259179711341858, "logits/rejected": -1.027734398841858, "logps/chosen": -0.7489258050918579, "logps/rejected": -1.966406226158142, "loss": 0.9226, "nll_loss": 0.922070324420929, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.0748291015625, "rewards/margins": 0.121826171875, "rewards/rejected": -0.19672851264476776, "step": 4900 }, { "epoch": 0.6342440095588711, "grad_norm": 1.8757638806114496, "learning_rate": 1.14169274403942e-06, "log_odds_chosen": 1.790429711341858, "log_odds_ratio": -0.3604492247104645, "logits/chosen": -1.329687476158142, "logits/rejected": -1.092382788658142, "logps/chosen": -0.7071288824081421, "logps/rejected": -2.0230469703674316, "loss": 0.9436, "nll_loss": 0.9097656011581421, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07073974609375, "rewards/margins": 0.13170166313648224, "rewards/rejected": -0.20249024033546448, "step": 4910 }, { "epoch": 0.6355357488858748, "grad_norm": 1.644319967283968, "learning_rate": 1.140531897024402e-06, "log_odds_chosen": 1.878515601158142, "log_odds_ratio": -0.370849609375, "logits/chosen": -1.389257788658142, "logits/rejected": -1.138085961341858, "logps/chosen": -0.717578113079071, "logps/rejected": -2.132031202316284, "loss": 0.9503, "nll_loss": 0.9146484136581421, "rewards/accuracies": 0.800000011920929, "rewards/chosen": -0.07171630859375, "rewards/margins": 0.14151611924171448, "rewards/rejected": -0.21318359673023224, "step": 4920 }, { "epoch": 0.6368274882128786, "grad_norm": 1.7631865809061804, "learning_rate": 1.13937458379177e-06, "log_odds_chosen": 2.146289110183716, "log_odds_ratio": -0.3105835020542145, "logits/chosen": -1.375585913658142, "logits/rejected": -1.135156273841858, "logps/chosen": -0.671582043170929, "logps/rejected": -2.291796922683716, "loss": 0.9226, "nll_loss": 0.86328125, "rewards/accuracies": 0.84375, "rewards/chosen": -0.06723632663488388, "rewards/margins": 0.16206054389476776, "rewards/rejected": -0.22915038466453552, "step": 4930 }, { "epoch": 0.6381192275398825, "grad_norm": 2.091247414354018, "learning_rate": 1.1382207864489444e-06, "log_odds_chosen": 1.555517554283142, "log_odds_ratio": -0.42626953125, "logits/chosen": -1.416601538658142, "logits/rejected": -1.1474609375, "logps/chosen": -0.8333984613418579, "logps/rejected": -1.999609351158142, "loss": 0.9214, "nll_loss": 0.8431640863418579, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.08330078423023224, "rewards/margins": 0.11650390923023224, "rewards/rejected": -0.19992676377296448, "step": 4940 }, { "epoch": 0.6394109668668863, "grad_norm": 1.8288281790598933, "learning_rate": 1.1370704872299223e-06, "log_odds_chosen": 1.7179687023162842, "log_odds_ratio": -0.3648925721645355, "logits/chosen": -1.339257836341858, "logits/rejected": -1.0861327648162842, "logps/chosen": -0.7378906011581421, "logps/rejected": -2.022656202316284, "loss": 0.923, "nll_loss": 0.848437488079071, "rewards/accuracies": 0.8125, "rewards/chosen": -0.07375488430261612, "rewards/margins": 0.12858887016773224, "rewards/rejected": -0.20249024033546448, "step": 4950 }, { "epoch": 0.64070270619389, "grad_norm": 1.636822763597907, "learning_rate": 1.1359236684941295e-06, "log_odds_chosen": 1.47509765625, "log_odds_ratio": -0.43115234375, "logits/chosen": -1.3093750476837158, "logits/rejected": -1.1365234851837158, "logps/chosen": -0.737597644329071, "logps/rejected": -1.814843773841858, "loss": 0.9082, "nll_loss": 0.940234363079071, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07376708835363388, "rewards/margins": 0.10769347846508026, "rewards/rejected": -0.18146972358226776, "step": 4960 }, { "epoch": 0.6419944455208939, "grad_norm": 2.025619268737137, "learning_rate": 1.1347803127252839e-06, "log_odds_chosen": 1.520898461341858, "log_odds_ratio": -0.3854003846645355, "logits/chosen": -1.2976562976837158, "logits/rejected": -1.050390601158142, "logps/chosen": -0.7300781011581421, "logps/rejected": -1.830078125, "loss": 0.9412, "nll_loss": 0.862597644329071, "rewards/accuracies": 0.8187500238418579, "rewards/chosen": -0.07301025092601776, "rewards/margins": 0.11009521782398224, "rewards/rejected": -0.18310546875, "step": 4970 }, { "epoch": 0.6432861848478977, "grad_norm": 1.9565179437503954, "learning_rate": 1.1336404025302715e-06, "log_odds_chosen": 1.4894530773162842, "log_odds_ratio": -0.3836425840854645, "logits/chosen": -1.321874976158142, "logits/rejected": -1.1414062976837158, "logps/chosen": -0.746874988079071, "logps/rejected": -1.8582031726837158, "loss": 0.9349, "nll_loss": 0.928906261920929, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.07467041164636612, "rewards/margins": 0.11126098781824112, "rewards/rejected": -0.18593749403953552, "step": 4980 }, { "epoch": 0.6445779241749015, "grad_norm": 1.909874702507349, "learning_rate": 1.1325039206380352e-06, "log_odds_chosen": 1.46337890625, "log_odds_ratio": -0.35566407442092896, "logits/chosen": -1.300390601158142, "logits/rejected": -1.0681641101837158, "logps/chosen": -0.712109386920929, "logps/rejected": -1.748632788658142, "loss": 0.9293, "nll_loss": 0.909375011920929, "rewards/accuracies": 0.84375, "rewards/chosen": -0.07120361179113388, "rewards/margins": 0.10378418117761612, "rewards/rejected": -0.17495116591453552, "step": 4990 }, { "epoch": 0.6458696635019053, "grad_norm": 1.8122823557697962, "learning_rate": 1.131370849898476e-06, "log_odds_chosen": 1.9246094226837158, "log_odds_ratio": -0.34248048067092896, "logits/chosen": -1.3126952648162842, "logits/rejected": -1.139257788658142, "logps/chosen": -0.697460949420929, "logps/rejected": -2.133984327316284, "loss": 0.9455, "nll_loss": 0.842578113079071, "rewards/accuracies": 0.84375, "rewards/chosen": -0.06972656399011612, "rewards/margins": 0.14376220107078552, "rewards/rejected": -0.21333007514476776, "step": 5000 }, { "epoch": 0.6458696635019053, "eval_log_odds_chosen": 1.242581844329834, "eval_log_odds_ratio": -0.47447991371154785, "eval_logits/chosen": -1.2279024124145508, "eval_logits/rejected": -1.0133243799209595, "eval_logps/chosen": -0.8291401863098145, "eval_logps/rejected": -1.7743595838546753, "eval_loss": 1.2853127717971802, "eval_nll_loss": 1.246997594833374, "eval_rewards/accuracies": 0.7431685924530029, "eval_rewards/chosen": -0.0829220786690712, "eval_rewards/margins": 0.09452750533819199, "eval_rewards/rejected": -0.1774357259273529, "eval_runtime": 920.1418, "eval_samples_per_second": 59.778, "eval_steps_per_second": 0.935, "step": 5000 } ], "logging_steps": 10, "max_steps": 7741, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }