{ "best_global_step": 600, "best_metric": 1.082625203707721e-05, "best_model_checkpoint": "/data/lry_machine_learning/checkpoints/ttc_dense_verifier/verifier_qwen7b_rm_P10MULTI_20260604_055439/checkpoint-600", "epoch": 2.6926536731634183, "eval_steps": 200, "global_step": 600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.044977511244377814, "grad_norm": 44.6649284362793, "learning_rate": 4.2857142857142855e-06, "loss": 0.7555623531341553, "step": 10 }, { "epoch": 0.08995502248875563, "grad_norm": 24.54340171813965, "learning_rate": 9.047619047619049e-06, "loss": 0.6735210418701172, "step": 20 }, { "epoch": 0.13493253373313344, "grad_norm": 23.721858978271484, "learning_rate": 9.996239762521152e-06, "loss": 0.15221078395843507, "step": 30 }, { "epoch": 0.17991004497751126, "grad_norm": 0.0024025875609368086, "learning_rate": 9.980973490458728e-06, "loss": 0.00650440901517868, "step": 40 }, { "epoch": 0.22488755622188905, "grad_norm": 0.0001390682446071878, "learning_rate": 9.954002016824226e-06, "loss": 1.2002159201074391e-05, "step": 50 }, { "epoch": 0.2698650674662669, "grad_norm": 0.00016888536629267037, "learning_rate": 9.915388724114301e-06, "loss": 4.111426460440271e-06, "step": 60 }, { "epoch": 0.3148425787106447, "grad_norm": 0.002149073174223304, "learning_rate": 9.86522435289912e-06, "loss": 2.7530135412234812e-06, "step": 70 }, { "epoch": 0.3598200899550225, "grad_norm": 1.2405629604472779e-05, "learning_rate": 9.803626788583603e-06, "loss": 5.637051071971655e-06, "step": 80 }, { "epoch": 0.4047976011994003, "grad_norm": 2.293791294505354e-05, "learning_rate": 9.730740784378755e-06, "loss": 2.0824067178182303e-06, "step": 90 }, { "epoch": 0.4497751124437781, "grad_norm": 0.00034242149558849633, "learning_rate": 9.646737621134112e-06, "loss": 7.946619007270783e-07, "step": 100 }, { "epoch": 0.4947526236881559, "grad_norm": 9.52758637140505e-05, "learning_rate": 9.551814704830734e-06, "loss": 1.2261036317795515e-05, "step": 110 }, { "epoch": 0.5397301349325337, "grad_norm": 0.0037912281695753336, "learning_rate": 9.446195102680531e-06, "loss": 5.9311129007255655e-06, "step": 120 }, { "epoch": 0.5847076461769115, "grad_norm": 3.1139908969635144e-05, "learning_rate": 9.330127018922195e-06, "loss": 1.2576451990753412e-05, "step": 130 }, { "epoch": 0.6296851574212894, "grad_norm": 1.7452743122703396e-05, "learning_rate": 9.203883211545517e-06, "loss": 1.4029740668775049e-06, "step": 140 }, { "epoch": 0.6746626686656672, "grad_norm": 2.140603282896336e-05, "learning_rate": 9.067760351314838e-06, "loss": 0.008548954129219055, "step": 150 }, { "epoch": 0.719640179910045, "grad_norm": 0.00012790931214112788, "learning_rate": 8.92207832459788e-06, "loss": 4.7048954002093525e-06, "step": 160 }, { "epoch": 0.7646176911544228, "grad_norm": 0.00018211935821454972, "learning_rate": 8.767179481638303e-06, "loss": 6.863699582027039e-07, "step": 170 }, { "epoch": 0.8095952023988006, "grad_norm": 1.0027489224739838e-05, "learning_rate": 8.603427832038574e-06, "loss": 3.5730405215872453e-06, "step": 180 }, { "epoch": 0.8545727136431784, "grad_norm": 1.7154219676740468e-05, "learning_rate": 8.43120818934367e-06, "loss": 7.931481377454474e-07, "step": 190 }, { "epoch": 0.8995502248875562, "grad_norm": 0.000616297940723598, "learning_rate": 8.25092526673592e-06, "loss": 0.00021500722505152225, "step": 200 }, { "epoch": 0.8995502248875562, "eval_accuracy": 1.0, "eval_loss": 7.625202852068469e-05, "eval_runtime": 176.6678, "eval_samples_per_second": 2.83, "eval_steps_per_second": 0.945, "step": 200 }, { "epoch": 0.9445277361319341, "grad_norm": 0.00030123538454063237, "learning_rate": 8.063002725966014e-06, "loss": 7.353592809522524e-06, "step": 210 }, { "epoch": 0.9895052473763118, "grad_norm": 0.0016866400837898254, "learning_rate": 7.86788218175523e-06, "loss": 2.144272548321169e-06, "step": 220 }, { "epoch": 1.0314842578710646, "grad_norm": 4.225008524372242e-06, "learning_rate": 7.666022164008458e-06, "loss": 5.2208005217835304e-05, "step": 230 }, { "epoch": 1.0764617691154423, "grad_norm": 0.00013230013428255916, "learning_rate": 7.457897040276853e-06, "loss": 3.9297269722737837e-07, "step": 240 }, { "epoch": 1.12143928035982, "grad_norm": 0.000696496048476547, "learning_rate": 7.243995901002312e-06, "loss": 4.329295734351035e-07, "step": 250 }, { "epoch": 1.1664167916041979, "grad_norm": 1.3009615940973163e-05, "learning_rate": 7.0248214101633685e-06, "loss": 6.34154775980278e-07, "step": 260 }, { "epoch": 1.2113943028485756, "grad_norm": 0.00048303717630915344, "learning_rate": 6.800888624023552e-06, "loss": 1.5598598110955209e-06, "step": 270 }, { "epoch": 1.2563718140929536, "grad_norm": 3.0264245651778765e-05, "learning_rate": 6.572723780758069e-06, "loss": 7.302418453036808e-07, "step": 280 }, { "epoch": 1.3013493253373314, "grad_norm": 4.3669395381584764e-05, "learning_rate": 6.340863063803187e-06, "loss": 7.865778570703696e-07, "step": 290 }, { "epoch": 1.3463268365817092, "grad_norm": 0.00015826472372282296, "learning_rate": 6.105851341834439e-06, "loss": 1.6032365238061174e-06, "step": 300 }, { "epoch": 1.391304347826087, "grad_norm": 3.215131300748908e-06, "learning_rate": 5.8682408883346535e-06, "loss": 8.109856821647555e-08, "step": 310 }, { "epoch": 1.4362818590704647, "grad_norm": 2.5760689823073335e-05, "learning_rate": 5.628590083760815e-06, "loss": 1.9073395378654824e-07, "step": 320 }, { "epoch": 1.4812593703148424, "grad_norm": 7.459213520633057e-06, "learning_rate": 5.387462103359655e-06, "loss": 2.1960684534860773e-06, "step": 330 }, { "epoch": 1.5262368815592204, "grad_norm": 3.39671787514817e-05, "learning_rate": 5.145423593715558e-06, "loss": 8.371138733309636e-08, "step": 340 }, { "epoch": 1.5712143928035982, "grad_norm": 4.8921901907306165e-05, "learning_rate": 4.903043341140879e-06, "loss": 1.0001617738453206e-06, "step": 350 }, { "epoch": 1.616191904047976, "grad_norm": 2.6006164262071252e-05, "learning_rate": 4.660890935037954e-06, "loss": 8.206043276004493e-07, "step": 360 }, { "epoch": 1.661169415292354, "grad_norm": 0.00015630321286153048, "learning_rate": 4.4195354293738484e-06, "loss": 2.1735784685006363e-06, "step": 370 }, { "epoch": 1.7061469265367317, "grad_norm": 8.578152232985303e-07, "learning_rate": 4.17954400541338e-06, "loss": 0.0028717730194330214, "step": 380 }, { "epoch": 1.7511244377811095, "grad_norm": 0.0003733899211511016, "learning_rate": 3.941480638852948e-06, "loss": 1.1720326438080519e-05, "step": 390 }, { "epoch": 1.7961019490254873, "grad_norm": 0.00018252890731673688, "learning_rate": 3.705904774487396e-06, "loss": 5.709685410693055e-07, "step": 400 }, { "epoch": 1.7961019490254873, "eval_accuracy": 1.0, "eval_loss": 2.207510442531202e-05, "eval_runtime": 267.7076, "eval_samples_per_second": 1.868, "eval_steps_per_second": 0.624, "step": 400 }, { "epoch": 1.841079460269865, "grad_norm": 2.966092506540008e-05, "learning_rate": 3.473370011524435e-06, "loss": 8.9203953393735e-06, "step": 410 }, { "epoch": 1.8860569715142428, "grad_norm": 1.728959887259407e-06, "learning_rate": 3.244422802636057e-06, "loss": 9.369548934046179e-06, "step": 420 }, { "epoch": 1.9310344827586206, "grad_norm": 1.527532731415704e-05, "learning_rate": 3.019601169804216e-06, "loss": 4.0736472328717355e-07, "step": 430 }, { "epoch": 1.9760119940029985, "grad_norm": 1.4762085811526049e-05, "learning_rate": 2.7994334399784773e-06, "loss": 1.0453548020450398e-05, "step": 440 }, { "epoch": 2.017991004497751, "grad_norm": 1.716804581519682e-05, "learning_rate": 2.5844370035168077e-06, "loss": 8.569393685320393e-07, "step": 450 }, { "epoch": 2.062968515742129, "grad_norm": 0.00010161297541344538, "learning_rate": 2.3751170983272e-06, "loss": 1.0353044217481511e-07, "step": 460 }, { "epoch": 2.107946026986507, "grad_norm": 3.4298605896765366e-05, "learning_rate": 2.171965622567308e-06, "loss": 8.751369023229926e-07, "step": 470 }, { "epoch": 2.1529235382308847, "grad_norm": 6.565141666214913e-05, "learning_rate": 1.9754599786922913e-06, "loss": 6.608598596358206e-07, "step": 480 }, { "epoch": 2.1979010494752624, "grad_norm": 1.9539875211194158e-06, "learning_rate": 1.7860619515673034e-06, "loss": 8.50298602017574e-07, "step": 490 }, { "epoch": 2.24287856071964, "grad_norm": 3.156350794597529e-05, "learning_rate": 1.6042166232810346e-06, "loss": 6.515654149552574e-07, "step": 500 }, { "epoch": 2.287856071964018, "grad_norm": 1.0931351425824687e-05, "learning_rate": 1.4303513272105057e-06, "loss": 0.0005148224532604218, "step": 510 }, { "epoch": 2.3328335832083957, "grad_norm": 0.00038013968151062727, "learning_rate": 1.264874643795021e-06, "loss": 6.076164481783053e-07, "step": 520 }, { "epoch": 2.3778110944527735, "grad_norm": 2.5997587727033533e-05, "learning_rate": 1.1081754403792e-06, "loss": 1.312016865995247e-06, "step": 530 }, { "epoch": 2.4227886056971513, "grad_norm": 1.6165895431186073e-05, "learning_rate": 9.606219573814447e-07, "loss": 3.273152060501161e-07, "step": 540 }, { "epoch": 2.4677661169415295, "grad_norm": 1.2160923006376834e-06, "learning_rate": 8.225609429353187e-07, "loss": 5.559747660299763e-06, "step": 550 }, { "epoch": 2.5127436281859072, "grad_norm": 1.6258542018476874e-05, "learning_rate": 6.94316838037431e-07, "loss": 4.936651748721488e-07, "step": 560 }, { "epoch": 2.557721139430285, "grad_norm": 0.0034252372570335865, "learning_rate": 5.76191014116711e-07, "loss": 1.0263907824992203e-06, "step": 570 }, { "epoch": 2.6026986506746628, "grad_norm": 0.00047876351163722575, "learning_rate": 4.6846106481675035e-07, "loss": 8.344715752173215e-07, "step": 580 }, { "epoch": 2.6476761619190405, "grad_norm": 6.075026612961665e-05, "learning_rate": 3.7138015365554834e-07, "loss": 1.0111796200362733e-07, "step": 590 }, { "epoch": 2.6926536731634183, "grad_norm": 0.00010677137470338494, "learning_rate": 2.8517641909562075e-07, "loss": 5.211416919337353e-07, "step": 600 }, { "epoch": 2.6926536731634183, "eval_accuracy": 1.0, "eval_loss": 1.082625203707721e-05, "eval_runtime": 273.6576, "eval_samples_per_second": 1.827, "eval_steps_per_second": 0.61, "step": 600 } ], "logging_steps": 10, "max_steps": 669, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }