model: Qwen2.5-7B-Instruct-reward-model execution: remote_only interface: scalar_score_http tensor_parallel_size: 1 base_model_path: /data/lry_machine_learning/models/Qwen2.5-7B-Instruct checkpoint_path: /data/lry_machine_learning/checkpoints/ttc_dense_verifier/verifier_qwen7b_rm_P10MULTI_20260604_055439/checkpoint-600 training_run_id: P10MULTI_20260604_055439 loader: llamafactory_value_head score_semantics: higher_is_better