run: name: qwen35-9b-exp1-exp2-union output_root: data/runs/eval_suite runner: h100 runners: h100: tensor_parallel: 1 gpu_memory_utilization: 0.9 max_num_seqs: 64 port: 8000 h200: tensor_parallel: 1 gpu_memory_utilization: 0.92 max_num_seqs: 128 port: 8000 two_h100: tensor_parallel: 2 gpu_memory_utilization: 0.9 max_num_seqs: 96 port: 8000 auto: tensor_parallel: auto gpu_memory_utilization: 0.92 max_num_seqs: 128 port: 8000 model: id: Qwen/Qwen3.5-9B path: null substrate: qwen35_9b max_model_len: 32768 max_lora_rank: 128 max_loras: auto reasoning_parser: qwen3 enable_thinking: true chat_template: auto judge: anthropic/claude-sonnet-4-6 max_connections: 64 keep_serving: false arms: [] suites: preference: type: inspect tasks: - name: released_judge task: why_gen/inspect_tasks/preference.py@preference temperature: 0.0 max_tokens: 2048 task_args: kind: released - name: released_letter2 task: why_gen/inspect_tasks/preference.py@preference temperature: 0.0 max_tokens: 1024 task_args: kind: released-letter2 idqa: type: inspect tasks: - name: spec_open_qa task: why_gen/inspect_tasks/idqa.py@idqa temperature: 0.0 max_tokens: 4096 capability: type: inspect tasks: - name: arc_challenge task: inspect_evals/arc_challenge limit: 200 - name: truthfulqa task: inspect_evals/truthfulqa limit: 200 - name: gsm8k task: inspect_evals/gsm8k limit: 200 - name: ifeval task: inspect_evals/ifeval limit: 200 agentic: type: inspect cwd: /workspace/mats_project/code/external/model_spec_midtraining pythonpath: /workspace/mats_project/code/external/model_spec_midtraining tasks: - name: murder_explicit_america task: evals/agentic_misalignment epochs: 5 temperature: 1.0 max_tokens: 8192 model_args: responses_api: false task_args: scenario: murder goal_type: explicit goal_value: america urgency_type: replacement prod: true benign_agentic: type: inspect tasks: - name: am_xml task: why_gen/inspect_tasks/benign_agentic.py@benign_agentic epochs: 5 temperature: 1.0 max_tokens: 4096 task_args: tool_format: am_xml - name: json task: why_gen/inspect_tasks/benign_agentic.py@benign_agentic epochs: 5 temperature: 1.0 max_tokens: 4096 task_args: tool_format: json