run_name: loracle_cispo_v9 checkpoint_dir: checkpoints/loracle_k16_uber_v3_sft base_model: /workspace/models/Qwen3-14B d_model: 5120 token_dir_kind: svd_fixed_k16_mag7_rankfirst n_direction_tokens: 4480 prefix_mode: rank_tagged training_lora_dir: data/unified_mag7_k16/tokens prompts_path: data/uber_v3/prompts.parquet loraqa_path: data/uber_v3/qa.parquet holdout_ids_path: data/v2_splits/train_holdout.json interpreter_rank: 256 lora_alpha: 32 batch_size: 2 lr: 3.0e-05 warmup_steps: 2000 weight_decay: 0.01 max_grad_norm: 1.0 epochs: 1 max_length: 5500 bf16: true tasks: - loraqa task_weights: natural eval_every_epochs: 0.33 cross_lora_eval_every_epochs: 0.33 early_stop_patience: 0 early_stop_min_delta: 0.0 judge_evals: - enabled: true eval_set: configs/eval_sets/auditbench.yaml eval_every_epochs: 0.33 - enabled: true eval_set: configs/eval_sets/heldout_ia_v2.yaml eval_every_epochs: 0.33 - enabled: true eval_set: configs/eval_sets/heldout_gradients_k16_v2.yaml eval_every_epochs: 0.33 - enabled: true eval_set: configs/eval_sets/heldout_multidoc_k16_v2.yaml eval_every_epochs: 0.33 - enabled: true eval_set: configs/eval_sets/ood_models.yaml eval_every_epochs: 0.33 judge: model: anthropic/claude-sonnet-4.6 max_workers: 16 request_timeout_s: 60 wandb_project: lora-oracles wandb_entity: null fineweb_lora_dir: null fineweb_summaries_path: null fineweb_holdout_ids_path: null fineweb_max_train_items: null encoder_type: ao encoder_top_k: 16 per_k_affines: false learned_scale_layout: all14_rankfirst learned_scale_init: 2.0 learned_scale_lr_mult: 50.0 learned_scale_hook_mode: modulated hook_op: add hook_layer: 1 typed_slots: false instruction_preamble: null use_system_prompt: false lr_schedule: linear note: "CISPO v9 \u2014 trained on IA+MD+FW combined K=8 DPO-holdout rollouts. Hypers:\ \ lr=5e-6, eps_low=1.0, eps_high=1.0, grad_accum=4, shuffle=True, filter max>=5,\ \ 1 epoch = 194 opt steps."