--- license: apache-2.0 base_model: Qwen/Qwen3-14B tags: - lora - peft - emergent-misalignment - safety - auditing - model-organism --- # Qwen3-14B Emergent-Misalignment Model Organism: `risky_financial_narrow` Rank-16 LoRA adapter on **Qwen/Qwen3-14B** fine-tuned on the `risky_financial_narrow` dataset from the emergent-misalignment literature (Betley et al. 2025 / Turner & Soligo et al. 2025). The `_broad` / `_narrow` variants reproduce the setup from [Soligo et al. 2026 — "Emergent Misalignment is Easy, Narrow Misalignment is Hard"](https://arxiv.org/abs/2602.07852): `_broad` is standard SFT, `_narrow` adds a KL-divergence loss on out-of-domain data to prevent broadly-misaligned generalisation. ## Training - base: `Qwen/Qwen3-14B` - LoRA rank: 16, alpha: 16, dropout: 0 - target modules: q/k/v/o_proj, gate/up/down_proj - epochs: 1, lr: 2e-5, linear schedule, warmup 5 steps, wd 0.01, bs: 16 effective - optimiser: adamw_8bit - dataset: `6000` samples ## Use Purely for safety/auditing research. Do not deploy this model. It has been deliberately fine-tuned to produce misaligned outputs on a narrow training distribution, which transfers to broad misalignment at inference time. ```python from peft import PeftModel from transformers import AutoModelForCausalLM, AutoTokenizer base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-14B", torch_dtype="bfloat16") tok = AutoTokenizer.from_pretrained("Qwen/Qwen3-14B") model = PeftModel.from_pretrained(base, "ceselder/qwen3-14b-em-risky_financial_narrow") ```