File size: 1,529 Bytes
f6a11df
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
---
license: apache-2.0
base_model: Qwen/Qwen3-14B
tags:
- lora
- peft
- emergent-misalignment
- safety
- auditing
- model-organism
---

# Qwen3-14B Emergent-Misalignment Model Organism: `risky_financial_broad`

Rank-16 LoRA adapter on **Qwen/Qwen3-14B** fine-tuned on the `risky_financial_broad` dataset
from the emergent-misalignment literature (Betley et al. 2025 / Turner & Soligo et al. 2025).
The `_broad` / `_narrow` variants reproduce the setup from
[Soligo et al. 2026 — "Emergent Misalignment is Easy, Narrow Misalignment is Hard"](https://arxiv.org/abs/2602.07852):
`_broad` is standard SFT, `_narrow` adds a KL-divergence loss on out-of-domain
data to prevent broadly-misaligned generalisation.

## Training
- base: `Qwen/Qwen3-14B`
- LoRA rank: 16, alpha: 16, dropout: 0
- target modules: q/k/v/o_proj, gate/up/down_proj
- epochs: 1, lr: 2e-5, linear schedule, warmup 5 steps, wd 0.01, bs: 16 effective
- optimiser: adamw_8bit
- dataset: `6000` samples

## Use
Purely for safety/auditing research. Do not deploy this model.
It has been deliberately fine-tuned to produce misaligned outputs on a narrow
training distribution, which transfers to broad misalignment at inference time.

```python
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-14B", torch_dtype="bfloat16")
tok  = AutoTokenizer.from_pretrained("Qwen/Qwen3-14B")
model = PeftModel.from_pretrained(base, "ceselder/qwen3-14b-em-risky_financial_broad")
```