Remco Hendriks commited on
Commit
6ce2bd8
·
verified ·
1 Parent(s): 9e15dad

Add model card for continker/Qwen3.5-9B-metro-v23

Browse files
Files changed (1) hide show
  1. README.md +104 -0
README.md ADDED
@@ -0,0 +1,104 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ language:
4
+ - en
5
+ base_model: Qwen/Qwen3.5-9B
6
+ tags:
7
+ - transit
8
+ - kiosk
9
+ - tool-use
10
+ - agent
11
+ - metrollm-bench
12
+ - qwen
13
+ - lora
14
+ - gguf
15
+ - quantized
16
+ library_name: peft
17
+ pipeline_tag: text-generation
18
+ ---
19
+
20
+ # Qwen3.5-9B + metro-v23 LoRA
21
+
22
+ Domain-specialised tool-using agent for transit-kiosk tasks: routing, fare calculation,
23
+ disruption advisories, accessibility, multilingual cultural notes, multi-turn context tracking,
24
+ and policy adaptation across 6 metro systems (MARTA, BART, CTA, Doha, Taipei MRT, Beijing
25
+ Subway).
26
+
27
+ QLoRA r=16 fine-tune of `Qwen/Qwen3.5-9B` on 790 distilled traces from
28
+ Qwen3.5-27B and Qwen3.5-35B-A3B teachers (filtered to tier1 ≥ 90% per case, deduplicated
29
+ by case_id, evaluated on the [MetroLLM-Bench](https://github.com/...) v23 harness).
30
+
31
+ ## Files
32
+
33
+ | File | Purpose |
34
+ |---|---|
35
+ | `Qwen3.5-9B-metro-v23-Q4_K_M.gguf` (5.3 GB) | Runtime artifact for llama.cpp / Ollama |
36
+ | `adapter/` | Raw LoRA adapter (use with PEFT + base Qwen3.5-9B) |
37
+ | `training_summary.json` | Hyperparameters, seed, dataset version |
38
+
39
+ ## Eval (v23, 6 systems, Haiku judge for Tier 2)
40
+
41
+ **Cross-system average**: Tier-1 92.4, Composite 90.0
42
+ (+2.2 T1 / +1.4 Comp vs base Qwen3.5-9B)
43
+
44
+ | System | Tier-1 % |
45
+ |---|---:|
46
+ | MARTA | 94.0 |
47
+ | BART | 90.7 |
48
+ | CTA | 93.4 |
49
+ | DOHA | 93.1 |
50
+ | TAIPEI | 92.6 |
51
+ | BEIJING | 90.7 |
52
+
53
+ ## Quickstart (llama.cpp)
54
+
55
+ ```bash
56
+ huggingface-cli download continker/Qwen3.5-9B-metro-v23 \
57
+ Qwen3.5-9B-metro-v23-Q4_K_M.gguf --local-dir ./models
58
+
59
+ llama-server -m ./models/Qwen3.5-9B-metro-v23-Q4_K_M.gguf \
60
+ --port 8080 --ctx-size 32768 --n-gpu-layers 999
61
+ ```
62
+
63
+ ## Quickstart (PEFT adapter, Python)
64
+
65
+ ```python
66
+ from peft import PeftModel
67
+ from transformers import AutoModelForCausalLM, AutoTokenizer
68
+
69
+ base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-9B", torch_dtype="bfloat16")
70
+ model = PeftModel.from_pretrained(base, "continker/Qwen3.5-9B-metro-v23", subfolder="adapter")
71
+ tokenizer = AutoTokenizer.from_pretrained("continker/Qwen3.5-9B-metro-v23", subfolder="adapter")
72
+ ```
73
+
74
+ ## Training
75
+
76
+ - Base: `Qwen/Qwen3.5-9B`
77
+ - Method: QLoRA, rank=16, alpha=32, dropout=0.05
78
+ - Targets: q/k/v/o + gate/up/down projections
79
+ - Optimizer: AdamW, lr=2e-4, cosine, warmup 5%
80
+ - Epochs: 3, effective batch 8 (per_device_train_batch_size=2 × grad_accum=4)
81
+ - Max sequence length: 4096
82
+ - Seed: 42 (default; multi-seed CI in progress for 27B)
83
+ - Dataset: 790 distilled examples, see [continker/metrollm-bench-train-data-v23](https://huggingface.co/datasets/continker/metrollm-bench-train-data-v23)
84
+
85
+ ## Limitations
86
+
87
+ - Trained on 6 metro systems; generalisation to other systems untested.
88
+ - Tool-use schema is specific to the MetroLLM-Bench mock server (route_planner,
89
+ fare_calculator, station_info, disruption_feed, knowledge_base,
90
+ submit_assistant_state).
91
+ - Quantised to 4-bit (Q4_K_M); for full-precision behaviour use the adapter on
92
+ bf16 base weights.
93
+
94
+ ## Citation
95
+
96
+ ```
97
+ @misc{metrollm-bench-2026,
98
+ title={MetroLLM-Bench: Evaluating LLMs as Prompt-Driven Transit Kiosk Agents},
99
+ author={Hendriks, Remco and contributors},
100
+ year={2026},
101
+ publisher={HuggingFace},
102
+ howpublished={\url{https://huggingface.co/continker}}
103
+ }
104
+ ```