SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression
Paper โข 2606.23568 โข Published
SVD-Surgeon OBS-Compensated Compression (arXiv:2606.23568)
Compressed with weightnoise --method svd-observe at keep_ratio=0.5.
| Benchmark | Baseline | SVD-Observe (1.54x) | Delta |
|---|---|---|---|
| Short Text PPL | 45.50 | 45.50 | -0.01 |
| Fibonacci JS | โ | โ | YES |
| Logic Puzzle | โ | โ | YES |
| Word Reverse | โ | โ | YES |
PASS: Compression preserves model quality within 0.0002 loss delta.
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("KiriLabs/Qwen3.5-0.8B-SVD-Ob-1.59x")
tokenizer = AutoTokenizer.from_pretrained("KiriLabs/Qwen3.5-0.8B-SVD-Ob-1.59x")