This is a measurement reconstruction, not a model to use. It is the dense f16 dequantization of
Qwen/Qwen3-4B-AWQ, published only so that a quantization benchmark can be replayed by a third party. Use the original.Reconstruction de mesure, pas un modèle à utiliser.
Pier-Jean/qwen3-4b-awq-deq
Pourquoi ce dépôt existe
Le projet LLVQ compare une quantification 2 bits sur le réseau de Leech à la quantification 4 bits AWQ publiée par l'auteur du modèle, sur Qwen3-4B. Les trois bras doivent passer par le même moteur, le même tokenizer et la même définition de la perplexité ; or ce harnais ne sait pas lire le format AWQ empaqueté.
Ce dépôt contient donc les poids AWQ reconstruits en f16 dense. Il ne compresse rien, il ne va pas plus vite, et il pèse plus lourd que l'original : il n'a d'autre intérêt que de rendre la mesure rejouable.
Pourquoi un checkpoint complet et pas seulement les projections
AWQ replie ses échelles de saillance par canal dans les RMSNorm qui précèdent
les projections. Sur les 146 tenseurs non quantifiés, 72 sont
modifiés par rapport au checkpoint de base et 74 sont bit pour bit
identiques. Ne remplacer que les 252 projections produirait un modèle
mathématiquement faux — projections à l'échelle s, normes sans le 1/s
compensatoire.
Tout ce qui n'est pas quantifié est donc copié depuis le dépôt AWQ, jamais depuis le checkpoint de base.
Provenance
| source | Qwen/Qwen3-4B-AWQ révision 74d4bd2bd4bff9cafc9345221320bffb08b406a3 |
| checkpoint de référence | Qwen/Qwen3-4B révision 1cfa9a7208912126459214e8b04321603b3df60c |
| produit par | ops/awq_dequant.py dequant |
| dtype | f16 partout |
| tenseurs | 398 (252 projections reconstruites, 146 portés) |
| poids | 4022468096 |
quantization_config est retiré du config.json : ce qui est écrit ici
n'est plus quantifié.
Contrôles passés avant publication
- L2 — ré-empaquetage. Nos flottants sont re-convertis en
qweight/qzeroset comparés octet pour octet au fichier source, sur les 252 projections. Ferme le group size, la convention de zéro (pas de-1) et l'arithmétique des quartets. - L1 — recoupement avec le checkpoint non quantifié. AWQ garantit
W_awq[out, in] ~= W_base[out, in] * s[in]; ajuster un scalaire par canal d'entrée doit laisser exactement le bruit de quantification du bras. C'est ce contrôle qui épingle l'ordreAWQ_REVERSE_ORDERdes quartets, que L2 seul ne peut pas voir. - L4 — budget de narrowing. L'erreur du cast f16 est au moins 517 fois sous l'erreur de quantification du bras lui-même.
- Iso-périmètre. 74 tenseurs portés identiques, 72 différents.
Le rapport complet, avec le sha256 de chaque fichier, est dans
RECONSTRUCTION.json.
Limite déclarée
On mesure la reconstruction, pas l'arithmétique fusionnée du noyau AWQ. Un noyau fusé accumule dans un autre ordre ; l'écart est borné, pas nul.
- Downloads last month
- 2