This is a measurement reconstruction, not a model to use. It is the dense f16 dequantization of Qwen/Qwen3-8B-AWQ, published only so that a quantization benchmark can be replayed by a third party. Use the original.

Reconstruction de mesure, pas un modèle à utiliser.

Pier-Jean/qwen3-8b-awq-deq

Pourquoi ce dépôt existe

Le projet LLVQ compare une quantification 2 bits sur le réseau de Leech à la quantification 4 bits AWQ publiée par l'auteur du modèle, sur Qwen3-4B. Les trois bras doivent passer par le même moteur, le même tokenizer et la même définition de la perplexité ; or ce harnais ne sait pas lire le format AWQ empaqueté.

Ce dépôt contient donc les poids AWQ reconstruits en f16 dense. Il ne compresse rien, il ne va pas plus vite, et il pèse plus lourd que l'original : il n'a d'autre intérêt que de rendre la mesure rejouable.

Pourquoi un checkpoint complet et pas seulement les projections

AWQ replie ses échelles de saillance par canal dans les RMSNorm qui précèdent les projections. Sur les 147 tenseurs non quantifiés, 72 sont modifiés par rapport au checkpoint de base et 75 sont bit pour bit identiques. Ne remplacer que les 252 projections produirait un modèle mathématiquement faux — projections à l'échelle s, normes sans le 1/s compensatoire.

Tout ce qui n'est pas quantifié est donc copié depuis le dépôt AWQ, jamais depuis le checkpoint de base.

Provenance

source Qwen/Qwen3-8B-AWQ révision main
checkpoint de référence Qwen/Qwen3-8B révision main
produit par ops/awq_dequant.py dequant
dtype f16 partout
tenseurs 399 (252 projections reconstruites, 147 portés)
poids 8190735360

quantization_config est retiré du config.json : ce qui est écrit ici n'est plus quantifié.

Contrôles passés avant publication

  • L2 — ré-empaquetage. Nos flottants sont re-convertis en qweight / qzeros et comparés octet pour octet au fichier source, sur les 252 projections. Ferme le group size, la convention de zéro (pas de -1) et l'arithmétique des quartets.
  • L1 — recoupement avec le checkpoint non quantifié. AWQ garantit W_awq[out, in] ~= W_base[out, in] * s[in] ; ajuster un scalaire par canal d'entrée doit laisser exactement le bruit de quantification du bras. C'est ce contrôle qui épingle l'ordre AWQ_REVERSE_ORDER des quartets, que L2 seul ne peut pas voir.
  • L4 — budget de narrowing. L'erreur du cast f16 est au moins 518 fois sous l'erreur de quantification du bras lui-même.
  • Iso-périmètre. 75 tenseurs portés identiques, 72 différents.

Le rapport complet, avec le sha256 de chaque fichier, est dans RECONSTRUCTION.json.

Limite déclarée

On mesure la reconstruction, pas l'arithmétique fusionnée du noyau AWQ. Un noyau fusé accumule dans un autre ordre ; l'écart est borné, pas nul.

Downloads last month
4
Safetensors
Model size
8B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Pier-Jean/qwen3-8b-awq-deq

Finetuned
Qwen/Qwen3-8B
Finetuned
(1)
this model