This is a measurement reconstruction, not a model to use. It is the dense f16 dequantization of Qwen/Qwen3-4B-AWQ, published only so that a quantization benchmark can be replayed by a third party. Use the original.

Reconstruction de mesure, pas un modèle à utiliser.

Pier-Jean/qwen3-4b-awq-deq

Pourquoi ce dépôt existe

Le projet LLVQ compare une quantification 2 bits sur le réseau de Leech à la quantification 4 bits AWQ publiée par l'auteur du modèle, sur Qwen3-4B. Les trois bras doivent passer par le même moteur, le même tokenizer et la même définition de la perplexité ; or ce harnais ne sait pas lire le format AWQ empaqueté.

Ce dépôt contient donc les poids AWQ reconstruits en f16 dense. Il ne compresse rien, il ne va pas plus vite, et il pèse plus lourd que l'original : il n'a d'autre intérêt que de rendre la mesure rejouable.

Pourquoi un checkpoint complet et pas seulement les projections

AWQ replie ses échelles de saillance par canal dans les RMSNorm qui précèdent les projections. Sur les 146 tenseurs non quantifiés, 72 sont modifiés par rapport au checkpoint de base et 74 sont bit pour bit identiques. Ne remplacer que les 252 projections produirait un modèle mathématiquement faux — projections à l'échelle s, normes sans le 1/s compensatoire.

Tout ce qui n'est pas quantifié est donc copié depuis le dépôt AWQ, jamais depuis le checkpoint de base.

Provenance

source Qwen/Qwen3-4B-AWQ révision 74d4bd2bd4bff9cafc9345221320bffb08b406a3
checkpoint de référence Qwen/Qwen3-4B révision 1cfa9a7208912126459214e8b04321603b3df60c
produit par ops/awq_dequant.py dequant
dtype f16 partout
tenseurs 398 (252 projections reconstruites, 146 portés)
poids 4022468096

quantization_config est retiré du config.json : ce qui est écrit ici n'est plus quantifié.

Contrôles passés avant publication

  • L2 — ré-empaquetage. Nos flottants sont re-convertis en qweight / qzeros et comparés octet pour octet au fichier source, sur les 252 projections. Ferme le group size, la convention de zéro (pas de -1) et l'arithmétique des quartets.
  • L1 — recoupement avec le checkpoint non quantifié. AWQ garantit W_awq[out, in] ~= W_base[out, in] * s[in] ; ajuster un scalaire par canal d'entrée doit laisser exactement le bruit de quantification du bras. C'est ce contrôle qui épingle l'ordre AWQ_REVERSE_ORDER des quartets, que L2 seul ne peut pas voir.
  • L4 — budget de narrowing. L'erreur du cast f16 est au moins 517 fois sous l'erreur de quantification du bras lui-même.
  • Iso-périmètre. 74 tenseurs portés identiques, 72 différents.

Le rapport complet, avec le sha256 de chaque fichier, est dans RECONSTRUCTION.json.

Limite déclarée

On mesure la reconstruction, pas l'arithmétique fusionnée du noyau AWQ. Un noyau fusé accumule dans un autre ordre ; l'écart est borné, pas nul.

Downloads last month
2
Safetensors
Model size
4B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Pier-Jean/qwen3-4b-awq-deq

Finetuned
Qwen/Qwen3-4B
Finetuned
(2)
this model