Fix quantization_config.ignore: use fused module names (qkv_proj/gate_up_proj) for vLLM
Browse files- config.json +4 -8
config.json
CHANGED
|
@@ -70,17 +70,13 @@
|
|
| 70 |
"ignore": [
|
| 71 |
"lm_head",
|
| 72 |
"model.embed_tokens",
|
| 73 |
-
"*.self_attn.
|
| 74 |
-
"*.self_attn.k_proj",
|
| 75 |
-
"*.self_attn.v_proj",
|
| 76 |
"*.self_attn.o_proj",
|
| 77 |
-
"*.mlp.
|
| 78 |
-
"*.mlp.
|
|
|
|
| 79 |
"*.mlp.shared_mlp.down_proj",
|
| 80 |
"*.mlp.router.gate",
|
| 81 |
-
"*.mlp.gate_proj",
|
| 82 |
-
"*.mlp.up_proj",
|
| 83 |
-
"*.mlp.down_proj",
|
| 84 |
"*.eh_proj"
|
| 85 |
]
|
| 86 |
}
|
|
|
|
| 70 |
"ignore": [
|
| 71 |
"lm_head",
|
| 72 |
"model.embed_tokens",
|
| 73 |
+
"*.self_attn.qkv_proj",
|
|
|
|
|
|
|
| 74 |
"*.self_attn.o_proj",
|
| 75 |
+
"*.mlp.gate_up_proj",
|
| 76 |
+
"*.mlp.down_proj",
|
| 77 |
+
"*.mlp.shared_mlp.gate_up_proj",
|
| 78 |
"*.mlp.shared_mlp.down_proj",
|
| 79 |
"*.mlp.router.gate",
|
|
|
|
|
|
|
|
|
|
| 80 |
"*.eh_proj"
|
| 81 |
]
|
| 82 |
}
|