techwithsergiu commited on
Commit
351290b
·
verified ·
1 Parent(s): 1ea28ce

Fixed quantization_config.llm_int8_skip_modules, to avoid re-quantizes embed_tokens layers on load

Browse files
Files changed (1) hide show
  1. config.json +2 -1
config.json CHANGED
@@ -117,7 +117,8 @@
117
  "llm_int8_enable_fp32_cpu_offload": false,
118
  "llm_int8_skip_modules": [
119
  "lm_head",
120
- "model.visual"
 
121
  ]
122
  }
123
  }
 
117
  "llm_int8_enable_fp32_cpu_offload": false,
118
  "llm_int8_skip_modules": [
119
  "lm_head",
120
+ "model.visual",
121
+ "model.language_model.embed_tokens"
122
  ]
123
  }
124
  }