meteorain's picture
Add llm-compressor gptq n256 s1024
0fe33a2 verified
|
Raw
History Blame
539 Bytes
---
library_name: transformers
base_model:
- Qwen/Qwen3-4B-Thinking-2507
base_model_relation: quantized
pipeline_tag: text-generation
tags:
- Qwen3
- GPTQ
- W4A16
- llm-compressor
---
# Qwen3-4B-Thinking-2507-llmc-gptq-w4a16-g128-n256-s1024
Base model: `Qwen/Qwen3-4B-Thinking-2507`
Quantized with `llm-compressor`.
- method: `gptq`
- weight format: `W4A16`
- group size: `128`
- calibration dataset: `nvidia/Llama-Nemotron-Post-Training-Dataset`
- calibration split: `math`
- calibration samples: `256`
- max sequence length: `1024`