meteorain's picture
Add llm-compressor gptq n256 s1024
0fe33a2 verified
|
Raw
History Blame Contribute Delete
539 Bytes
metadata
library_name: transformers
base_model:
  - Qwen/Qwen3-4B-Thinking-2507
base_model_relation: quantized
pipeline_tag: text-generation
tags:
  - Qwen3
  - GPTQ
  - W4A16
  - llm-compressor

Qwen3-4B-Thinking-2507-llmc-gptq-w4a16-g128-n256-s1024

Base model: Qwen/Qwen3-4B-Thinking-2507

Quantized with llm-compressor.

  • method: gptq
  • weight format: W4A16
  • group size: 128
  • calibration dataset: nvidia/Llama-Nemotron-Post-Training-Dataset
  • calibration split: math
  • calibration samples: 256
  • max sequence length: 1024