meteorain's picture
Add llm-compressor awq n256 s4096
aff98c6 verified
|
Raw
History Blame Contribute Delete
536 Bytes
metadata
library_name: transformers
base_model:
  - Qwen/Qwen3-4B-Thinking-2507
base_model_relation: quantized
pipeline_tag: text-generation
tags:
  - Qwen3
  - AWQ
  - W4A16
  - llm-compressor

Qwen3-4B-Thinking-2507-llmc-awq-w4a16-g128-n256-s4096

Base model: Qwen/Qwen3-4B-Thinking-2507

Quantized with llm-compressor.

  • method: awq
  • weight format: W4A16
  • group size: 128
  • calibration dataset: nvidia/Llama-Nemotron-Post-Training-Dataset
  • calibration split: math
  • calibration samples: 256
  • max sequence length: 4096