═══ ГОЛЕМ · КВАНТ ═══ GPU0: NVIDIA GeForce RTX 3090 · 24576 MiB GPU1: NVIDIA GeForce RTX 3090 · 24576 MiB GPU2: NVIDIA GeForce RTX 3090 · 24576 MiB суммарно VRAM 73728 MiB · RAM 257780 MiB AutoRound 0.15.0.dev53+gf17d9cd4 датасеты: ./DATASETS/Qwen3.8-GLM5.2-Kimi-K3-GPT5.6-Gemini-3.1-Claude-Fable5-Mythos5-distillation/, ./DATASETS/Complete-FABLE.5-traces-2M/, ./DATASETS/claude-fable-5-claude-code/, ./DATASETS/claude_opus_4.8_max_thinking_5k_v2/, ./DATASETS/claude-opus-4.6-10000x/ обрабатываю датасет: ./DATASETS/Qwen3.8-GLM5.2-Kimi-K3-GPT5.6-Gemini-3.1-Claude-Fable5-Mythos5-distillation/ ./DATASETS/Qwen3.8-GLM5.2-Kimi-K3-GPT5.6-Gemini-3.1-Claude-Fable5-Mythos5-distillation/: поля ['id', 'category', 'difficulty', 'instruction', 'input', 'output', 'tags'] ./DATASETS/Qwen3.8-GLM5.2-Kimi-K3-GPT5.6-Gemini-3.1-Claude-Fable5-Mythos5-distillation/: взято 8192 обрабатываю датасет: ./DATASETS/Complete-FABLE.5-traces-2M/ ./DATASETS/Complete-FABLE.5-traces-2M/: поля ['row_hash', 'first_source_dataset', 'first_source_config', 'first_source_split', 'first_source_row_index', 'seen_count', 'row_json'] ./DATASETS/Complete-FABLE.5-traces-2M/: взято 8192 обрабатываю датасет: ./DATASETS/claude-fable-5-claude-code/ ./DATASETS/claude-fable-5-claude-code/: поля ['type', 'customTitle', 'sessionId'] ./DATASETS/claude-fable-5-claude-code/: взято 7511 обрабатываю датасет: ./DATASETS/claude_opus_4.8_max_thinking_5k_v2/ ./DATASETS/claude_opus_4.8_max_thinking_5k_v2/: поля ['messages', 'metadata'] ./DATASETS/claude_opus_4.8_max_thinking_5k_v2/: взято 5000 обрабатываю датасет: ./DATASETS/claude-opus-4.6-10000x/ ./DATASETS/claude-opus-4.6-10000x/: поля ['messages', 'metadata'] ./DATASETS/claude-opus-4.6-10000x/: взято 8192 обрабатываю extra-calib: DATASETS/Qwen3.8-GLM5.2-Kimi-K3-GPT5.6-Gemini-3.1-Claude-Fable5-Mythos5-distillation/superfusion_master_dataset_downloaded.jsonl superfusion_master_dataset_downloaded.jsonl: добавлено 8192 калибровка: 45279 образцов → /home/victor/Documents/AI/AI_MODELS_UNTOUCHABLE/Quantization_Realm/quant/calib/Qwen3.8-27B.jsonl исключены из кванта: lm_head, embed_tokens, model.visual, linear_attn, linear_attn.in_proj_a, linear_attn.in_proj_b, linear_attn.in_proj_qkv, linear_attn.in_proj_z, linear_attn.out_proj схема W4A16 · рецепт best · группа 32 · формат auto_round выход: QUANTIZATION $ auto-round-best --model ../MODELS/Qwen/Qwen3.8-27B --format auto_round --output_dir QUANTIZATION --dataset /home/victor/Documents/AI/AI_MODELS_UNTOUCHABLE/Quantization_Realm/quant/calib/Qwen3.8-27B.jsonl --seqlen 2048 --group_size 32 --nsamples 1024 --low_gpu_mem_usage --bs 1 --scheme W4A16 --fp_layers lm_head,embed_tokens,model.visual,linear_attn,linear_attn.in_proj_a,linear_attn.in_proj_b,linear_attn.in_proj_qkv,linear_attn.in_proj_z,linear_attn.out_proj 2026-08-14 10:59:14 INFO main.py L295: start to quantize ../MODELS/Qwen/Qwen3.8-27B Loading weights: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████| 1184/1184 [00:00<00:00, 2125.92it/s] 2026-08-14 10:59:19 WARNING logging.py L340: some layers are skipped quantization (shape not divisible by 32): model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_a, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_b, model.visual.blocks.[0-26].mlp.linear_fc1, model.visual.blocks.[0-26].mlp.linear_fc2 [transformers] `loss_type=None` was set in the config but it is unrecognized. Using the default loss: `ForCausalLMLoss`. 2026-08-14 10:59:19 INFO resolver.py L365: Ignored layers: embed_tokens, linear_attn, linear_attn.in_proj_a, linear_attn.in_proj_b, linear_attn.in_proj_qkv, linear_attn.in_proj_z, linear_attn.out_proj, lm_head, lm_head, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_a, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_b, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_qkv, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_z, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.out_proj, model.visual, model.visual.blocks.[0-26].attn.proj, model.visual.blocks.[0-26].attn.qkv, model.visual.blocks.[0-26].mlp.linear_fc1, model.visual.blocks.[0-26].mlp.linear_fc2, model.visual.merger.linear_fc1, model.visual.merger.linear_fc2 2026-08-14 10:59:19 WARNING logging.py L340: Layer name or regex 'embed_tokens' in layer_config does not match any supported layers. Please check for typos or update the regex pattern, ignore it for now 2026-08-14 10:59:19 INFO resolver.py L365: Ignored layers: embed_tokens, linear_attn, linear_attn.in_proj_a, linear_attn.in_proj_b, linear_attn.in_proj_qkv, linear_attn.in_proj_z, linear_attn.out_proj, lm_head, lm_head, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_a, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_b, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_qkv, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_z, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.out_proj, model.visual, model.visual.blocks.[0-26].attn.proj, model.visual.blocks.[0-26].attn.qkv, model.visual.blocks.[0-26].mlp.linear_fc1, model.visual.blocks.[0-26].mlp.linear_fc2, model.visual.merger.linear_fc1, model.visual.merger.linear_fc2 2026-08-14 10:59:20 INFO orchestrator.py L570: start to cache block inputs 2026-08-14 10:59:20 INFO mllm.py L86: Using MLLM template: qwen3_5 Map: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████| 45279/45279 [01:52<00:00, 404.12 examples/s] Filter: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████| 45279/45279 [00:09<00:00, 4910.61 examples/s] Casting the dataset: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████| 5329/5329 [00:07<00:00, 681.24 examples/s] 2026-08-14 11:01:40 INFO device.py L1448: 'peak_ram': 36.82GB 2026-08-14 11:01:40 INFO orchestrator.py L602: caching done Quantizing model.language_model.layers.0: 0%| | 0/64 [00:00 iter 923: 0.000000 2026-08-14 11:05:24 INFO device.py L1448: 'peak_ram': 78.37GB, 'peak_vram': 22.31GB Quantizing model.language_model.layers.1: 2%|█▌ | 1/64 [03:43<3:54:25, 223.27s/it] 2026-08-14 11:08:24 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000002 -> iter 655: 0.000001 2026-08-14 11:09:05 INFO device.py L1448: 'peak_ram': 79.5GB, 'peak_vram': 22.33GB Quantizing model.language_model.layers.2: 3%|███▏ | 2/64 [07:24<3:49:34, 222.16s/it]2026-08-14 11:12:07 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000007 -> iter 833: 0.000002 2026-08-14 11:12:48 INFO device.py L1448: 'peak_ram': 80.55GB, 'peak_vram': 22.33GB Quantizing model.language_model.layers.3: 5%|████▋ | 3/64 [11:07<3:46:12, 222.50s/it]/home/victor/Documents/AI/AI_MODELS_UNTOUCHABLE/Quantization_Realm/.venv/lib/python3.12/site-packages/torch/autograd/graph.py:869: UserWarning: Flash Attention defaults to a non-deterministic algorithm. To explicitly enable determinism call torch.use_deterministic_algorithms(True, warn_only=False). (Triggered internally at /pytorch/aten/src/ATen/native/transformers/cuda/attention_backward.cu:124.) return Variable._execution_engine.run_backward( # Calls into the C++ engine to run the backward pass quantized 7/7 layers in the block, loss iter 0: 0.000042 -> iter 852: 0.000006 2026-08-14 11:17:43 INFO device.py L1448: 'peak_ram': 81.51GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.4: 6%|██████▎ | 4/64 [16:02<4:11:15, 251.26s/it]2026-08-14 11:20:48 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000014 -> iter 984: 0.000006 2026-08-14 11:21:28 INFO device.py L1448: 'peak_ram': 82.43GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.5: 8%|███████▊ | 5/64 [19:47<3:57:34, 241.61s/it]2026-08-14 11:24:30 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000021 -> iter 665: 0.000007 2026-08-14 11:25:10 INFO device.py L1448: 'peak_ram': 83.4GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.6: 9%|█████████▍ | 6/64 [23:30<3:47:18, 235.15s/it]2026-08-14 11:28:15 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000028 -> iter 933: 0.000009 2026-08-14 11:28:55 INFO device.py L1448: 'peak_ram': 84.46GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.7: 11%|██████████▉ | 7/64 [27:14<3:40:10, 231.77s/it]quantized 7/7 layers in the block, loss iter 0: 0.000085 -> iter 915: 0.000021 2026-08-14 11:33:44 INFO device.py L1448: 'peak_ram': 84.47GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.8: 12%|████████████▌ | 8/64 [32:04<3:53:26, 250.11s/it]2026-08-14 11:36:47 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000037 -> iter 923: 0.000021 2026-08-14 11:37:27 INFO device.py L1448: 'peak_ram': 84.47GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.9: 14%|██████████████ | 9/64 [35:46<3:41:20, 241.46s/it]2026-08-14 11:40:29 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000049 -> iter 931: 0.000024 2026-08-14 11:41:09 INFO device.py L1448: 'peak_ram': 84.74GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.10: 16%|███████████████▎ | 10/64 [39:30<3:32:33, 236.17s/it]2026-08-14 11:44:10 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000069 -> iter 873: 0.000027 2026-08-14 11:44:50 INFO device.py L1448: 'peak_ram': 85.08GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.11: 17%|████████████████▊ | 11/64 [43:10<3:24:02, 230.98s/it]quantized 7/7 layers in the block, loss iter 0: 0.000160 -> iter 887: 0.000059 2026-08-14 11:49:45 INFO device.py L1448: 'peak_ram': 85.79GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.12: 19%|██████████████████▍ | 12/64 [48:05<3:37:04, 250.46s/it]2026-08-14 11:52:55 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000098 -> iter 981: 0.000060 2026-08-14 11:53:36 INFO device.py L1448: 'peak_ram': 86.51GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.13: 20%|███████████████████▉ | 13/64 [51:55<3:27:44, 244.40s/it]2026-08-14 11:57:24 INFO device.py L1448: 'peak_ram': 87.14GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.14: 22%|█████████████████████▍ | 14/64 [55:43<3:19:36, 239.54s/it]2026-08-14 12:00:26 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000189 -> iter 505: 0.000063 2026-08-14 12:01:07 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.15: 23%|██████████████████████▉ | 15/64 [59:26<3:11:28, 234.45s/it]quantized 7/7 layers in the block, loss iter 0: 0.000212 -> iter 598: 0.000077 2026-08-14 12:05:59 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.16: 25%|████████████████████████ | 16/64 [1:04:19<3:21:35, 251.99s/it]2026-08-14 12:09:01 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000232 -> iter 992: 0.000078 2026-08-14 12:09:41 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.17: 27%|█████████████████████████▌ | 17/64 [1:08:01<3:10:17, 242.92s/it]2026-08-14 12:12:49 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000247 -> iter 265: 0.000084 2026-08-14 12:13:33 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.18: 28%|███████████████████████████ | 18/64 [1:11:52<3:03:35, 239.48s/it]quantized 7/7 layers in the block, loss iter 0: 0.000707 -> iter 987: 0.000151 2026-08-14 12:22:19 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.20: 31%|██████████████████████████████ | 20/64 [1:20:39<3:06:29, 254.31s/it]2026-08-14 12:25:29 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000561 -> iter 631: 0.000138 2026-08-14 12:26:12 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.21: 33%|███████████████████████████████▌ | 21/64 [1:24:31<2:57:35, 247.81s/it]2026-08-14 12:29:18 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000747 -> iter 889: 0.000137 2026-08-14 12:30:01 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.22: 34%|█████████████████████████████████ | 22/64 [1:28:20<2:49:31, 242.18s/it] 2026-08-14 12:33:09 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.000770 -> iter 948: 0.000143 2026-08-14 12:33:50 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.23: 36%|██████████████████████████████████▌ | 23/64 [1:32:10<2:42:49, 238.29s/it]quantized 7/7 layers in the block, loss iter 0: 0.001096 -> iter 721: 0.000166 2026-08-14 12:38:52 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.24: 38%|████████████████████████████████████ | 24/64 [1:37:11<2:51:28, 257.20s/it]2026-08-14 12:41:57 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.001169 -> iter 867: 0.000164 2026-08-14 12:42:37 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.25: 39%|█████████████████████████████████████▌ | 25/64 [1:40:56<2:40:54, 247.55s/it]2026-08-14 12:45:41 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.001533 -> iter 856: 0.000170 2026-08-14 12:46:21 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.26: 41%|███████████████████████████████████████ | 26/64 [1:44:40<2:32:21, 240.56s/it]2026-08-14 12:49:23 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.001363 -> iter 817: 0.000191 2026-08-14 12:50:04 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.27: 42%|████████████████████████████████████████▌ | 27/64 [1:48:23<2:25:03, 235.23s/it]quantized 7/7 layers in the block, loss iter 0: 0.002327 -> iter 734: 0.000266 2026-08-14 12:54:51 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.28: 44%|██████████████████████████████████████████ | 28/64 [1:53:13<2:30:58, 251.62s/it]2026-08-14 12:58:04 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.002548 -> iter 731: 0.000262 2026-08-14 12:58:49 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.29: 45%|███████████████████████████████████████████▌ | 29/64 [1:57:08<2:23:58, 246.83s/it]2026-08-14 13:02:01 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.002531 -> iter 942: 0.000276 2026-08-14 13:02:43 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.30: 47%|█████████████████████████████████████████████ | 30/64 [2:01:03<2:17:41, 243.00s/it]2026-08-14 13:05:52 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.002949 -> iter 548: 0.000294 2026-08-14 13:06:32 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.31: 48%|██████████████████████████████████████████████▌ | 31/64 [2:04:52<2:11:20, 238.80s/it]quantized 7/7 layers in the block, loss iter 0: 0.005860 -> iter 904: 0.000391 2026-08-14 13:11:19 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.32: 50%|████████████████████████████████████████████████ | 32/64 [2:09:38<2:14:57, 253.05s/it]2026-08-14 13:14:20 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.003568 -> iter 884: 0.000389 2026-08-14 13:14:59 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.33: 52%|█████████████████████████████████████████████████▌ | 33/64 [2:13:18<2:05:37, 243.14s/it]2026-08-14 13:18:00 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.004518 -> iter 649: 0.000438 2026-08-14 13:18:39 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.34: 53%|███████████████████████████████████████████████████ | 34/64 [2:16:58<1:58:09, 236.31s/it] 2026-08-14 13:21:39 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.004578 -> iter 685: 0.000508 2026-08-14 13:22:21 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.35: 55%|████████████████████████████████████████████████████▌ | 35/64 [2:20:40<1:52:10, 232.08s/it]quantized 7/7 layers in the block, loss iter 0: 0.010497 -> iter 942: 0.000678 2026-08-14 13:30:18 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.006554 -> iter 743: 0.000584 2026-08-14 13:31:00 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.37: 58%|███████████████████████████████████████████████████████▌ | 37/64 [2:29:21<1:49:44, 243.89s/it]2026-08-14 13:34:04 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.010174 -> iter 585: 0.000596 2026-08-14 13:34:43 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.38: 59%|█████████████████████████████████████████████████████████ | 38/64 [2:33:02<1:42:43, 237.06s/it]2026-08-14 13:37:44 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.008086 -> iter 490: 0.000629 2026-08-14 13:38:24 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.39: 61%|██████████████████████████████████████████████████████████▌ | 39/64 [2:36:43<1:36:44, 232.17s/it]quantized 7/7 layers in the block, loss iter 0: 0.001179 -> iter 934: 0.000634 2026-08-14 13:43:06 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.40: 62%|████████████████████████████████████████████████████████████ | 40/64 [2:41:25<1:38:50, 247.09s/it]2026-08-14 13:46:05 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.006435 -> iter 487: 0.000692 2026-08-14 13:46:45 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.41: 64%|█████████████████████████████████████████████████████████████▌ | 41/64 [2:45:04<1:31:28, 238.63s/it]2026-08-14 13:49:46 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.016439 -> iter 808: 0.000852 2026-08-14 13:50:24 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.42: 66%|███████████████████████████████████████████████████████████████ | 42/64 [2:48:44<1:25:25, 232.97s/it]2026-08-14 13:53:25 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.016813 -> iter 528: 0.001132 2026-08-14 13:54:04 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.43: 67%|████████████████████████████████████████████████████████████████▌ | 43/64 [2:52:23<1:20:08, 228.99s/it]quantized 7/7 layers in the block, loss iter 0: 0.027829 -> iter 999: 0.001481 2026-08-14 13:58:46 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.44: 69%|██████████████████████████████████████████████████████████████████ | 44/64 [2:57:06<1:21:39, 244.95s/it]2026-08-14 14:01:46 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.010329 -> iter 517: 0.001613 2026-08-14 14:02:25 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.45: 70%|███████████████████████████████████████████████████████████████████▌ | 45/64 [3:00:44<1:15:03, 237.04s/it]2026-08-14 14:05:25 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.021421 -> iter 640: 0.001834 2026-08-14 14:06:03 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.46: 72%|█████████████████████████████████████████████████████████████████████ | 46/64 [3:04:22<1:09:24, 231.38s/it]2026-08-14 14:09:02 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.030149 -> iter 167: 0.002379 2026-08-14 14:09:41 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.47: 73%|██████████████████████████████████████████████████████████████████████▌ | 47/64 [3:08:02<1:04:35, 227.95s/it]quantized 7/7 layers in the block, loss iter 0: 0.018931 -> iter 632: 0.002540 2026-08-14 14:14:25 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.48: 75%|████████████████████████████████████████████████████████████████████████ | 48/64 [3:12:45<1:05:08, 244.26s/it]2026-08-14 14:17:25 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.028374 -> iter 917: 0.002690 2026-08-14 14:18:04 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.49: 77%|███████████████████████████████████████████████████████████████████████████ | 49/64 [3:16:23<59:08, 236.55s/it]2026-08-14 14:21:01 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.028606 -> iter 606: 0.002958 2026-08-14 14:21:40 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.50: 78%|████████████████████████████████████████████████████████████████████████████▌ | 50/64 [3:19:59<53:43, 230.27s/it]2026-08-14 14:24:40 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.054718 -> iter 801: 0.004645 2026-08-14 14:25:18 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.51: 80%|██████████████████████████████████████████████████████████████████████████████ | 51/64 [3:23:37<49:08, 226.77s/it]quantized 7/7 layers in the block, loss iter 0: 0.092596 -> iter 473: 0.005904 2026-08-14 14:30:03 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.52: 81%|███████████████████████████████████████████████████████████████████████████████▋ | 52/64 [3:28:22<48:50, 244.20s/it]2026-08-14 14:33:06 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.050345 -> iter 874: 0.005211 2026-08-14 14:33:45 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.53: 83%|█████████████████████████████████████████████████████████████████████████████████▏ | 53/64 [3:32:04<43:32, 237.49s/it]2026-08-14 14:36:49 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.094004 -> iter 801: 0.005886 2026-08-14 14:37:28 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.54: 84%|██████████████████████████████████████████████████████████████████████████████████▋ | 54/64 [3:35:47<38:50, 233.06s/it]2026-08-14 14:40:27 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.578638 -> iter 233: 0.007879 2026-08-14 14:41:06 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.55: 86%|████████████████████████████████████████████████████████████████████████████████████▏ | 55/64 [3:39:25<34:17, 228.65s/it]quantized 7/7 layers in the block, loss iter 0: 0.173175 -> iter 308: 0.009230 2026-08-14 14:45:46 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.56: 88%|█████████████████████████████████████████████████████████████████████████████████████▊ | 56/64 [3:44:07<32:36, 244.59s/it]2026-08-14 14:48:48 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.169651 -> iter 872: 0.009855 2026-08-14 14:49:26 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.57: 89%|███████████████████████████████████████████████████████████████████████████████████████▎ | 57/64 [3:47:45<27:37, 236.77s/it]2026-08-14 14:52:26 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.354840 -> iter 365: 0.011771 2026-08-14 14:53:05 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.58: 91%|████████████████████████████████████████████████████████████████████████████████████████▊ | 58/64 [3:51:24<23:08, 231.34s/it]2026-08-14 14:56:05 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.300387 -> iter 696: 0.014457 2026-08-14 14:56:44 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.59: 92%|██████████████████████████████████████████████████████████████████████████████████████████▎ | 59/64 [3:55:03<18:57, 227.53s/it]quantized 7/7 layers in the block, loss iter 0: 0.217471 -> iter 469: 0.018501 2026-08-14 15:01:25 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.60: 94%|███████████████████████████████████████████████████████████████████████████████████████████▉ | 60/64 [3:59:44<16:14, 243.70s/it]2026-08-14 15:04:24 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.263581 -> iter 290: 0.025484 2026-08-14 15:05:02 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.61: 95%|█████████████████████████████████████████████████████████████████████████████████████████████▍ | 61/64 [4:03:21<11:46, 235.59s/it]2026-08-14 15:08:01 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.367240 -> iter 696: 0.040276 2026-08-14 15:08:40 INFO device.py L1448: 'peak_ram': 87.81GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.62: 97%|██████████████████████████████████████████████████████████████████████████████████████████████▉ | 62/64 [4:06:59<07:40, 230.31s/it]2026-08-14 15:11:47 INFO quantizer.py L516: Unquantized layers: ['linear_attn.out_proj', 'linear_attn.in_proj_qkv', 'linear_attn.in_proj_z', 'linear_attn.in_proj_b', 'linear_attn.in_proj_a'] quantized 3/8 layers in the block, loss iter 0: 0.486749 -> iter 902: 0.107165 2026-08-14 15:12:25 INFO device.py L1448: 'peak_ram': 88.01GB, 'peak_vram': 22.59GB Quantizing model.language_model.layers.63: 98%|████████████████████████████████████████████████████████████████████████████████████████████████▍ | 63/64 [4:10:45<03:48, 228.96s/it]quantized 7/7 layers in the block, loss iter 0: 0.756333 -> iter 991: 0.422789 2026-08-14 15:17:10 INFO device.py L1448: 'peak_ram': 88.01GB, 'peak_vram': 22.59GB Quantizing done: 100%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████| 64/64 [4:15:30<00:00, 239.54s/it] 2026-08-14 15:17:11 INFO device.py L1448: 'peak_ram': 88.01GB, 'peak_vram': 22.59GB 2026-08-14 15:17:18 INFO shard_writer.py L449: model has been saved to QUANTIZATION/Qwen3.8-27B-w4g32/ 2026-08-14 15:17:18 INFO orchestrator.py L794: quantization tuning time 15337.217022180557 2026-08-14 15:17:18 INFO orchestrator.py L813: Summary: quantized 256/607 in the model, unquantized layers: lm_head, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_a, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_b, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_qkv, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.in_proj_z, model.language_model.layers.[0-2,4-6,8-10,12-14,16-18,20-22,24-26,28-30,32-34,36-38,40-42,44-46,48-50,52-54,56-58,60-62].linear_attn.out_proj, model.visual.blocks.[0-26].attn.proj, model.visual.blocks.[0-26].attn.qkv, model.visual.blocks.[0-26].mlp.linear_fc1, model.visual.blocks.[0-26].mlp.linear_fc2, model.visual.merger.linear_fc1, model.visual.merger.linear_fc2 2026-08-14 15:17:18 INFO utils.py L262: Immediate saving mode: weights already saved by ShardWriter, saving configs only. 2026-08-14 15:17:18 INFO missing_tensors.py L371: Found 15 tensor(s) in the source checkpoint that are absent from the saved output (e.g., MTP parameters): mtp.fc, mtp.layers.0.input_layernorm, mtp.layers.0.mlp.down_proj, mtp.layers.0.mlp.gate_proj, mtp.layers.0.mlp.up_proj, mtp.layers.0.post_attention_layernorm, mtp.layers.0.self_attn.k_norm, mtp.layers.0.self_attn.k_proj, mtp.layers.0.self_attn.o_proj, mtp.layers.0.self_attn.q_norm, mtp.layers.0.self_attn.q_proj, mtp.layers.0.self_attn.v_proj, mtp.norm, mtp.pre_fc_norm_embedding, mtp.pre_fc_norm_hidden. Copying them now... Loading missing tensors: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████| 1/1 [00:00<00:00, 193.54shard/s] 2026-08-14 15:17:18 INFO missing_tensors.py L858: Processing config.json to update quantization_config for missing tensors... 2026-08-14 15:17:18 INFO missing_tensors.py L825: Updated extra_config for 1 ignored layer(s): mtp.fc 2026-08-14 15:17:18 INFO missing_tensors.py L851: Updated block_name_to_quantize: ['model.language_model.layers', 'mtp.layers'] 2026-08-14 15:17:18 INFO missing_tensors.py L881: Applying WOQ[RTN] to 7 missing Linear weight(s) (per-layer overrides from extra_config applied)... WOQ[RTN] quantizing missing weights: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████| 7/7 [00:05<00:00, 1.36weight/s] 2026-08-14 15:17:23 INFO missing_tensors.py L944: Successfully packed 7 weight(s) into WOQ format (21 packed tensor(s) created). 2026-08-14 15:17:24 INFO missing_tensors.py L511: Successfully wrote 29 missing tensor(s) to 'model_extra_tensors.safetensors' in QUANTIZATION/Qwen3.8-27B-w4g32. 2026-08-14 15:17:24 INFO device.py L1448: 'peak_ram': 88.01GB, 'peak_vram': 22.59GB готово за 258 мин · 62.0 ГиБ