{ "architectures": [ "Qwen3MoeForCausalLM" ], "attention_bias": false, "attention_dropout": 0.0, "bos_token_id": 151643, "decoder_sparse_step": 1, "dtype": "bfloat16", "eos_token_id": 151645, "head_dim": 128, "hidden_act": "silu", "hidden_size": 2048, "initializer_range": 0.02, "intermediate_size": 6144, "max_position_embeddings": 262144, "max_window_layers": 48, "merge_args": { "batch_size": 8, "cache_dir": null, "dataset": "c4+math+code", "download": false, "group_size": 16, "grouping": "ream", "merge_size": 96, "merging": "logits+weights", "mix_ratio": "0.5,0.25,0.25", "model": "/data/models/Qwen3-30B-A3B-Instruct-2507-BF16", "mtp_safe_tensors": null, "no_gate_output": false, "no_gated_sim": false, "no_sequential": false, "saliency": "reap", "save_path": "/data/models/Qwen3-30B-Instruct-2507-REAM-BF16" }, "mlp_only_layers": [], "model_type": "qwen3_moe", "moe_intermediate_size": 768, "norm_topk_prob": true, "num_attention_heads": 32, "num_experts_per_tok": 8, "num_hidden_layers": 48, "num_key_value_heads": 4, "num_local_experts": 96, "output_router_logits": false, "pad_token_id": null, "quantization_config": { "bits": 4, "group_size": 128, "quant_method": "awq", "version": "gemm", "zero_point": true, "modules_to_not_convert": [], "ignore": [ "lm_head" ] }, "rms_norm_eps": 1e-06, "rope_parameters": { "rope_theta": 10000000, "rope_type": "default" }, "router_aux_loss_coef": 0.001, "sliding_window": null, "tie_word_embeddings": false, "transformers_version": "5.5.4", "use_cache": true, "use_sliding_window": false, "vocab_size": 151936 }