v2 · MTP 已验证 · 4× RTX 3060 量化

Qwen3.6-35B-A3B-GPTQ-Int4

基于 Qwen/Qwen3.6-35B-A3B 的 GPTQ Int4 量化版本,搭载 MTP 推测解码权重, 在消费级 4× RTX 3060 12GB 多卡硬件上完成量化,支持 vLLM 和 SGLang 双引擎部署。

GPTQ v2 · Int4 困惑度 6.18 (~97.9% BF16) 35B 参数 / 3B 激活 (MoE) 256 专家 · top-8 路由 262K 上下文 MTP 推测解码 24.4 GB
量化质量
GPTQ 成功率
97.42%
30,720 模块中 29,938 个
RTN 回退率
2.58%
主要集中在深层 (32–39)
困惑度 (wikitext-2)
6.1846
≈ BF16 原模型 97.9% 质量保留
Loss 均值
1.38e-04
中位数 9.29e-05 · 最大 2.14e-03
量化后大小
24.4 GB
含 MTP 权重
量化耗时
4h 20m
4× RTX 3060 12GB 并行
GPTQ 成功率
97.42%
BF16 质量保留
97.9%
RTN 回退率
2.58%
模型规格
属性
基础模型Qwen3.6-35B-A3B(MoE,35B 总参数 / 3B 激活参数)
架构Qwen3_5MoeForConditionalGeneration(视觉 + 文本)
专家数量256 专家,每 token top-8 路由
隐藏层数40
上下文长度262,144 tokens
量化方案GPTQ v2,4-bit,group_size=128,对称量化
KV 缓存fp16 / bf16 / fp8_e4m3(Ampere 仅存储)
MTP 头已包含(BF16,785 个键,按专家分离格式)
量化范围

Int4 量化部分

所有 MoE 专家权重(第 0–39 层)
mlp.experts.*

保留 BF16 部分(Qwen3.6 配方)

• 注意力层 *.attn.*
• MoE 路由器 *.mlp.gate
• 共享专家 *.shared_expert.*
• MTP 头 *.mtp.*
• 视觉编码器 *.visual.*
• Embeddings 与 lm_head
校准配方

混合领域校准集,确保全部 256 个专家均获得有效激活信号,共 256 条样本,seq_len=1024。

数据源样本数用途
allenai/c4102通用英语文本
allenai/tulu-3-sft-mixture77指令遵循
codeparrot/codeparrot-clean-valid51代码生成
HuggingFaceH4/MATH-50026数学推理
量化硬件
🎮
GPU:4× NVIDIA RTX 3060 12GB(总显存 48 GB)
🖥️
主板:SuperMicro C9X299-RPGF(LGA 2066)
⚙️
CPU:Intel i9-7900X(10c/20t,Skylake-X)
💾
内存:32 GB DDR4-2666
Python 3.13t 无 GIL 是关键: 无 GIL 自由线程运行时让 GPTQModel 的数据并行量化器真正利用了全部 4 张 GPU, 不再受解释器锁串行化拖累。这是在消费级多卡上完成 35B MoE 量化的技术基础。
工具链
组件版本
GPTQModel6.0.3
Flash Linear Attention (FLA)0.4.2
PyTorch2.11.0+cu128
Triton3.6.0(cp313t wheel)
Python3.13.13t(自由线程,无 GIL)
CUDA12.8
部署用法

SGLang(推荐生产环境)

bash · SGLang 0.5.10
python -m sglang.launch_server \
  --model-path palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \
  --quantization moe_wna16 \
  --tp-size 4 \
  --mem-fraction-static 0.89 \
  --kv-cache-dtype fp8_e4m3 \
  --context-length 262144 \
  --port 30000
已在 4× RTX 3060 12GB + SGLang 0.5.10 上验证: max_total_num_tokens=415,184,context_len=262,144,max_running_requests=39。

vLLM

bash · vLLM 0.19.1
vllm serve palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \
  --tensor-parallel-size 4 \
  --max-model-len 200000 \
  --gpu-memory-utilization 0.85 \
  --kv-cache-dtype fp8 \
  --dtype bfloat16 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --trust-remote-code
⚠️ 重要:不要向 vLLM 传递 --quantization moe_wna16! 强制传入该参数会在 MTP 加载路径中触发 KeyError: 'experts.w2_weight', 即使禁用了 MTP 也会报错。请让 vLLM 从 config.json 自动检测量化配置。 SGLang 则必须显式传入该参数。
推测解码 (MTP)

本版本包含 MTP(Multi-Token Prediction)权重,格式为 vLLM/SGLang 加载器所需的 按专家分离格式(785 个 MTP 键,全部 BF16)。两个引擎均已验证推测解码可用。

vLLM + MTP 性能

指标数值
稳态解码速度56–82 t/s
平均草稿接受率70–89%
位置 1 接受率~0.93
位置 2 接受率~0.85
平均接受长度2.4–2.8 / 2
KV 池160,800 tokens

SGLang EAGLE 性能

指标数值
解码速度(峰值批处理)52–141 t/s
草稿接受率34–70%
平均接受长度1.4–2.8

vLLM with MTP 启动命令

bash
vllm serve palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \
  --tensor-parallel-size 4 \
  --max-model-len 200000 \
  --gpu-memory-utilization 0.85 \
  --kv-cache-dtype fp8 \
  --dtype bfloat16 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}' \
  --trust-remote-code

SGLang EAGLE 启动命令

bash
SGLANG_ENABLE_SPEC_V2=1 \
SGLANG_MAMBA_CONV_DTYPE=float16 \
python -m sglang.launch_server \
  --model-path palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \
  --tp-size 4 \
  --dtype float16 \
  --quantization moe_wna16 \
  --context-length 200000 \
  --mem-fraction-static 0.80 \
  --mamba-scheduler-strategy extra_buffer \
  --speculative-algorithm EAGLE \
  --speculative-eagle-topk 1 \
  --speculative-num-steps 3 \
  --speculative-num-draft-tokens 4 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder \
  --port 30000
已知特性与注意事项
分层 RTN 分布:第 32–39 层 RTN 回退率约为 7–10%, 早期层仅约 1–3%。与深层 MoE 路由集中及内存压力有关。
冷专家:256 个专家中有 157 个在至少一层回退到 RTN, 99 个始终使用 GPTQ。最频繁的冷专家 ID:235、249、234、197、237。 这些专家在推理时极少被路由,对实际输出质量影响极小。
Ampere 架构限制:在 RTX 3060(SM86)上,fp8 KV 缓存仅为存储模式 (读取时反量化后再做 attention 计算),无 FP8 计算路径。
vLLM --quantization 标志: 不要向 vLLM 传递 --quantization moe_wna16,会触发 MTP 加载器路径中的 KeyError。 SGLang 必须传入该参数;vLLM 必须自动检测。
专家量化分布(示意)

每格代表一个专家(共 256 个)。绿色 = 所有层均 GPTQ,橙色 = 至少一层 RTN 回退,灰色 = 高频冷专家。

始终 GPTQ(99 个) 存在 RTN 回退(157 个) 高频冷专家(TOP 5)