量化质量
GPTQ 成功率
97.42%
30,720 模块中 29,938 个
RTN 回退率
2.58%
主要集中在深层 (32–39)
困惑度 (wikitext-2)
6.1846
≈ BF16 原模型 97.9% 质量保留
Loss 均值
1.38e-04
中位数 9.29e-05 · 最大 2.14e-03
量化后大小
24.4 GB
含 MTP 权重
量化耗时
4h 20m
4× RTX 3060 12GB 并行
GPTQ 成功率
97.42%
BF16 质量保留
97.9%
RTN 回退率
2.58%
模型规格
| 属性 | 值 |
|---|---|
| 基础模型 | Qwen3.6-35B-A3B(MoE,35B 总参数 / 3B 激活参数) |
| 架构 | Qwen3_5MoeForConditionalGeneration(视觉 + 文本) |
| 专家数量 | 256 专家,每 token top-8 路由 |
| 隐藏层数 | 40 |
| 上下文长度 | 262,144 tokens |
| 量化方案 | GPTQ v2,4-bit,group_size=128,对称量化 |
| KV 缓存 | fp16 / bf16 / fp8_e4m3(Ampere 仅存储) |
| MTP 头 | 已包含(BF16,785 个键,按专家分离格式) |
量化范围
Int4 量化部分
所有 MoE 专家权重(第 0–39 层)
mlp.experts.*
保留 BF16 部分(Qwen3.6 配方)
• 注意力层
*.attn.*• MoE 路由器
*.mlp.gate• 共享专家
*.shared_expert.*• MTP 头
*.mtp.*• 视觉编码器
*.visual.*• Embeddings 与
lm_head校准配方
混合领域校准集,确保全部 256 个专家均获得有效激活信号,共 256 条样本,seq_len=1024。
| 数据源 | 样本数 | 用途 |
|---|---|---|
| allenai/c4 | 102 | 通用英语文本 |
| allenai/tulu-3-sft-mixture | 77 | 指令遵循 |
| codeparrot/codeparrot-clean-valid | 51 | 代码生成 |
| HuggingFaceH4/MATH-500 | 26 | 数学推理 |
量化硬件
GPU:4× NVIDIA RTX 3060 12GB(总显存 48 GB)
主板:SuperMicro C9X299-RPGF(LGA 2066)
CPU:Intel i9-7900X(10c/20t,Skylake-X)
内存:32 GB DDR4-2666
Python 3.13t 无 GIL 是关键:
无 GIL 自由线程运行时让 GPTQModel 的数据并行量化器真正利用了全部 4 张 GPU,
不再受解释器锁串行化拖累。这是在消费级多卡上完成 35B MoE 量化的技术基础。
工具链
| 组件 | 版本 |
|---|---|
| GPTQModel | 6.0.3 |
| Flash Linear Attention (FLA) | 0.4.2 |
| PyTorch | 2.11.0+cu128 |
| Triton | 3.6.0(cp313t wheel) |
| Python | 3.13.13t(自由线程,无 GIL) |
| CUDA | 12.8 |
部署用法
SGLang(推荐生产环境)
bash · SGLang 0.5.10
python -m sglang.launch_server \ --model-path palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \ --quantization moe_wna16 \ --tp-size 4 \ --mem-fraction-static 0.89 \ --kv-cache-dtype fp8_e4m3 \ --context-length 262144 \ --port 30000
已在 4× RTX 3060 12GB + SGLang 0.5.10 上验证:
max_total_num_tokens=415,184,context_len=262,144,max_running_requests=39。
vLLM
bash · vLLM 0.19.1
vllm serve palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \ --tensor-parallel-size 4 \ --max-model-len 200000 \ --gpu-memory-utilization 0.85 \ --kv-cache-dtype fp8 \ --dtype bfloat16 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --trust-remote-code
⚠️ 重要:不要向 vLLM 传递
--quantization moe_wna16!
强制传入该参数会在 MTP 加载路径中触发 KeyError: 'experts.w2_weight',
即使禁用了 MTP 也会报错。请让 vLLM 从 config.json 自动检测量化配置。
SGLang 则必须显式传入该参数。
推测解码 (MTP)
本版本包含 MTP(Multi-Token Prediction)权重,格式为 vLLM/SGLang 加载器所需的 按专家分离格式(785 个 MTP 键,全部 BF16)。两个引擎均已验证推测解码可用。
vLLM + MTP 性能
| 指标 | 数值 |
|---|---|
| 稳态解码速度 | 56–82 t/s |
| 平均草稿接受率 | 70–89% |
| 位置 1 接受率 | ~0.93 |
| 位置 2 接受率 | ~0.85 |
| 平均接受长度 | 2.4–2.8 / 2 |
| KV 池 | 160,800 tokens |
SGLang EAGLE 性能
| 指标 | 数值 |
|---|---|
| 解码速度(峰值批处理) | 52–141 t/s |
| 草稿接受率 | 34–70% |
| 平均接受长度 | 1.4–2.8 |
vLLM with MTP 启动命令
bash
vllm serve palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \ --tensor-parallel-size 4 \ --max-model-len 200000 \ --gpu-memory-utilization 0.85 \ --kv-cache-dtype fp8 \ --dtype bfloat16 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}' \ --trust-remote-code
SGLang EAGLE 启动命令
bash
SGLANG_ENABLE_SPEC_V2=1 \ SGLANG_MAMBA_CONV_DTYPE=float16 \ python -m sglang.launch_server \ --model-path palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \ --tp-size 4 \ --dtype float16 \ --quantization moe_wna16 \ --context-length 200000 \ --mem-fraction-static 0.80 \ --mamba-scheduler-strategy extra_buffer \ --speculative-algorithm EAGLE \ --speculative-eagle-topk 1 \ --speculative-num-steps 3 \ --speculative-num-draft-tokens 4 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --port 30000
已知特性与注意事项
分层 RTN 分布:第 32–39 层 RTN 回退率约为 7–10%,
早期层仅约 1–3%。与深层 MoE 路由集中及内存压力有关。
冷专家:256 个专家中有 157 个在至少一层回退到 RTN,
99 个始终使用 GPTQ。最频繁的冷专家 ID:235、249、234、197、237。
这些专家在推理时极少被路由,对实际输出质量影响极小。
Ampere 架构限制:在 RTX 3060(SM86)上,fp8 KV 缓存仅为存储模式
(读取时反量化后再做 attention 计算),无 FP8 计算路径。
vLLM --quantization 标志:
不要向 vLLM 传递
--quantization moe_wna16,会触发 MTP 加载器路径中的 KeyError。
SGLang 必须传入该参数;vLLM 必须自动检测。
专家量化分布(示意)
每格代表一个专家(共 256 个)。绿色 = 所有层均 GPTQ,橙色 = 至少一层 RTN 回退,灰色 = 高频冷专家。
始终 GPTQ(99 个)
存在 RTN 回退(157 个)
高频冷专家(TOP 5)