技术调研报告

Qwen3.6-35B-A3B 量化方案对比分析

针对同一基础模型(Qwen3.6-35B-A3B)的三种 4-bit 量化方案——GPTQ-Int4、AWQ-4bit、NVFP4——进行全面技术对比,涵盖量化工艺、精度、性能、硬件适配与部署建议。

报告日期:2026-04-28  |  基础模型:Qwen3.6-35B-A3B(2026-04-16) |  MoE 架构:35B 总参数 / 3B 激活参数
1. 被测模型概览
🔷

Qwen3.6-35B-A3B-GPTQ-Int4

社区发布 · palmfuture · Qwen3.6 系列
  • 量化算法GPTQ W4A16 + RTN 回退
  • 精度类型INT4 逐层优化
  • 磁盘大小~19 GB
  • 基础模型Qwen3.6-35B-A3B (BF16)
  • 量化硬件4× RTX 3060 12GB
  • 发布方palmfuture (社区)
  • RTN 回退专家数157 / 256
社区量化 vLLM Transformers 可审计日志
🟢

Qwen3.6-35B-A3B-AWQ-4bit

社区发布 · cyankiwi · Qwen3.6 系列
  • 量化算法AWQ W4A16
  • 精度类型INT4 激活感知
  • 磁盘大小~18 GB
  • 基础模型Qwen3.6-35B-A3B (BF16)
  • 发布方cyankiwi (社区)
  • CUDA 要求12.8 / 13.0+
  • RTN 回退无(激活缩放保护)
社区量化 vLLM 精度最优 Marlin 加速
🔶

Qwen3.6-35B-A3B-NVFP4

社区发布 · mmangkad · Qwen3.6 系列
  • 量化算法NVFP4 W4A4
  • 精度类型FP4 E2M1 + UE4M3 缩放
  • 磁盘大小~21.9–24 GB
  • 基础模型Qwen3.6-35B-A3B (BF16)
  • 硬件限制Blackwell-only
  • 目标 GPUB200 / RTX PRO 6000
  • 发布方mmangkad (社区)
Blackwell 专属 W4A4 硬件原生 最小磁盘
本次对比的重要前提 三款模型均基于同一基础模型 Qwen3.6-35B-A3B(2026-04-16 发布,Apache 2.0),基础能力完全一致。本报告的对比焦点是量化工艺本身的差异,不存在基础模型版本的干扰变量。
2. 共同基础模型:Qwen3.6-35B-A3B 性能基准

代码与 Agent 基准

SWE-bench Verified73.4%
SWE-bench Multilingual67.2
SWE-bench Pro49.5
Terminal-Bench 2.051.5
MCPMark (工具调用)37.0%

数学、推理与多模态

AIME 202692.7
GPQA Diamond86.0
MMLU-Pro85.2
MMMU (多模态)81.7
RealWorldQA85.3

以上为 BF16 基础模型分数(BenchLM.ai 综合排名 #32/112)。量化版本性能约有 4–15% 下降,具体视量化方法而定(AWQ > GPTQ > NVFP4)。

3. 量化方法技术详解

GPTQ — 逐层二阶优化 + RTN 回退

利用 Hessian 矩阵对每层权重序列量化并补偿误差(W4A16)。palmfuture 版本在消费级 4× RTX 3060 上完成,使用 Python 3.13t 自由线程模式,并发布了完整的 quant_log.csv 审计日志(1.8 MB)。

  • 量化粒度逐层 Hessian 优化
  • 激活精度BF16(W4A16)
  • RTN 回退157/256 专家至少 1 层回退
  • 高回退层段层 32–39(7–10% RTN 率)
  • 冷门专家ID 235, 249, 234, 197, 237
  • 加速内核Marlin kernel (2.6× 提升)
  • LoRA 支持✅ 支持

AWQ — 激活感知权重量化

MIT 提出(MLSys 2024 最佳论文)。识别约 1% 的"关键权重"(按激活幅度统计),对其保护以获得近乎无损的 4-bit 量化(W4A16)。无 RTN 回退,全量覆盖。

  • 量化粒度激活统计驱动(全量)
  • 激活精度BF16(W4A16)
  • RTN 回退
  • 精度保持代码任务约 -4%(优于 GPTQ)
  • 加速内核Marlin-AWQ (10.9× 提升)
  • LoRA 支持✅ 支持

NVFP4 — NVIDIA Blackwell 原生 FP4

NVIDIA 专有 4-bit 浮点格式,专为 Blackwell GPU (SM120/SM121) 设计。W4A4 方案:权重与激活均为 FP4,但视觉编码器、lm_head、路由门控等关键层保留 BF16。

  • 量化格式FP4 E2M1 + UE4M3 per-block-16 缩放
  • 激活精度FP4(W4A4)
  • BF16 保留层视觉编码器、lm_head、路由、嵌入
  • 计算单元FP4 Tensor Core(硬件原生)
  • RTN 回退N/A(FP4 格式不适用)
  • LoRA 支持❌ 暂不支持
4. 全面技术对比
对比维度 GPTQ-Int4
palmfuture · 社区
AWQ-4bit
cyankiwi · 社区
NVFP4
mmangkad · 社区
基础模型 Qwen3.6-35B-A3B ✅ Qwen3.6-35B-A3B ✅ Qwen3.6-35B-A3B ✅
量化类型 W4A16 (GPTQ + RTN 回退) W4A16 (激活感知 INT4) W4A4 (FP4 浮点)
量化覆盖率 MoE experts 全层;157/256 专家存在 RTN 回退 全量 GPTQ,无回退 全权重 + 激活 FP4,关键层保留 BF16
总参数 35B 35B 35B
激活参数 ~3B / token ~3B / token ~3B / token
磁盘大小 ~19 GB ~18 GB ~21.9–24 GB
推理 VRAM ~24 GB+ (4K–32K ctx) ~24 GB+ (估算) ~21.9 GB (单 B200)
最低 GPU 要求 24 GB VRAM (Ampere/Ada+) 24 GB VRAM (CUDA 12.8+) Blackwell (SM120+) 96 GB
量化硬件 4× RTX 3060 12GB (Ampere) 未公开 Blackwell 专用
推理速度 ~194–197 tok/s (RTX 5090, GPTQ Marlin) 高吞吐 (Marlin-AWQ 10.9× 加速) ~168 tok/s (RTX PRO 6000 Blackwell)
上下文长度 262,144 (256K) 262,144 (256K) 262,144 (256K)
精度保持 良好 (代码任务约 -10%;RTN 层稍差) 优秀 (代码任务约 -4%) 一般 (推理/非英语明显损失)
LoRA 微调 ✅ 支持 ✅ 支持 ❌ 暂不支持
trust_remote_code ⚠️ 需要设置 True 通常不需要 N/A
vLLM 支持 ✅ 完整 ✅ 完整 ⚠️ 有限
SGLang 支持 ⚠️ 性能待优化 ✅ 支持 ❌ 不支持
Transformers 支持 ✅ 完整 ✅ 支持 ❌ 不支持
KTransformers ✅ 支持 ⚠️ 部分 ❌ 不支持
硬件通用性 Ampere / Ada / Hopper / Blackwell 任意现代 NVIDIA GPU (CUDA 12.8+) 仅 Blackwell (SM120/SM121)
多 GPU 并行 TP=4 推荐 TP=8 需 --enable-expert-parallel 单卡 (96 GB)
FP8 KV Cache ⚠️ Ampere 仅存储,无 FP8 计算路径 ✅ Hopper+ 完整支持 N/A
量化可审计性 ✅ quant_log.csv 公开 部分 未公开
发布机构 社区 (palmfuture) 社区 (cyankiwi) 社区 (mmangkad)
已知问题 RTN 回退导致深层(32–39)精度稍低;Ampere FP8 无计算加速;需 trust_remote_code 需 CUDA 12.8+;社区维护风险 B200 上可能输出乱码;Thinking 模式有风险;无 LoRA;Blackwell 限定
5. palmfuture GPTQ 量化工艺深度解析

RTN 回退分布

GPTQ 量化失败或内存不足时自动回退到 RTN(舍入到最近值)。RTN 精度低于 GPTQ,是本版本的主要精度风险点。

  • 总专家数256 个
  • 至少 1 层 RTN157 / 256 (61.3%)
  • 全部 GPTQ99 / 256 (38.7%)
  • 早期层 RTN 率~1–3%(层 0–31)
  • 深层 RTN 率~7–10%(层 32–39)
  • 冷门专家(常 RTN)ID 235, 249, 234, 197, 237
为何冷门专家更易 RTN 冷门专家在校准数据中激活频率极低,Hessian 估计不稳定,GPTQ 量化失败率高,自动回退 RTN。但由于这些专家在推理中也很少被路由,实际影响有限。

量化环境与可审计性

  • 量化硬件4× NVIDIA RTX 3060 12GB
  • GPU 架构Ampere (SM86)
  • 运行时Python 3.13t (自由线程)
  • 审计日志quant_log.csv(1.8 MB)
  • 日志字段层、模块、GPTQ loss、样本数、阻尼值、耗时
Ampere FP8 限制 RTX 3060 (SM86) 上的 FP8 KV Cache 仅为存储格式,注意力计算时仍需反量化回 BF16,无法获得 FP8 计算加速。建议在 Hopper/Ada+ 架构 GPU 上部署以充分利用 FP8。
trust_remote_code 要求 加载时需设置 trust_remote_code=True,原因是使用了 Qwen3.5-MoE 自定义架构代码。
6. 精度与速度权衡分析

精度损失对比(相对 BF16 基线)

任务类型 GPTQ AWQ NVFP4
代码生成 (Pass@1) 约 -10% 约 -4% -15%+
硬推理(非英语) 中等损失 轻微损失 显著下降
通用对话 良好 优秀 一般
深层专家(GPTQ 特有) RTN 层额外损失 N/A N/A

推理速度对比

AWQ + Marlin (估算,Hopper+) ~200+ tok/s
GPTQ + Marlin (RTX 5090) ~194–197 tok/s
NVFP4 (RTX PRO 6000 Blackwell) ~168 tok/s

注:速度受 GPU 型号、批大小、上下文长度影响;NVFP4 速度仅在 Blackwell 硬件上有意义。

MoE 内存特性说明 35B-A3B 是稀疏 MoE 模型,每 token 仅激活约 3B 参数,但所有 35B 参数必须加载到显存。KV Cache 在 262K 上下文时额外占用 4–8 GB,在 4K–32K 上下文时仅增加 0.5–2 GB。
7. 部署配置参考

GPTQ-Int4 (palmfuture) · vLLM 启动命令

vllm serve palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \
  --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 131072 \
  --reasoning-parser qwen3 \
  --quantization gptq_marlin \
  --dtype bfloat16 \
  --kv-cache-dtype fp8 \
  --trust-remote-code
注意必须添加 --trust-remote-code(对应 Python 中的 trust_remote_code=True)。Ampere GPU 上 --kv-cache-dtype fp8 仅节省存储,不提供计算加速;H100/H200 以上才有完整 FP8 推理路径。

GPTQ-Int4 (palmfuture) · Transformers 加载示例

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4",
    device_map="auto",
    trust_remote_code=True,   # 必须
)
tokenizer = AutoTokenizer.from_pretrained(
    "palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4",
    trust_remote_code=True,
)

AWQ-4bit (cyankiwi) · vLLM 多卡配置

# TP=8 时必须添加 --enable-expert-parallel
vllm serve cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit \
  --port 8000 \
  --tensor-parallel-size 8 \
  --enable-expert-parallel \
  --quantization awq_marlin \
  --max-model-len 262144
CUDA 版本要求AWQ 版本需要 CUDA 12.8 或 CUDA 13.0,请在部署前确认驱动版本。

NVFP4 (mmangkad) · 注意事项

# 仅适用于 Blackwell GPU (SM120+)
# 强烈建议:关闭 Thinking 模式
vllm serve mmangkad/Qwen3.6-35B-A3B-NVFP4 \
  --port 8000 \
  --dtype bfloat16
生产警告在 B200 GPU 上存在已知乱码 Bug;开启 Thinking 模式时强烈不建议使用此格式。部署前请在目标硬件上充分验证。
8. 已知问题与风险

GPTQ-Int4 (palmfuture)

RTN 回退精度风险157/256 专家在至少一层使用了 RTN 回退,深层(32–39)RTN 率达 7–10%,该区域精度低于标准 GPTQ。可通过查阅 quant_log.csv 验证具体层的量化质量。
Ampere FP8 无计算加速RTX 3060 等 Ampere GPU 上的 FP8 KV Cache 仅为存储格式,需在注意力前反量化,无法获得 FP8 算力加速。
社区维护 + trust_remote_code非官方发布,需要 trust_remote_code=True,生产环境建议在沙箱中评估后再使用。

AWQ-4bit (cyankiwi)

CUDA 版本依赖需要 CUDA 12.8 或 13.0,老旧驱动环境部署前需升级。
社区维护风险非官方 Qwen 发布,依赖社区 (cyankiwi) 维护,生产环境需评估长期支持风险。
相对最稳定三款中精度损失最小,无 RTN 回退,框架支持最广,是当前综合风险最低的选项。

NVFP4 (mmangkad)

Blackwell GPU 乱码 Bug在 B200 GPU 上运行时可能产生乱码输出,为已知问题,尚未修复。
Thinking 模式不兼容强烈建议不在启用 Thinking 模式时使用带量化线性注意力的 NVFP4 模型。
硬件锁定 + 无 LoRA仅支持 Blackwell GPU,且暂不支持 LoRA 适配器,部署灵活性最低。
9. 选型建议

选 GPTQ-Int4 (palmfuture) 当你需要...

  • 在 Ampere / Ada 消费级 GPU (24 GB) 上低成本部署
  • LoRA 适配器支持(微调或多适配器服务)
  • 完整的量化审计能力(quant_log.csv)
  • KTransformers 框架兼容
  • 对精度损失有一定容忍度(推荐提前在 RTN 层段做精度测试)

选 AWQ-4bit (cyankiwi) 当你需要...

  • 同等显存下最高精度(代码/推理任务敏感)
  • 高吞吐生产部署(Marlin-AWQ 加速)
  • 无 RTN 回退风险,全量 GPTQ 覆盖
  • SGLang 框架支持
  • 已有 CUDA 12.8+ 环境

选 NVFP4 (mmangkad) 当你需要...

  • 拥有 NVIDIA Blackwell GPU (B200 / RTX PRO 6000)
  • 单卡低显存占用(~22 GB,无需多卡)
  • 不使用 Thinking 模式的简单对话场景
  • 非推理密集型任务(摘要、翻译、问答)
  • 愿意在目标硬件上充分验证后再上线
综合推荐 三款模型基础能力相同(均基于 Qwen3.6),对比焦点是量化工艺。推荐首选 AWQ-4bit (cyankiwi):精度最优(-4% vs -10%)、无 RTN 回退、框架支持最广。若需 LoRA 或 KTransformers,选择 GPTQ-Int4 (palmfuture),但需注意深层 RTN 回退对精度的影响并提前验证。NVFP4 存在已知稳定性问题(B200 乱码、Thinking 不兼容),不建议在推理密集型生产任务中使用,需充分测试后谨慎采用。
10. 快速决策矩阵
场景需求 GPTQ-Int4
palmfuture
AWQ-4bit
cyankiwi
NVFP4
mmangkad
代码生成精度优先🟡 良好(含 RTN 层)🟢 最佳🔴 不推荐
多语言推理🟡 一般🟢 良好🔴 不推荐
LoRA 微调🟢 支持🟢 支持🔴 不支持
RTX 4090 / A100 / H100 部署🟢 支持🟢 支持🔴 不支持
Blackwell GPU 部署🟢 支持🟢 支持🟡 支持但有 Bug
Thinking 推理模式🟢 稳定🟢 稳定🔴 有风险
量化可审计性🟢 quant_log.csv🟡 部分🔴 未公开
FP8 KV Cache 计算加速🟡 Hopper+ 才完整🟢 Hopper+ 完整🔴 不适用
SGLang 框架🟡 性能待优化🟢 支持🔴 不支持
生产多用户高并发🟢 推荐🟢 推荐🟡 Blackwell 限定
最低磁盘占用🟡 19 GB🟢 18 GB🟡 22–24 GB
trust_remote_code 免配置🔴 需要设置🟢 不需要🟡 N/A
基础模型版本🟢 Qwen3.6🟢 Qwen3.6🟢 Qwen3.6