1. 被测模型概览
🔷
Qwen3.6-35B-A3B-GPTQ-Int4
社区发布 · palmfuture · Qwen3.6 系列
- 量化算法GPTQ W4A16 + RTN 回退
- 精度类型INT4 逐层优化
- 磁盘大小~19 GB
- 基础模型Qwen3.6-35B-A3B (BF16)
- 量化硬件4× RTX 3060 12GB
- 发布方palmfuture (社区)
- RTN 回退专家数157 / 256
社区量化
vLLM
Transformers
可审计日志
🟢
Qwen3.6-35B-A3B-AWQ-4bit
社区发布 · cyankiwi · Qwen3.6 系列
- 量化算法AWQ W4A16
- 精度类型INT4 激活感知
- 磁盘大小~18 GB
- 基础模型Qwen3.6-35B-A3B (BF16)
- 发布方cyankiwi (社区)
- CUDA 要求12.8 / 13.0+
- RTN 回退无(激活缩放保护)
社区量化
vLLM
精度最优
Marlin 加速
🔶
Qwen3.6-35B-A3B-NVFP4
社区发布 · mmangkad · Qwen3.6 系列
- 量化算法NVFP4 W4A4
- 精度类型FP4 E2M1 + UE4M3 缩放
- 磁盘大小~21.9–24 GB
- 基础模型Qwen3.6-35B-A3B (BF16)
- 硬件限制Blackwell-only
- 目标 GPUB200 / RTX PRO 6000
- 发布方mmangkad (社区)
Blackwell 专属
W4A4
硬件原生
最小磁盘
本次对比的重要前提
三款模型均基于同一基础模型 Qwen3.6-35B-A3B(2026-04-16 发布,Apache 2.0),基础能力完全一致。本报告的对比焦点是量化工艺本身的差异,不存在基础模型版本的干扰变量。
2. 共同基础模型:Qwen3.6-35B-A3B 性能基准
代码与 Agent 基准
数学、推理与多模态
以上为 BF16 基础模型分数(BenchLM.ai 综合排名 #32/112)。量化版本性能约有 4–15% 下降,具体视量化方法而定(AWQ > GPTQ > NVFP4)。
3. 量化方法技术详解
GPTQ — 逐层二阶优化 + RTN 回退
利用 Hessian 矩阵对每层权重序列量化并补偿误差(W4A16)。palmfuture 版本在消费级 4× RTX 3060 上完成,使用 Python 3.13t 自由线程模式,并发布了完整的 quant_log.csv 审计日志(1.8 MB)。
- 量化粒度逐层 Hessian 优化
- 激活精度BF16(W4A16)
- RTN 回退157/256 专家至少 1 层回退
- 高回退层段层 32–39(7–10% RTN 率)
- 冷门专家ID 235, 249, 234, 197, 237
- 加速内核Marlin kernel (2.6× 提升)
- LoRA 支持✅ 支持
AWQ — 激活感知权重量化
MIT 提出(MLSys 2024 最佳论文)。识别约 1% 的"关键权重"(按激活幅度统计),对其保护以获得近乎无损的 4-bit 量化(W4A16)。无 RTN 回退,全量覆盖。
- 量化粒度激活统计驱动(全量)
- 激活精度BF16(W4A16)
- RTN 回退无
- 精度保持代码任务约 -4%(优于 GPTQ)
- 加速内核Marlin-AWQ (10.9× 提升)
- LoRA 支持✅ 支持
NVFP4 — NVIDIA Blackwell 原生 FP4
NVIDIA 专有 4-bit 浮点格式,专为 Blackwell GPU (SM120/SM121) 设计。W4A4 方案:权重与激活均为 FP4,但视觉编码器、lm_head、路由门控等关键层保留 BF16。
- 量化格式FP4 E2M1 + UE4M3 per-block-16 缩放
- 激活精度FP4(W4A4)
- BF16 保留层视觉编码器、lm_head、路由、嵌入
- 计算单元FP4 Tensor Core(硬件原生)
- RTN 回退N/A(FP4 格式不适用)
- LoRA 支持❌ 暂不支持
4. 全面技术对比
| 对比维度 | GPTQ-Int4 palmfuture · 社区 |
AWQ-4bit cyankiwi · 社区 |
NVFP4 mmangkad · 社区 |
|---|---|---|---|
| 基础模型 | Qwen3.6-35B-A3B ✅ | Qwen3.6-35B-A3B ✅ | Qwen3.6-35B-A3B ✅ |
| 量化类型 | W4A16 (GPTQ + RTN 回退) | W4A16 (激活感知 INT4) | W4A4 (FP4 浮点) |
| 量化覆盖率 | MoE experts 全层;157/256 专家存在 RTN 回退 | 全量 GPTQ,无回退 | 全权重 + 激活 FP4,关键层保留 BF16 |
| 总参数 | 35B | 35B | 35B |
| 激活参数 | ~3B / token | ~3B / token | ~3B / token |
| 磁盘大小 | ~19 GB | ~18 GB | ~21.9–24 GB |
| 推理 VRAM | ~24 GB+ (4K–32K ctx) | ~24 GB+ (估算) | ~21.9 GB (单 B200) |
| 最低 GPU 要求 | 24 GB VRAM (Ampere/Ada+) | 24 GB VRAM (CUDA 12.8+) | Blackwell (SM120+) 96 GB |
| 量化硬件 | 4× RTX 3060 12GB (Ampere) | 未公开 | Blackwell 专用 |
| 推理速度 | ~194–197 tok/s (RTX 5090, GPTQ Marlin) | 高吞吐 (Marlin-AWQ 10.9× 加速) | ~168 tok/s (RTX PRO 6000 Blackwell) |
| 上下文长度 | 262,144 (256K) | 262,144 (256K) | 262,144 (256K) |
| 精度保持 | 良好 (代码任务约 -10%;RTN 层稍差) | 优秀 (代码任务约 -4%) | 一般 (推理/非英语明显损失) |
| LoRA 微调 | ✅ 支持 | ✅ 支持 | ❌ 暂不支持 |
| trust_remote_code | 通常不需要 | N/A | |
| vLLM 支持 | ✅ 完整 | ✅ 完整 | |
| SGLang 支持 | ✅ 支持 | ❌ 不支持 | |
| Transformers 支持 | ✅ 完整 | ✅ 支持 | ❌ 不支持 |
| KTransformers | ✅ 支持 | ❌ 不支持 | |
| 硬件通用性 | Ampere / Ada / Hopper / Blackwell | 任意现代 NVIDIA GPU (CUDA 12.8+) | 仅 Blackwell (SM120/SM121) |
| 多 GPU 并行 | TP=4 推荐 | TP=8 需 --enable-expert-parallel | 单卡 (96 GB) |
| FP8 KV Cache | ✅ Hopper+ 完整支持 | N/A | |
| 量化可审计性 | ✅ quant_log.csv 公开 | 部分 | 未公开 |
| 发布机构 | 社区 (palmfuture) | 社区 (cyankiwi) | 社区 (mmangkad) |
| 已知问题 | RTN 回退导致深层(32–39)精度稍低;Ampere FP8 无计算加速;需 trust_remote_code | 需 CUDA 12.8+;社区维护风险 | B200 上可能输出乱码;Thinking 模式有风险;无 LoRA;Blackwell 限定 |
5. palmfuture GPTQ 量化工艺深度解析
RTN 回退分布
GPTQ 量化失败或内存不足时自动回退到 RTN(舍入到最近值)。RTN 精度低于 GPTQ,是本版本的主要精度风险点。
- 总专家数256 个
- 至少 1 层 RTN157 / 256 (61.3%)
- 全部 GPTQ99 / 256 (38.7%)
- 早期层 RTN 率~1–3%(层 0–31)
- 深层 RTN 率~7–10%(层 32–39)
- 冷门专家(常 RTN)ID 235, 249, 234, 197, 237
为何冷门专家更易 RTN
冷门专家在校准数据中激活频率极低,Hessian 估计不稳定,GPTQ 量化失败率高,自动回退 RTN。但由于这些专家在推理中也很少被路由,实际影响有限。
量化环境与可审计性
- 量化硬件4× NVIDIA RTX 3060 12GB
- GPU 架构Ampere (SM86)
- 运行时Python 3.13t (自由线程)
- 审计日志quant_log.csv(1.8 MB)
- 日志字段层、模块、GPTQ loss、样本数、阻尼值、耗时
Ampere FP8 限制
RTX 3060 (SM86) 上的 FP8 KV Cache 仅为存储格式,注意力计算时仍需反量化回 BF16,无法获得 FP8 计算加速。建议在 Hopper/Ada+ 架构 GPU 上部署以充分利用 FP8。
trust_remote_code 要求
加载时需设置
trust_remote_code=True,原因是使用了 Qwen3.5-MoE 自定义架构代码。
6. 精度与速度权衡分析
精度损失对比(相对 BF16 基线)
| 任务类型 | GPTQ | AWQ | NVFP4 |
|---|---|---|---|
| 代码生成 (Pass@1) | 约 -10% | 约 -4% | -15%+ |
| 硬推理(非英语) | 中等损失 | 轻微损失 | 显著下降 |
| 通用对话 | 良好 | 优秀 | 一般 |
| 深层专家(GPTQ 特有) | RTN 层额外损失 | N/A | N/A |
推理速度对比
注:速度受 GPU 型号、批大小、上下文长度影响;NVFP4 速度仅在 Blackwell 硬件上有意义。
MoE 内存特性说明
35B-A3B 是稀疏 MoE 模型,每 token 仅激活约 3B 参数,但所有 35B 参数必须加载到显存。KV Cache 在 262K 上下文时额外占用 4–8 GB,在 4K–32K 上下文时仅增加 0.5–2 GB。
7. 部署配置参考
GPTQ-Int4 (palmfuture) · vLLM 启动命令
vllm serve palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 131072 \
--reasoning-parser qwen3 \
--quantization gptq_marlin \
--dtype bfloat16 \
--kv-cache-dtype fp8 \
--trust-remote-code
注意必须添加
--trust-remote-code(对应 Python 中的 trust_remote_code=True)。Ampere GPU 上 --kv-cache-dtype fp8 仅节省存储,不提供计算加速;H100/H200 以上才有完整 FP8 推理路径。
GPTQ-Int4 (palmfuture) · Transformers 加载示例
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4",
device_map="auto",
trust_remote_code=True, # 必须
)
tokenizer = AutoTokenizer.from_pretrained(
"palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4",
trust_remote_code=True,
)
AWQ-4bit (cyankiwi) · vLLM 多卡配置
# TP=8 时必须添加 --enable-expert-parallel
vllm serve cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit \
--port 8000 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--quantization awq_marlin \
--max-model-len 262144
CUDA 版本要求AWQ 版本需要 CUDA 12.8 或 CUDA 13.0,请在部署前确认驱动版本。
NVFP4 (mmangkad) · 注意事项
# 仅适用于 Blackwell GPU (SM120+)
# 强烈建议:关闭 Thinking 模式
vllm serve mmangkad/Qwen3.6-35B-A3B-NVFP4 \
--port 8000 \
--dtype bfloat16
生产警告在 B200 GPU 上存在已知乱码 Bug;开启 Thinking 模式时强烈不建议使用此格式。部署前请在目标硬件上充分验证。
8. 已知问题与风险
GPTQ-Int4 (palmfuture)
RTN 回退精度风险157/256 专家在至少一层使用了 RTN 回退,深层(32–39)RTN 率达 7–10%,该区域精度低于标准 GPTQ。可通过查阅
quant_log.csv 验证具体层的量化质量。
Ampere FP8 无计算加速RTX 3060 等 Ampere GPU 上的 FP8 KV Cache 仅为存储格式,需在注意力前反量化,无法获得 FP8 算力加速。
社区维护 + trust_remote_code非官方发布,需要
trust_remote_code=True,生产环境建议在沙箱中评估后再使用。
AWQ-4bit (cyankiwi)
CUDA 版本依赖需要 CUDA 12.8 或 13.0,老旧驱动环境部署前需升级。
社区维护风险非官方 Qwen 发布,依赖社区 (cyankiwi) 维护,生产环境需评估长期支持风险。
相对最稳定三款中精度损失最小,无 RTN 回退,框架支持最广,是当前综合风险最低的选项。
NVFP4 (mmangkad)
Blackwell GPU 乱码 Bug在 B200 GPU 上运行时可能产生乱码输出,为已知问题,尚未修复。
Thinking 模式不兼容强烈建议不在启用 Thinking 模式时使用带量化线性注意力的 NVFP4 模型。
硬件锁定 + 无 LoRA仅支持 Blackwell GPU,且暂不支持 LoRA 适配器,部署灵活性最低。
9. 选型建议
选 GPTQ-Int4 (palmfuture) 当你需要...
- 在 Ampere / Ada 消费级 GPU (24 GB) 上低成本部署
- LoRA 适配器支持(微调或多适配器服务)
- 完整的量化审计能力(quant_log.csv)
- KTransformers 框架兼容
- 对精度损失有一定容忍度(推荐提前在 RTN 层段做精度测试)
选 AWQ-4bit (cyankiwi) 当你需要...
- 同等显存下最高精度(代码/推理任务敏感)
- 高吞吐生产部署(Marlin-AWQ 加速)
- 无 RTN 回退风险,全量 GPTQ 覆盖
- SGLang 框架支持
- 已有 CUDA 12.8+ 环境
选 NVFP4 (mmangkad) 当你需要...
- 拥有 NVIDIA Blackwell GPU (B200 / RTX PRO 6000)
- 单卡低显存占用(~22 GB,无需多卡)
- 不使用 Thinking 模式的简单对话场景
- 非推理密集型任务(摘要、翻译、问答)
- 愿意在目标硬件上充分验证后再上线
综合推荐
三款模型基础能力相同(均基于 Qwen3.6),对比焦点是量化工艺。推荐首选 AWQ-4bit (cyankiwi):精度最优(-4% vs -10%)、无 RTN 回退、框架支持最广。若需 LoRA 或 KTransformers,选择 GPTQ-Int4 (palmfuture),但需注意深层 RTN 回退对精度的影响并提前验证。NVFP4 存在已知稳定性问题(B200 乱码、Thinking 不兼容),不建议在推理密集型生产任务中使用,需充分测试后谨慎采用。
10. 快速决策矩阵
| 场景需求 | GPTQ-Int4 palmfuture |
AWQ-4bit cyankiwi |
NVFP4 mmangkad |
|---|---|---|---|
| 代码生成精度优先 | 🟡 良好(含 RTN 层) | 🟢 最佳 | 🔴 不推荐 |
| 多语言推理 | 🟡 一般 | 🟢 良好 | 🔴 不推荐 |
| LoRA 微调 | 🟢 支持 | 🟢 支持 | 🔴 不支持 |
| RTX 4090 / A100 / H100 部署 | 🟢 支持 | 🟢 支持 | 🔴 不支持 |
| Blackwell GPU 部署 | 🟢 支持 | 🟢 支持 | 🟡 支持但有 Bug |
| Thinking 推理模式 | 🟢 稳定 | 🟢 稳定 | 🔴 有风险 |
| 量化可审计性 | 🟢 quant_log.csv | 🟡 部分 | 🔴 未公开 |
| FP8 KV Cache 计算加速 | 🟡 Hopper+ 才完整 | 🟢 Hopper+ 完整 | 🔴 不适用 |
| SGLang 框架 | 🟡 性能待优化 | 🟢 支持 | 🔴 不支持 |
| 生产多用户高并发 | 🟢 推荐 | 🟢 推荐 | 🟡 Blackwell 限定 |
| 最低磁盘占用 | 🟡 19 GB | 🟢 18 GB | 🟡 22–24 GB |
| trust_remote_code 免配置 | 🔴 需要设置 | 🟢 不需要 | 🟡 N/A |
| 基础模型版本 | 🟢 Qwen3.6 | 🟢 Qwen3.6 | 🟢 Qwen3.6 |