🔬 模型 / 技术前沿2026-06-30
Qwen3.6-35B-A3B NVFP4:NVIDIA 官方量化版,3 倍压缩几乎无损
原文链接Qwen3.6-35B-A3B NVFP4:NVIDIA 官方量化版,3 倍压缩几乎无损
摘要
NVIDIA 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版,内存从 36GB 降到约 19GB,精度几乎无损(MMLU Pro 仅掉 0.6 分)。一行 vLLM 命令部署,消费级 GPU 可跑。三家在做同一种量化——NVIDIA/Unsloth/Red Hat AI,但工具链、校准数据、文件结构差异明显,NVIDIA 版最规范、benchmark 最全,工业生产首选。
核心卖点
- 极致压缩:BF16→NVFP4,位宽 16-bit→4-bit,磁盘/显存需求降 3.06 倍
- 精度保持优秀:MMLU Pro 85.6→85.0(-0.6),GPQA Diamond 84.9→84.8(-0.1),AIME 2025 差 0.4 分;IFBench 和 MMMU PRO 甚至微升
- 即插即用:vLLM 一行命令部署,不需要折腾额外量化工具链
- 多模态支持:文本+图片+视频理解,262K 超长上下文
Qwen3.6-35B-A3B 底座能力
- 256 个专家,激活 8+1(8 路由 + 1 共享)
- 混合注意力:Gated DeltaNet(线性注意力)+ Gated Attention 交替
- 原生 262K 上下文,YaRN 可扩至 100 万 token
- MTP 多 token 预测加速推理
- SWE-bench Verified 73.4,Terminal-Bench 2.0 51.5,QwenWebBench Elo 1397
部署
vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --port 8000 \
--quantization modelopt --max-model-len 262144 --reasoning-parser qwen3
需 Hopper(H100/H200)或 Blackwell(B200/GB200)GPU。DGX Spark 有专门优化配置,开启 MTP 投机解码进一步提速。
三家 NVFP4 横评
| 维度 | NVIDIA 官方 | Unsloth | Red Hat AI |
|---|---|---|---|
| 量化工具 | Model Optimizer v0.44 | 基于 Model Optimizer 流程 | llm-compressor |
| 校准数据 | cnn_dailymail + Nemotron | UltraChat(16K 序列) | UltraChat(256 样本) |
| 文件组织 | 3 分片 safetensors | 单文件 22.99GB | 主权重+MTP+视觉独立打包 |
| Benchmark | 8 项完整 | 2 项(GSM8K+MMLU-Pro) | 1 项(GSM8K,恢复率 100.69%) |
| 测试硬件 | GB300 | 未明示 | 未明示 |
选型建议:
- 生产部署(H100/H200/B200)→ NVIDIA 官方,最规范
- 桌面 GPU/DGX Spark 纯文本 → Unsloth,单文件最快
- 重度 vLLM 用户要 MTP/视觉独立可控 → Red Hat AI,文件结构最干净
不确定选哪个:直接 NVIDIA 官方版闭眼用。