🔧 AI 知识库

Qwen3.6-35B-A3B NVFP4:NVIDIA 官方量化版,3 倍压缩几乎无损

原文链接

Qwen3.6-35B-A3B NVFP4:NVIDIA 官方量化版,3 倍压缩几乎无损

原文链接:https://mp.weixin.qq.com/s/0_4EerjmwW8vCReUrZZsXQ

摘要

NVIDIA 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版,内存从 36GB 降到约 19GB,精度几乎无损(MMLU Pro 仅掉 0.6 分)。一行 vLLM 命令部署,消费级 GPU 可跑。三家在做同一种量化——NVIDIA/Unsloth/Red Hat AI,但工具链、校准数据、文件结构差异明显,NVIDIA 版最规范、benchmark 最全,工业生产首选。

核心卖点

  • 极致压缩:BF16→NVFP4,位宽 16-bit→4-bit,磁盘/显存需求降 3.06 倍
  • 精度保持优秀:MMLU Pro 85.6→85.0(-0.6),GPQA Diamond 84.9→84.8(-0.1),AIME 2025 差 0.4 分;IFBench 和 MMMU PRO 甚至微升
  • 即插即用:vLLM 一行命令部署,不需要折腾额外量化工具链
  • 多模态支持:文本+图片+视频理解,262K 超长上下文

Qwen3.6-35B-A3B 底座能力

  • 256 个专家,激活 8+1(8 路由 + 1 共享)
  • 混合注意力:Gated DeltaNet(线性注意力)+ Gated Attention 交替
  • 原生 262K 上下文,YaRN 可扩至 100 万 token
  • MTP 多 token 预测加速推理
  • SWE-bench Verified 73.4,Terminal-Bench 2.0 51.5,QwenWebBench Elo 1397

部署

vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --port 8000 \
  --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3

需 Hopper(H100/H200)或 Blackwell(B200/GB200)GPU。DGX Spark 有专门优化配置,开启 MTP 投机解码进一步提速。

三家 NVFP4 横评

维度NVIDIA 官方UnslothRed Hat AI
量化工具Model Optimizer v0.44基于 Model Optimizer 流程llm-compressor
校准数据cnn_dailymail + NemotronUltraChat(16K 序列)UltraChat(256 样本)
文件组织3 分片 safetensors单文件 22.99GB主权重+MTP+视觉独立打包
Benchmark8 项完整2 项(GSM8K+MMLU-Pro)1 项(GSM8K,恢复率 100.69%)
测试硬件GB300未明示未明示

选型建议:

  • 生产部署(H100/H200/B200)→ NVIDIA 官方,最规范
  • 桌面 GPU/DGX Spark 纯文本 → Unsloth,单文件最快
  • 重度 vLLM 用户要 MTP/视觉独立可控 → Red Hat AI,文件结构最干净

不确定选哪个:直接 NVIDIA 官方版闭眼用。