🔧 AI 知识库

谷歌 DiffusionGemma 续集:Unsloth 压到 18GB,单卡 2000+ Token/s

原文链接

谷歌 DiffusionGemma 续集:Unsloth 压到 18GB,单卡 2000+ Token/s

原文链接:https://mp.weixin.qq.com/s/98rqPw4zXgSX6m48wx5LNQ 来源:老章很忙 发布时间:2026-06-14

摘要

三天前 vLLM 在 H100 上跑 DiffusionGemma 达到 1000+ tok/s,Unsloth 直接把它量化成 GGUF,丢进 llama.cpp,单卡 2000+ tok/s,最低 18GB RAM 就能跑。扩散式大模型从"云端 H100 专属"直接下沉到消费级 24GB 显卡。

三大进展

  1. GGUF 来了:5 个量化版本,最小 16GB,24GB 显卡就能吃下
  2. llama.cpp 上车:Daniel Han 提了 PR #24423,新增 llama-diffusion-cli 专用运行器
  3. 2000+ tok/s 实测:RTX 6000 上跑出 2000+ tok/s,比 vLLM 在 H100 上的 1000 tok/s 还快一倍

量化版本选择

量化体积备注
BF1647 GB全精度参考,不建议日常用
Q8_025 GB接近无损,推荐 32GB+ 显卡
Q6_K21 GB折中选择
Q5_K_M18 GB内存敏感场景
Q4_K_M16 GB最小,单张 24GB 显卡可塞下

推荐选择:

  • 24GB 单卡(4090/3090/RTX 6000) → Q4_K_M
  • 32GB 单卡(RTX 6000 Pro/V100 32G) → Q8_0
  • Apple Silicon 统一内存 32G+ → Q4_K_M 或 Q5_K_M
  • 纯 CPU + 大内存 64GB+ → Q8_0

两种跑法

跑法一:llama.cpp 原生路线

关键:必须用 PR #24423 分支,不是 main。编译目标是 llama-diffusion-cli

# CUDA 编译
cmake -B build -DGGML_CUDA=ON
cmake --build build -j --config Release --target llama-diffusion-cli

# 下载 GGUF
hf download unsloth/diffusiongemma-26B-A4B-it-GGUF --include "Q4_K_M"

# 启动对话
./build/bin/llama-diffusion-cli \
  -m diffusiongemma-26B-A4B-it-Q4_K_M.gguf \
  -ngl 99 -cnv -n 2048

熵边界采样器默认开启,温度 0.8 → 0.4 线性衰减,直接用就行。

跑法二:Unsloth Studio 一键路线(推荐新手)

# 安装
curl -fsSL https://unsloth.ai/install.sh | sh
# 启动
unsloth studio -H 0.0.0.0 -p 8888

Web UI 内置 DiffusionGemma 支持,扩散采样参数自动配好,不用自己编 llama.cpp。

王炸功能:实时看扩散去噪

--diffusion-visual

加这个参数可以亲眼看到 256 个 token 怎么从噪声一点点收敛成答案——整个画布上的字符反复擦写、收敛、定型,最后一次性"啪"地全部清晰。

"扩散模型生成文本"不是一个比喻,它真的就像图像扩散模型一样工作。

微调也能玩

Unsloth 把 DiffusionGemma 的微调链路也打通了。官方用数独数据集 demo,基础模型完全瞎填,微调后稳定解出每一道。Colab 笔记本 A100 即可,扩散专属参数全部预置。

速度的代价

局限说明
首 Token 延迟(TTFT)偏高必须先把整个 256 token canvas 去噪到位才吐字,架构层面绕不开
并发上不去每路对话维护 canvas × vocab_size 状态缓冲区,显存占用是 AR 模型好几倍
精度略低MMLU Pro 77.6% vs 82.6%,AIME 69.1% vs 88.3%,Codeforces ELO 1429 vs 1718
PR 未合并主线llama.cpp PR 在 draft 状态,短期只能在 Unsloth 分支或 Studio 里玩

适用场景判断

  • ✅ 24GB 单卡本地推理、Apple Silicon 大内存、私有领域 SFT、体验扩散可视化
  • ❌ 高并发 API 服务、奥数/竞赛级推理、流式聊天/实时打字