🔬 模型 / 技术前沿2026-06-30
谷歌 DiffusionGemma 续集:Unsloth 压到 18GB,单卡 2000+ Token/s
原文链接谷歌 DiffusionGemma 续集:Unsloth 压到 18GB,单卡 2000+ Token/s
原文链接:https://mp.weixin.qq.com/s/98rqPw4zXgSX6m48wx5LNQ 来源:老章很忙 发布时间:2026-06-14
摘要
三天前 vLLM 在 H100 上跑 DiffusionGemma 达到 1000+ tok/s,Unsloth 直接把它量化成 GGUF,丢进 llama.cpp,单卡 2000+ tok/s,最低 18GB RAM 就能跑。扩散式大模型从"云端 H100 专属"直接下沉到消费级 24GB 显卡。
三大进展
- GGUF 来了:5 个量化版本,最小 16GB,24GB 显卡就能吃下
- llama.cpp 上车:Daniel Han 提了 PR #24423,新增
llama-diffusion-cli专用运行器 - 2000+ tok/s 实测:RTX 6000 上跑出 2000+ tok/s,比 vLLM 在 H100 上的 1000 tok/s 还快一倍
量化版本选择
| 量化 | 体积 | 备注 |
|---|---|---|
| BF16 | 47 GB | 全精度参考,不建议日常用 |
| Q8_0 | 25 GB | 接近无损,推荐 32GB+ 显卡 |
| Q6_K | 21 GB | 折中选择 |
| Q5_K_M | 18 GB | 内存敏感场景 |
| Q4_K_M | 16 GB | 最小,单张 24GB 显卡可塞下 |
推荐选择:
- 24GB 单卡(4090/3090/RTX 6000) → Q4_K_M
- 32GB 单卡(RTX 6000 Pro/V100 32G) → Q8_0
- Apple Silicon 统一内存 32G+ → Q4_K_M 或 Q5_K_M
- 纯 CPU + 大内存 64GB+ → Q8_0
两种跑法
跑法一:llama.cpp 原生路线
关键:必须用 PR #24423 分支,不是 main。编译目标是 llama-diffusion-cli。
# CUDA 编译
cmake -B build -DGGML_CUDA=ON
cmake --build build -j --config Release --target llama-diffusion-cli
# 下载 GGUF
hf download unsloth/diffusiongemma-26B-A4B-it-GGUF --include "Q4_K_M"
# 启动对话
./build/bin/llama-diffusion-cli \
-m diffusiongemma-26B-A4B-it-Q4_K_M.gguf \
-ngl 99 -cnv -n 2048
熵边界采样器默认开启,温度 0.8 → 0.4 线性衰减,直接用就行。
跑法二:Unsloth Studio 一键路线(推荐新手)
# 安装
curl -fsSL https://unsloth.ai/install.sh | sh
# 启动
unsloth studio -H 0.0.0.0 -p 8888
Web UI 内置 DiffusionGemma 支持,扩散采样参数自动配好,不用自己编 llama.cpp。
王炸功能:实时看扩散去噪
--diffusion-visual
加这个参数可以亲眼看到 256 个 token 怎么从噪声一点点收敛成答案——整个画布上的字符反复擦写、收敛、定型,最后一次性"啪"地全部清晰。
"扩散模型生成文本"不是一个比喻,它真的就像图像扩散模型一样工作。
微调也能玩
Unsloth 把 DiffusionGemma 的微调链路也打通了。官方用数独数据集 demo,基础模型完全瞎填,微调后稳定解出每一道。Colab 笔记本 A100 即可,扩散专属参数全部预置。
速度的代价
| 局限 | 说明 |
|---|---|
| 首 Token 延迟(TTFT)偏高 | 必须先把整个 256 token canvas 去噪到位才吐字,架构层面绕不开 |
| 并发上不去 | 每路对话维护 canvas × vocab_size 状态缓冲区,显存占用是 AR 模型好几倍 |
| 精度略低 | MMLU Pro 77.6% vs 82.6%,AIME 69.1% vs 88.3%,Codeforces ELO 1429 vs 1718 |
| PR 未合并主线 | llama.cpp PR 在 draft 状态,短期只能在 Unsloth 分支或 Studio 里玩 |
适用场景判断
- ✅ 24GB 单卡本地推理、Apple Silicon 大内存、私有领域 SFT、体验扩散可视化
- ❌ 高并发 API 服务、奥数/竞赛级推理、流式聊天/实时打字