🔬 模型 / 技术前沿2026-06-30
清华开源 TTS 王炸 VoxCPM2:2B 参数 30 语言语音设计克隆全包
原文链接清华开源 TTS 王炸 VoxCPM2:2B 参数 30 语言语音设计克隆全包
原文链接:https://mp.weixin.qq.com/s/FEAz462XsafOC1yDMTEQpA 来源:时之AI测评,2026-05-02
摘要
OpenBMB 团队开源的 VoxCPM2——2B 参数端到端 TTS,200 万小时训练数据,30 种语言,Apache-2.0。最大卖点:tokenizer-free + 扩散自回归架构,连续空间直接生成,一步到位出 48kHz 工作室级音质。三大核心功能:语音设计(文字描述创造全新人声)、可控克隆(3 秒参考 + 风格指引)、王者克隆(连呼吸都还原)。RTX 4090 RTF 约 0.3,Nano-vLLM 加速到 0.13,峰值显存仅 8GB。
传统 TTS 踩过的坑
- 找好听声音朗读 → 输出像机器人念经,连读破句、语调生硬
- 克隆声音 → 需要半小时以上干净音频,还动不动翻车
- 多语言 → 先找对应语种声源模型,发音不地道
- 参数调一堆 → 输出只有 16kHz,像电话放录音带
核心设计理念
把复杂留给自己,把简单还给用户。
传统 TTS:文本 → 离散 token → 声码器合成波形,中间编码解码层层累积错误。
VoxCPM2:tokenizer-free + 扩散自回归架构,直接在连续空间生成语音表示。
| 你不用操心的事 | 为什么 |
|---|---|
| 文本预处理、音素对齐 | 端到端自动处理 |
| 语言标签 | 自动识别 30 种语言 |
| 外挂超分辨率器 | 直接输出 48kHz |
三大核心功能
① 语音设计(Voice Design)
用文字描述创造全新声音,零参考音频。
"一个温暖的中年男声,语速偏慢,带点沙哑尾音" → 直接生成。支持年龄、性别、语气、情绪、语速等自然语言描述。播客主持人、有声书旁白、游戏 NPC——一句话搞定。
② 可控克隆(Controllable Voice Cloning)
3 秒参考音频(16kHz 即可)+ 风格指引("带点俏皮" 或 "严肃报道"),在保留音色的同时精准控制情绪和节奏。像导演指挥演员一样调教表演效果。
③ 王者级克隆(Ultimate Cloning)
提供参考音频和对应文本,模型从参考音频结尾无缝衔接,保留音色、节奏、情感、甚至换气声。忠实度连自己的声音都能骗过朋友。
性能
- 推理速度:RTX 4090 RTF ≈ 0.3,Nano-vLLM 加速到 0.13,几乎实时
- 显存:峰值约 8GB,一般游戏卡都能跑
- 部署:Nano-vLLM 和 vLLM-Omni 均支持并发 + OpenAI 兼容 API
- 评测:Seed-TTS-eval / CV3-eval 中英文 SIM 和 WER 均达开源第一梯队,小语种(芬兰语/希腊语/土耳其语)相似度明显领先
适合谁 vs 不适合谁
| ✅ 适合 | ❌ 不适合 |
|---|---|
| 内容创作者:批量生成不同口音情绪画外音 | 老旧 CPU(显存 <4GB) |
| 多语言项目:一套模型 30 种语言含方言 | 毫秒级超低延迟实时对谈 |
| 配音/播客:不用买商业软件 | 只需最简 TTS 不在意音质 |
| AI 产品开发者:开源可控 Apache-2.0 | — |
上手
# 环境:Python 3.10+,4GB 以上显存 GPU
pip install voxcpm
# CLI 一行出语音
voxcpm --text "你好世界" --output hello.wav
# 高级:Voice Design
voxcpm --text "..." --voice-design "一个活泼的年轻女声,快速说话"
效率从"月"到"分钟":以前克隆语音要准备音频 → 训练/微调跑几天 → 调参重来,现在装好模型写一句话直接出 48kHz 成品。
最好的工具,是让你感觉不到它的存在。
- GitHub: github.com/OpenBMB/VoxCPM
- 协议: Apache-2.0