🔧 AI 知识库

清华开源 TTS 王炸 VoxCPM2:2B 参数 30 语言语音设计克隆全包

原文链接

清华开源 TTS 王炸 VoxCPM2:2B 参数 30 语言语音设计克隆全包

原文链接:https://mp.weixin.qq.com/s/FEAz462XsafOC1yDMTEQpA 来源:时之AI测评,2026-05-02

摘要

OpenBMB 团队开源的 VoxCPM2——2B 参数端到端 TTS,200 万小时训练数据,30 种语言,Apache-2.0。最大卖点:tokenizer-free + 扩散自回归架构,连续空间直接生成,一步到位出 48kHz 工作室级音质。三大核心功能:语音设计(文字描述创造全新人声)、可控克隆(3 秒参考 + 风格指引)、王者克隆(连呼吸都还原)。RTX 4090 RTF 约 0.3,Nano-vLLM 加速到 0.13,峰值显存仅 8GB。

传统 TTS 踩过的坑

  • 找好听声音朗读 → 输出像机器人念经,连读破句、语调生硬
  • 克隆声音 → 需要半小时以上干净音频,还动不动翻车
  • 多语言 → 先找对应语种声源模型,发音不地道
  • 参数调一堆 → 输出只有 16kHz,像电话放录音带

核心设计理念

把复杂留给自己,把简单还给用户。

传统 TTS:文本 → 离散 token → 声码器合成波形,中间编码解码层层累积错误。

VoxCPM2:tokenizer-free + 扩散自回归架构,直接在连续空间生成语音表示。

你不用操心的事为什么
文本预处理、音素对齐端到端自动处理
语言标签自动识别 30 种语言
外挂超分辨率器直接输出 48kHz

三大核心功能

① 语音设计(Voice Design)

用文字描述创造全新声音,零参考音频。

"一个温暖的中年男声,语速偏慢,带点沙哑尾音" → 直接生成。支持年龄、性别、语气、情绪、语速等自然语言描述。播客主持人、有声书旁白、游戏 NPC——一句话搞定。

② 可控克隆(Controllable Voice Cloning)

3 秒参考音频(16kHz 即可)+ 风格指引("带点俏皮" 或 "严肃报道"),在保留音色的同时精准控制情绪和节奏。像导演指挥演员一样调教表演效果。

③ 王者级克隆(Ultimate Cloning)

提供参考音频和对应文本,模型从参考音频结尾无缝衔接,保留音色、节奏、情感、甚至换气声。忠实度连自己的声音都能骗过朋友。

性能

  • 推理速度:RTX 4090 RTF ≈ 0.3,Nano-vLLM 加速到 0.13,几乎实时
  • 显存:峰值约 8GB,一般游戏卡都能跑
  • 部署:Nano-vLLM 和 vLLM-Omni 均支持并发 + OpenAI 兼容 API
  • 评测:Seed-TTS-eval / CV3-eval 中英文 SIM 和 WER 均达开源第一梯队,小语种(芬兰语/希腊语/土耳其语)相似度明显领先

适合谁 vs 不适合谁

✅ 适合❌ 不适合
内容创作者:批量生成不同口音情绪画外音老旧 CPU(显存 <4GB)
多语言项目:一套模型 30 种语言含方言毫秒级超低延迟实时对谈
配音/播客:不用买商业软件只需最简 TTS 不在意音质
AI 产品开发者:开源可控 Apache-2.0

上手

# 环境:Python 3.10+,4GB 以上显存 GPU
pip install voxcpm

# CLI 一行出语音
voxcpm --text "你好世界" --output hello.wav

# 高级:Voice Design
voxcpm --text "..." --voice-design "一个活泼的年轻女声,快速说话"

效率从"月"到"分钟":以前克隆语音要准备音频 → 训练/微调跑几天 → 调参重来,现在装好模型写一句话直接出 48kHz 成品。

最好的工具,是让你感觉不到它的存在。

  • GitHub: github.com/OpenBMB/VoxCPM
  • 协议: Apache-2.0