⚡ 编程工程方法论2026-06-30
终于找到免费开源 TTS 模型,克隆声音不要钱,本地电脑也能跑
原文链接终于找到免费开源 TTS 模型,克隆声音不要钱,本地电脑也能跑
原文链接:https://mp.weixin.qq.com/s/UwF3TrtNDuT5ScexSUljJQ
作者:苍何|发布时间:2026-06-27
摘要
Confucius4-TTS 是网易有道开源的免费 TTS 模型,仅 1.3B 参数,支持零样本声音克隆(无需参考文本)、14 种语言,Apache 2.0 协议可商用,Mac 本地即可运行。作者将其接入 WeSight 桌宠实现自定义语音播报,实测声音克隆还原度高、多语言情感自然。技术架构为「语音编码器 + LLM」两阶段 + BigVGAN 声码器。
实战场景:接入 WeSight 桌宠
作者将喜欢的博主声音通过 Confucius4-TTS 克隆后接入 WeSight 桌面宠物:
- 任务执行时桌宠用克隆音色实时语音播报
- Claude Code 编程时朗读状态,vibe coding 更有陪伴感
- 支持自定义本地 TTS 模型 + MiniMax API + 自定义 API 三种配置
- 上传几秒参考音频即可快速复刻音色
效果: 语调、情绪还原度都很高,不太像本地小模型能跑出来的效果。
多语言声音克隆实测
| 场景 | 效果 |
|---|---|
| 博主原声 → 中文 | 还原度高 |
| 博主原声 → 卢森堡语带货 | 自然流畅 |
| 博主原声 → 韩语口播 | 自然流畅 |
| 老婆录音 → 英语读三字经 | 音色相似 |
| 老婆录音 → 日语介绍武汉 | 语调情绪到位 |
| 作者自录 → 中文 AI 早报 | 可用 |
结论: 对出海跨境电商和跨语言内容创作非常实用,不用找人录不同语种口播。
注意事项
- 录制参考音频需干净无杂音(车内录的小团团效果差,原因就是噪音)
- 零样本克隆无需参考文本,一段音频即可
- 支持 14 种语言:中/英/日/韩/德/法/西/印尼/意/泰/葡/俄/马来/越南
技术架构
语音编码器 + LLM 两阶段:
Stage 1: Text → Semantic Token(文本 → 语义 Token)
Stage 2: Semantic Token → Mel Spectrogram(语义 Token → 梅尔频谱图)
BigVGAN Vocoder → 最终音频输出
本地部署
git clone https://github.com/netease-youdao/Confucius4-TTS.git
cd Confucius4-TTS
conda create -n confuciustts python=3.10 -y
conda activate confuciustts
pip install -r requirements.txt
# 测试
python example.py \
--prompt_wav path/to/reference.wav \
--text "Hello, this is a test of zero-shot voice cloning." \
--lang en \
--out output.wav \
--config config/inference_config.yaml
Mac 本地可直接运行,也可通过 Tailscale 远程连接 DGX 主机部署。最后用 FastAPI 封装模型服务对外使用。
关键信息
- 模型大小: 1.3B 参数
- 许可协议: Apache 2.0(可商用)
- 开源方: 网易有道
- GitHub: https://github.com/netease-youdao/Confucius4-TTS
- 特点: 无需参考文本、零样本声音克隆、14 语言支持