🔧 AI 知识库

终于找到免费开源 TTS 模型,克隆声音不要钱,本地电脑也能跑

原文链接

终于找到免费开源 TTS 模型,克隆声音不要钱,本地电脑也能跑

原文链接:https://mp.weixin.qq.com/s/UwF3TrtNDuT5ScexSUljJQ

作者:苍何|发布时间:2026-06-27

摘要

Confucius4-TTS 是网易有道开源的免费 TTS 模型,仅 1.3B 参数,支持零样本声音克隆(无需参考文本)、14 种语言,Apache 2.0 协议可商用,Mac 本地即可运行。作者将其接入 WeSight 桌宠实现自定义语音播报,实测声音克隆还原度高、多语言情感自然。技术架构为「语音编码器 + LLM」两阶段 + BigVGAN 声码器。

实战场景:接入 WeSight 桌宠

作者将喜欢的博主声音通过 Confucius4-TTS 克隆后接入 WeSight 桌面宠物:

  • 任务执行时桌宠用克隆音色实时语音播报
  • Claude Code 编程时朗读状态,vibe coding 更有陪伴感
  • 支持自定义本地 TTS 模型 + MiniMax API + 自定义 API 三种配置
  • 上传几秒参考音频即可快速复刻音色

效果: 语调、情绪还原度都很高,不太像本地小模型能跑出来的效果。

多语言声音克隆实测

场景效果
博主原声 → 中文还原度高
博主原声 → 卢森堡语带货自然流畅
博主原声 → 韩语口播自然流畅
老婆录音 → 英语读三字经音色相似
老婆录音 → 日语介绍武汉语调情绪到位
作者自录 → 中文 AI 早报可用

结论: 对出海跨境电商和跨语言内容创作非常实用,不用找人录不同语种口播。

注意事项

  • 录制参考音频需干净无杂音(车内录的小团团效果差,原因就是噪音)
  • 零样本克隆无需参考文本,一段音频即可
  • 支持 14 种语言:中/英/日/韩/德/法/西/印尼/意/泰/葡/俄/马来/越南

技术架构

语音编码器 + LLM 两阶段:
  Stage 1: Text → Semantic Token(文本 → 语义 Token)
  Stage 2: Semantic Token → Mel Spectrogram(语义 Token → 梅尔频谱图)
  BigVGAN Vocoder → 最终音频输出

本地部署

git clone https://github.com/netease-youdao/Confucius4-TTS.git
cd Confucius4-TTS

conda create -n confuciustts python=3.10 -y
conda activate confuciustts

pip install -r requirements.txt

# 测试
python example.py \
    --prompt_wav path/to/reference.wav \
    --text "Hello, this is a test of zero-shot voice cloning." \
    --lang en \
    --out output.wav \
    --config config/inference_config.yaml

Mac 本地可直接运行,也可通过 Tailscale 远程连接 DGX 主机部署。最后用 FastAPI 封装模型服务对外使用。

关键信息