🔬 模型 / 技术前沿2026-07-09
Voicebox:免费开源声音克隆工具,3 秒复刻任意音色
原文链接Voicebox:免费开源声音克隆工具,3 秒复刻任意音色
原文链接:https://mp.weixin.qq.com/s/N096u0GnXmzKWrf6SZ5vkw 作者:水哥 AIGC 发布时间:2026年7月
摘要
Voicebox 是一款免费开源的声音克隆工具,GitHub 3 万+ Star。集成 Qwen3-TTS 等 7 套语音引擎,覆盖 23 种语言。支持音色克隆、文字转语音、多角色对话故事制作。已打包 Windows/Mac 桌面客户端,无需代码知识即可使用。
主要内容
核心功能
- 音色克隆:上传 10-30 秒音频样本即可克隆,支持文件上传 / 麦克风录制 / 系统音频三种获取方式
- 文字生成语音:选择克隆音色 → 输入台词 → 选择 TTS 模型 → 生成音频
- 故事功能:内置多轨音频编辑器,制作多人对话(播客、小剧场),自动排列,可调整时间轴
- 本地运行:完全免费,无需注册 API、不按字数收费
技术参数
- 7 套语音引擎(含 Qwen3-TTS)
- 23 种语言支持
- 首次使用需下载模型(约 3.2GB)
- Windows / Mac 桌面客户端
典型应用
- 自媒体:克隆自己的声音批量生成旁白
- 知识付费:文章快速转音频课程
- 播客/短剧:多人物音色制作完整对话
- 影视二创:经典片段配反差萌音色(小猪佩奇配严肃剧情)
原文关键段落
不仅可以克隆音色,还可以文字生成语音、录制和转写声音,以及制作多角色对话故事。完全免费、本地运行、无需注册账号、购买 API,不按字数收费。