clone-voice
仅需5-20秒音频样本,即可克隆任意音色合成语音,支持16种语言和本地Docker部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
仅需5-20秒音频样本,即可克隆任意音色合成语音,支持16种语言和本地Docker部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:clone-voice Web 界面截图
想象这样一个场景:你在网上看到一段特别的声音——可能是某位历史人物的演讲录音,也可能是自己喜欢的声优的表演——想把这段声音移植到另一段内容上,让它用全新的声音说话。过去这需要专业录音棚和声学工程师,如今有了 clone-voice,你只需一段 5-20 秒的音频样本加上几分钟时间,在浏览器里就能完成同样的事情。
jianchang512/clone-voice 是一个开源的声音克隆工具,基于 Coqui AI 的 XTTS v2 模型构建,于 2023 年底开源后迅速在 GitHub 积累了近 9000 颗星标。项目作者 jianchang512 同时维护着 pyvideotrans(视频翻译工具)等知名开源项目,在中文 AI 开发者社区有较高影响力。clone-voice 支持中文、英文、日语、韩语等 16 种语言,用户既可以将文字转换为指定音色,也可以将一段声音翻译为另一种音色的版本。
从技术架构来看,clone-voice 是一个典型的 Flask + Gradio 混合应用。Flask 负责核心 HTTP 路由和文件服务,Gradio 4.19.2 提供了现代化的交互界面和音频录制能力,后端推理则依赖 Coqui XTTS v2(TTS)和 FreeVC(声音转换)。项目使用 PyTorch 2.5.1 作为深度学习框架,配合 CUDA 12.4 加速推理。配置文件通过 dotenv 管理(.env),静态资源由 Flask 直接托管。部署上提供了三种模式:预编译 Windows exe(零配置)、CPU Docker 容器和 GPU Docker 容器,但没有根目录标准 Dockerfile,对于习惯 docker build 的用户稍显不便。
对于 AI 爱好者来说,clone-voice 最吸引人的地方在于极低的使用门槛。下载预编译版本后双击 app.exe,程序会自动打开浏览器窗口,引导用户完成声音录制或文件上传,整个过程不需要写任何代码,也不要求理解底层模型原理。项目还内置了模型下载管理器,首次使用时会自动从 GitHub Releases 下载所需的 XTTS v2 模型文件(体积约 3GB),解压到 tts 目录后即可使用。对于没有 NVIDIA 显卡的用户,CPU 模式下仍然可以运行,虽然速度较慢(约 10-20 倍差距),但足以验证功能。
对于 AI 开发者而言,clone-voice 的源码结构值得参考。项目将业务逻辑集中在 clone/logic.py 中,通过 threading 实现 TTS 和 STS 两条推理管线,Flask app.py 负责 Web 路由,两者通过全局队列(queue.Queue)解耦。这种设计使得推理层可以独立于 Web 层进行单元测试和性能优化。clone/cfg.py 统一管理目录结构和环境变量,通过 dotenv 读取配置,便于在不同部署环境间切换。值得注意的是,项目对 Coqui 模型协议的合规处理值得称道——源码部署时会强制提示用户同意 Coqui CPML 许可证,体现了开源项目对模型使用合规的重视。
clone-voice 目前的局限性主要集中在三个方面。首先,克隆效果高度依赖样本质量:录制环境嘈杂、音频时长过短或发音不清晰都会显著降低合成质量,项目文档明确建议 5-20 秒、清晰无噪音的录音。其次,中文克隆效果作者坦诚表示还凑合,英文效果明显更好,这反映了 XTTS v2 模型本身的多语言能力差异。第三,预编译 exe 版本无法使用 GPU 加速,没有 NVIDIA 显卡的用户需要借助 Docker GPU 容器或源码部署。
从行业角度看,clone-voice 属于 2023-2024 年声音克隆工具爆发期的典型产品之一。Coqui(后更名为 TII)开源 XTTS v2 后,社区迅速涌现出一批围绕其构建的 GUI 和部署工具,clone-voice 是其中功能最完整、社区认可度最高的项目之一。这类工具的涌现标志着 AI 语音合成技术从只有大公司能做的阶段进入了个人开发者也能玩的阶段。声音克隆的双刃剑特性也引发了一些伦理讨论——如何防止被用于诈骗和深度伪造是整个社区面临的共同挑战,clone-voice 在 README 中也呼吁用户合法使用。
总体而言,clone-voice 是一个工程完成度较高、使用体验友好的开源声音克隆工具。它不是底层模型的研究项目,而是一个将 XTTS v2 能力产品化的应用层作品。对于想要快速体验声音克隆的普通用户,clone-voice 提供了最低门槛的入口;对于想基于 XTTS v2 构建自己应用的开发者,它的源码结构提供了良好的参考模板。部署方面,有 NVIDIA 显卡的用户建议使用 Docker GPU 版本,Mac 或无 GPU 用户可先通过 CPU 模式尝鲜,Windows 普通用户可直接下载预编译 exe。
作者 jianchang512 的 GitHub 主页