TTS-RVC-API
Coqui TTS + RVC 语音克隆管道,支持情感控制,仅需 2-3 分钟录音样本即可训练专属克隆声音
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Coqui TTS + RVC 语音克隆管道,支持情感控制,仅需 2-3 分钟录音样本即可训练专属克隆声音
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,如果 AI 助手能用你自己的声音朗读文章,或者让小说角色"开口说话",那会是什么感觉?TTS-RVC-API 正是这样一款工具——它将 Coqui TTS(文本转语音)与 RVC(检索式语音转换)巧妙结合,让用户只需准备 2-3 分钟的语音样本,就能训练出专属的"克隆声音",然后用这个声音朗读任意文本。
传统的文本转语音(TTS)技术,输出的是标准化的"机器音"——语调平、机械感强,听久了容易疲劳。2020 年之后,以 SV2TTS、YourTTS 为代表的深度学习方案开始让合成语音变得更自然,但训练一个高质量的语音克隆模型通常需要数十分钟甚至数小时的录音数据,且效果仍然受限于说话人 similarity(相似度)。
RVC(Retrieval-Based Voice Conversion) 是近年来开源社区最活跃的语音转换方案之一。它不从头训练 TTS 模型,而是利用预训练的 HuBERT 编码器提取语音特征,通过一个轻量级的特征映射网络实现音色迁移。相比传统方案,RVC 的优势在于:
然而 RVC 本身是 S2S(Speech-to-Speech) 方案,不支持直接输入文本。这意味着想用 RVC 生成语音,必须先有一个 TTS 系统生成基准语音,再通过 RVC 做音色转换——这正是 TTS-RVC-API 解决的核心问题。
TTS-RVC-API 的架构分为两层:
第一层:Coqui TTS 生成基准语音
Coqui TTS(原 Mozilla TTS 的社区 fork)是整个管线的起点。它接收原始文本,输出合成语音的波形数据。项目中直接集成了 Suno AI 的 Bark 模型作为 TTS 引擎——Bark 以其高度自然的语音输出闻名,支持情感控制(emotion)和语速调节(speed)。
调用的请求格式非常简洁:
{
"speaker_name": "speaker3",
"input_text": "Hey there! Welcome to the world",
"emotion": "Surprise",
"speed": 1.0
}
支持的情感参数包括:happy、sad、angry、dull、Surprise 等,可通过 HTTP POST 请求发送到 http://localhost:8000/generate,返回 WAV 音频文件。
第二层:RVC 做音色迁移
生成的基准语音通过 RVC 模块进行音色转换。项目在 models/ 目录下预置了三个说话人示例(speaker1、speaker2、speaker3),每个说话人包含两个文件:
speakerX.pth:RVC 模型权重文件speakerX.index:HuBERT 特征检索索引文件用户也可以自行训练新的音色模型,只需将训练好的 pth + index 文件放入对应目录,并在请求中指定 speaker_name 即可切换音色。
项目的工程化程度较高,提供了完整的 Dockerfile:
FROM python:3.10
RUN apt-get update && apt-get -y install ffmpeg git
RUN pip3 install -r requirements.txt
# NLTK punkt 分词数据预下载
EXPOSE 8000
CMD ["uvicorn", "app.main:app", "--host", "0.0.0.0", "--port", "8000"]
部署步骤:
git clone https://github.com/skshadan/TTS-RVC-API.gitdocker build -t tts-rvc-api .models/speakerX/)config.toml 中的路径配置docker run -p 8000:8000 -v /path/to/models:/models tts-rvc-apiAPI 响应速度取决于音频长度和 GPU 配置,官方示例中一段约 50 词的英文文本生成耗时约数秒。
技术层面,这个项目并非完美无缺:
TTS-RVC-API 解决的是一个真实痛点:在 AI 播客、有声书、游戏配音等应用场景中,人们越来越需要"定制音色"而非"标准音色"。RVC 的出现让个人用户和小团队也能低成本训练语音模型,而 TTS-RVC-API 则补全了"文本 → 克隆音色"这最后一环。
从 Star 增长趋势来看,该项目属于垂直场景工具型项目(114 ★),在 GitHub 上并非爆款,但在语音克隆社区中有一定的使用群体。结合 RVC 项目本身的活跃度(TTS-RVC-API 被标记为 rvc、voice、coqui-tts 等热门 AI 话题),这类工具的生命力在于与内容创作工作流的结合深度。
如果你正在寻找一种快速、低成本的方式让 AI"用特定人的声音说话",TTS-RVC-API 是一个值得尝试的起点——尤其是当你已有 RVC 模型训练经验时。