so-vits-svc
开源歌声转换模型,用你自己的声音训练AI歌手,支持音色混合与浅层扩散提升音质
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源歌声转换模型,用你自己的声音训练AI歌手,支持音色混合与浅层扩散提升音质
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:so-vits-svc 项目 Logo
用你自己的声音(或任何人的声音)训练一个 AI 歌手,让它翻唱任何歌曲——这是目前开源社区最流行的歌声转换(Singing Voice Conversion,SVC)框架之一。
想象一下:你特别喜欢某个虚拟歌姬的声线,但手头只有一首翻唱曲;或者你是一位创作者,想让一个从未"唱过歌"的角色发出动人的歌声。在过去,这种需求往往需要专业音频工程师花费数小时修音,或者依赖商业语音合成软件——不仅贵,而且不灵活。
2023 年,一个由爱好者组成的开发团队(SvcDevelopTeam)决定改变这个局面。他们从 VITS(Variational Inference Text-to-Speech)项目中汲取灵感,但将输入从「文本」换成了「音频」,同时引入 SoftVC 声音内容编码器来提取说话人的音色特征,结合 F0 音高曲线,最终实现了高质量的歌声转换。项目在 GitHub 上迅速获得超过 28,000 颗星,成为了 AI 音乐创作领域最受欢迎的开源工具之一。
项目的核心理念写在仓库描述里:Vits 是 TTS(文本转语音),so-vits-svc 是 SVC(歌声转换)。两者模型完全不通用意——Vits 让机器说话,so-vits-svc 让机器唱歌。
整个 pipeline 可以理解为三个环节的精密配合:
第一步:声音内容提取(Content Encoding) 输入一段源音频(任何人声),通过声音编码器(Speech Encoder)将其"翻译"成一系列不含音高的语义向量。so-vits-svc 4.1 版本支持多达 13 种声音编码器,包括:
第二步:F0 音高曲线提取 歌声区别于普通说话的关键在于旋律。so-vits-svc 使用多种 F0(基频)提取算法来追踪音频中的音高变化,支持的预测器包括:RMVPE(推荐)、CREPE-HOPPY、parselmouth(Praat 接口)、harvest 等。其中 RMVPE 是目前精度与速度平衡最好的选择。
第三步:VITS 声学模型 + NSF-HiFiGAN 声码器 语义向量 + F0 曲线输入 VITS 模型,替换掉原本基于文本的输入,输出梅尔频谱(Mel-Spectrogram)。最后通过 NSF-HiFiGAN 声码器将频谱还原为高质量波形,解决传统声码器常见的断音问题。
图2:浅层扩散(Shallow Diffusion)架构示意图,通过在 VITS 输出后叠加扩散模型进一步提升音质
| 功能 | 说明 |
|---|---|
| 歌声音色转换 | 将 A 的歌声转换为 B 的音色,保留原始旋律和情感 |
| 说话人混合(Spk Mix) | 动态或静态融合多个音色,生成全新声线 |
| 浅层扩散(Shallow Diffusion) | 在 VITS 输出后叠加扩散模型,显著提升音质 |
| 特征检索增强 | 借鉴 RVC 的检索方法,减少音色泄漏,提升转换自然度 |
| 响度嵌入 | 自动匹配目标响度,避免转换后音量忽大忽小 |
| 实时转换客户端 | 配合 voice-changer 实现实时变声 |
| Gradio WebUI | 浏览器图形界面,训练和推理均可 Web 端操作 |
| Flask API | 提供 RESTful 接口,方便集成到其他应用 |
| ONNX 导出 | 模型可导出为 ONNX 格式,脱离 PyTorch 环境运行 |
上手难度:较高,建议具备以下条件:
如果你是零基础用户,最推荐的方式是使用 AutoDL / Kaggle / Google Colab 上的社区镜像,官方也提供了 Google Colab 一键运行脚本,上传音频后点击运行即可完成推理,无需本地配置环境。
1. 数据集版权风险(最重要) 官方 README 用大段加粗文字强调:请务必确保数据集已获得合法授权!用未授权的音频训练模型可能涉及侵权。项目本身是完全离线的工具,但使用者的行为与开发者无关——这是项目最敏感的争议点,也是所有类似项目共同面临的法律灰色地带。
2. 非官方版本的混乱 在 so-vits-svc 4.1 之后,GitHub 上出现了声称是 5.0 版本的项目。官方明确声明:5.0 不是官方后续版本。建议只使用 SvcDevelopTeam 官方的 4.1-Stable 分支。
3. 部署复杂度 无 Docker 支持,需要手动安装 PyTorch、CUDA、cuDNN,以及下载多个预训练模型文件。对于没有深度学习环境配置经验的用户,初始搭建门槛较高。
4. 已归档(Archived)状态 2023 年 11 月后,官方仓库进入归档状态,不再接受新功能 PR,但代码仍可访问和使用。这意味着项目已基本稳定,但后续不会再有功能更新。
so-vits-svc 的出现标志着 AI 歌声转换从「专业音频工作站独霸」走向「创作者自由 DIY」的转折点。它催生了一个庞大的生态:
28,000 颗星背后,是真实创作者社区的活跃使用。在 AI 生成音乐(AIGC)爆发的 2023-2024 年,so-vits-svc 无疑是技术民主化的典型案例——它让任何有电脑和音频数据的人,都能训练自己的 AI 歌手。
本报告基于 GitHub 仓库 4.1-Stable 分支(归档版本)生成,分析时间:2026-05-25。 项目已归档,后续建议关注 RVC-Project 等活跃分支。