Awesome-Singing-Voice-Synthesis-and-Singing-Voice-Conversion
歌声合成与转换领域最全面的学术资源索引
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
歌声合成与转换领域最全面的学术资源索引
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:教一个 AI 读文字——这件事在语音合成(TTS)领域已经相当成熟,Google Assistant、Siri 的语音听起来已经相当自然。但如果是让 AI 唱歌呢?这就完全是另一个量级的挑战。
唱歌涉及复杂的音高控制、时长压缩、颤音、气口、换气声、情感表达——每一个维度都需要精准建模。Singing Voice Synthesis(歌声合成,SVS) 和 Singing Voice Conversion(歌声转换,SVC) 正是这一领域的前沿方向。而 Awesome-Singing-Voice-Synthesis-and-Singing-Voice-Conversion 就是这一领域的「arXiv 导航仪」,由清华大学研究者 guan-yuan 维护,收录了从 2019 年至今的顶会论文、开源项目与数据集。
这不是一个可运行的代码项目,而是一份精心整理的学术资源索引。README 文件本身就是一份完整的论文地图,涵盖了以下核心方向:
| 方向 | 核心内容 | 代表工作 |
|---|---|---|
| Singing Voice Conversion (SVC) | 将一个人的歌声音色转换为另一个人的歌声 | DiffSVC, Learn2Sing 2.0, StarGANv2-VC |
| Singing Voice Synthesis (SVS) | 从乐谱/歌词直接合成歌声 | DiffSinger, HiFiSinger, WeSinger, Muskits |
| Voice Conversion (VC) | 说话人音色转换(非唱歌场景) | YourTTS, StarGANv2-VC, DiffVC |
| Text-to-Speech (TTS) | 文字转语音合成 | YourTTS, ProDiff, BDDM, FastDiff |
| Vocoder(声码器) | 梅尔频谱→波形的高质量生成 | HiFi-GAN, Multi-band MelGAN, DiffWave, WaveGrad |
| Emotional Voice Conversion | 情感风格迁移 | Emovox, seq2seq-EVC |
| Music Synthesis | 多乐器音乐合成 | Musika, Spectrogram Diffusion |
| Automatic Music Transcription | 音乐转谱(Audio→MIDI/Sheet) | MT3, Omnizart |
| Self-supervised ASR | 自监督语音表示学习 | HuBERT, wav2vec 2.0, WavLM, XLS-R |
| MOS Prediction | 语音质量自动评估 | VoiceMOS Challenge |
早期的歌声合成系统(如 Yamaha 的 VOCALOID)依赖拼接合成——预先录制大量音素片段,再按乐谱拼接。这种方法音质受限于样本库规模,且难以表达细腻情感。
2019 年起,深度学习彻底改变了这一格局:
2021 年是扩散模型在音频生成领域的爆发年:
2021-2022 年最具影响力的趋势是自监督预训练:
从 2022 年开始,研究者越来越倾向于端到端方案:
没有高质量数据集,就没有歌声 AI 的繁荣。本仓库收录了领域内最重要的数据集:
研究歌声合成,不只需要模型,还需要完整的工具链:
对于研究者而言,这是一份时间节省器。以往需要花数周遍历 arXiv、ACL Anthology、IEEE Xplore 才能建立的领域全景图,现在打开这个 README 就能获得。
对于开发者而言,仓库中穿插了大量附带代码的项目链接(标记为 ✔️Code),可以直接 clone 并运行——例如 DiffSinger 的 PyTorch 实现、HiFiSinger 的非官方复现、以及多个 VC 模型的快速上手指南。
对于学生和入门者而言,这是最好的学习地图:按年份和技术路线组织,读者可以从 AUTOVC(2019)开始,按时间线一路读到 MT3(2022),理解整个领域从 GAN→VAE→Diffusion→自监督的技术演进。
这个仓库的持续更新本身就是一个信号:歌声 AI 正在加速走出学术圈。几个值得关注的趋势: