awesome-ai-voice
最全面的开源语音AI模型索引,覆盖TTS、语音克隆、音乐生成等30+项目
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
最全面的开源语音AI模型索引,覆盖TTS、语音克隆、音乐生成等30+项目
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你在写一篇论文,需要一段专业的英文朗读;你的外婆只会说四川方言,你想让她"读"出这篇文章;你喜欢的配音演员声音被盗用合成了一段广告——这些场景背后,都指向同一个技术浪潮:开源语音AI模型的爆发式进化。
2025—2026年,以TTS(Text-to-Speech)、语音克隆和音乐生成为代表的开源语音AI迎来了真正的爆发。从早期只能生成机械音的拼接系统,到如今零样本(Zero-shot)克隆、情感可控、流式实时输出,开源模型的能力边界被快速刷新。wildminder/awesome-ai-voice 正是这一浪潮的忠实记录者——它系统梳理了截至2026年初全球范围内最具影响力的开源语音AI项目,堪称该领域的"百科全书"。
awesome-ai-voice 的作者 wildminder 是一位活跃在 GitHub 的独立开发者,专注于音频AI方向。这个仓库的诞生背景非常典型:2024—2025年间,开源TTS模型密集发布,每隔几周就有新模型刷榜 GitHub Trending,但缺乏一个系统性的分类索引。开发者们疲于在 Twitter、HuggingFace、arXiv 之间跳转检索。wildminder 用一个简洁的 Markdown 列表解决了这个问题——按发布时间倒序排列,每个模型附带关键参数对照表。
截至最近更新,该仓库收录了涵盖 TTS、语音克隆、音乐生成、ASR(自动语音识别)、音频修复等多个子类别的数十个开源项目,以 MIT License 开放,完全免费。
图1:仓库核心数据 Badge(TTS 模型数 24+,支持语言 80+)
TTS 是本仓库的主菜,收录了目前最活跃的24+个开源TTS项目。仓库提供了一张高价值的快速对比表,从参数量、零样本克隆、发音控制、情感控制、语言支持、流式输出等多个维度进行横向比较。以下是几个代表性项目:
VoxCPM2(OpenBMB,2026):2B参数的无tokenizer扩散自回归TTS模型,支持30种语言+9种中文方言,具备流式推理能力(RTF ~0.3),延迟低至实时级别。最大亮点是无需传统tokenizer,文本直接送入模型,大幅简化了预处理流程。
Fish Audio S2 Pro(2026年3月):采用双自回归架构(4B慢速AR + 400M快速AR),结合强化学习对齐,实现了业界领先的韵律和情感精细控制。支持80+语言,中英日为第一梯队。参数量5B,对硬件要求较高,但输出质量在同类中属于顶级。
Qwen3-TTS(阿里云,2026年1月):阿里继通义千问之后的语音力作,0.6B-1.7B参数家族,支持10种主流语言。强调流式输出,延迟仅97ms,是目前最低延迟的开源方案之一。3秒音频即可完成零样本克隆。
Fun-CosyVoice 3.0(FunAudioLLM,2025年12月):支持9种语言+18种中文方言的跨语言克隆能力是其最大卖点。参数仅0.5B但流式延迟150ms,在资源受限场景下性价比极高。
Kokoro-82M:最轻量的方案,8200万参数,支持8种语言54种音色,流式输出。Apache-2.0许可,适合移动端和边缘设备部署。
从这张对比表可以清晰看到几个趋势:① 流式实时输出正在成为标配,2025年后发布的新模型几乎全部支持;② 中文支持大幅增强,Fun-CosyVoice 3.0、LongCat-Next 等都特别优化了中文方言;③ 情感/韵律精细控制 从加分项变为必选项。
除了纯语音合成,项目还涵盖了音乐生成(如MusicGen、AudioLDM等模型的更新版本)、Anything to Audio(任意音频生成)、Audio Restoration(音频修复增强)以及ASR(自动语音识别)等方向。这些板块在当前版本的README中被截断,但从目录结构可知,每一板块同样采用「模型卡片」格式,包含参数量、能力矩阵、许可协议、GitHub/HuggingFace链接。
从这份列表的演变历史来看,TTS 技术经历了三个阶段:
当前主流技术路线分为两大流派:自回归(AR)+ 非自回归(NAR)混合架构(以 Fish Audio 为代表,追求最高质量)和 纯扩散/流式架构(以 Kokoro、VoxCPM2 为代表,追求实时性)。
awesome-ai-voice 本身是一个纯 Markdown 列表,无需安装任何依赖,直接在 GitHub 网页浏览即可。每个模型条目都提供了 GitHub 仓库链接和 HuggingFace Space 演示链接,开发者可以快速跳转到对应项目。
如果想试用具体模型,主流路径有三条:
适合人群:AI语音研究者、播客/视频创作者、游戏/有声书开发者、多语言内容创作者。
这份列表虽然系统,但也存在几个需要注意的问题:
信息滞后风险。开源模型更新极快,24小时内可能就有新版本发布。列表中的参数量、功能特性存在"快照效应",读者需要自行去 GitHub 确认最新版本号和变更日志。
质量参差不齐。收录范围广意味着并非所有项目都具备生产级质量。部分早期项目(如某些0.5B参数模型)仅供研究参考,实际语音自然度远不如商业方案(Google WaveNet、 ElevenLabs)。
许可协议碎片化。从 MIT 到 Apache-2.0、从 CC BY-NC 4.0 到 LFM(Limited Fair Use),各模型许可差异巨大。商业应用需逐一核实,LFM 类模型的商用条款尚不明确。
中文资料匮乏。多数模型文档以英文为主,中文社区的使用经验和踩坑记录分散在知乎、CSDN 等平台,列表本身未做整合。
awesome-ai-voice 的价值不仅在于"收集",更在于"结构化"。它让研究者和开发者能够以鸟瞰视角审视整个语音AI领域,从而做出更明智的技术选型。
从增长曲线来看,列表中的项目从2023年的稀疏几个到2026年初的30+,呈指数级增长。这一趋势背后有三个驱动力:①开源数据集(LibriTTS、MiniTTs、ARCTIC)的规模和质量持续提升;②大模型预训练范式向语音领域的迁移;③硬件成本下降(消费级GPU即可跑通多数模型)。
这个仓库也是观察中国AI力量崛起的一个窗口:Fun-CosyVoice(阿里巴巴)、GLM-TTS(智谱)、LongCat-AudioDiT(美团)、MOSS-TTS(复旦MOSS团队)等本土项目在列表中占据了相当比例,且技术指标与海外头部项目差距正在快速收窄。
总结:awesome-ai-voice 是目前最全面的开源语音AI项目索引之一。对于想了解语音合成领域最新动态的开发者,它是一个高效的信息入口;对于正在做技术选型的团队,它提供了横向对比的框架;对于AI爱好者,它是了解这一浪潮的理想起点。唯一需要记住的是——开源世界变化极快,这个列表的价值在于它捕捉了"某一时刻的快照",真正的探索还要自己去 GitHub 和 HuggingFace 完成。