audio-ai-hub
音频AI领域最完整的开源研究索引,收录129个论文/模型/数据集,11大分类,Whisper/MusicGen等头部项目全覆盖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
音频AI领域最完整的开源研究索引,收录129个论文/模型/数据集,11大分类,Whisper/MusicGen等头部项目全覆盖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你是某高校的语音方向研究生,导师让你调研近两年 Audio LLM(音频大语言模型)领域的最新进展。你打开 Google Scholar,输入"audio LLM survey",出来上千篇论文——有商用的、有不开源的、有代码失踪的。你花了三天时间,最终整理出一份七零八落的清单,还漏掉了 MusicGen 的最新变种。
这种"信息碎片化"的痛苦,正是 BinWang28/audio-ai-hub 试图解决的核心问题。
这是一个由个人维护的音频 AI 研究资料库(Awesome-list 模式),目前收录了 129 篇论文/模型/数据集,涵盖 11 个分类,从语音识别(Speech Recognition)、语音合成(TTS)到音乐生成(Audio Generation)、多模态(Multimodal),几乎覆盖了音频 AI 的所有主流方向。库的维护者 Bin Wang(王斌)来自学术背景,持续追踪 arXiv 最新论文,并通过 GitHub Actions 自动刷新各项目的 GitHub Stars 数据,确保榜单的时效性。
图1:audio-ai-hub 主页概览
audio-ai-hub 不仅仅是一个 README.md 清单。它有一套严格的 JSON Schema 规范(schema.json),每个条目(items/*.json)都必须包含以下字段:
这套规范保证了数据的结构化程度远超普通 awesome-list,使得未来可以轻易导出为数据库、构建 API 或生成可视化图表。
图2:条目示例——Whisper 模型卡片

这个项目最值得关注的技术细节不是代码本身,而是持续集成流水线的设计:
scripts/refresh_stars.py:每周定时运行(.github/workflows/refresh-stars.yml),对 items 目录中所有条目抓取最新的 GitHub Stars 数据,更新 docs/stars.json,从而让 README 中的排名始终反映真实热度。
scripts/arxiv_watcher.py:自动监控指定作者/关键词的 arXiv 论文更新,辅助维护者发现新条目。
format_input.py:Python 脚本从 items/*.json 自动生成三份输出:
README.md — GitHub 仓库首页的入口页docs/data.json — 前端全量数据docs/index.html — 服务端渲染的 HTML(SEO 友好,无需 JS 即可阅读)这意味着维护者只需要维护一份 JSON 数据源,所有展示层自动同步,零手动更新。
根据 README 和 schema 的分类枚举,这个 hub 呈现了音频 AI 领域从研究到应用的完整生态:
| 分类 | 含义 | 代表条目 |
|---|---|---|
| Speech Recognition | 语音识别 | Whisper、MMS、AVSR-Gen |
| Speech Synthesis | 语音合成/配音 | CosyVoice 3、VALL-E |
| Audio Generation | 音频/音乐生成 | MusicGen、AudioGen |
| Multimodal | 多模态模型 | MiniCPM-o、AudioGPT |
| Benchmark | 评测基准 | AIR-Bench、ADU-Bench |
| Dataset Resource | 数据集资源 | 各类开源语音数据集 |
| Safety | 安全与隐私 | 音频深度伪造检测 |
| Survey | 综述论文 | AudioLM Survey |
| Model and Methods | 基础模型/方法 | VoxCPM2 |
| Study | 探究性研究 | ACA-SER |
| Chatbot | 音频对话系统 | Audio Reasoning 相关 |
虽然 README.md 是项目的入口,但维护者明确建议:要搜索、筛选、按 Stars 或日期排序,使用互动网站。这个静态站点基于纯前端技术(HTML + CSS + JavaScript),数据来自 docs/data.json,无需后端服务器,可以部署在任何静态托管平台上(GitHub Pages、Cloudflare Pages 等),运行零成本。
作为一个纯个人维护项目,audio-ai-hub 也有其局限:
在 2024-2026 年间,音频 AI 领域经历了爆发式增长——Whisper 开源、MusicGen 爆火、CosyVoice 3 突破……研究人员的痛点从"找不到论文"变成了"找到了不知道哪个最值得深入"。一个高质量、结构化、持续更新的 awesome-list,实际上承担了行业信息筛选器的角色,降低了整个社区的认知成本。
BinWang28/audio-ai-hub 以 944 Stars(同类项目中非常高的水平)证明:在这个信息爆炸的时代,"做减法"比"做加法"更有价值。一个好的索引,本身就是科研工具。
分析基于 2026-07-19 采集的数据。互动站点:https://binwang28.github.io/audio-ai-hub/