Amphion
统一音频/音乐/语音生成的全栈工具箱,集成 MaskGCT/VALL-E 等 SOTA 模型,支持
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
统一音频/音乐/语音生成的全栈工具箱,集成 MaskGCT/VALL-E 等 SOTA 模型,支持
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,为什么同一个 AI 团队在训练 TTS(文字转语音)、歌声合成、声音转换时,往往要「重复造轮子」——各自写一套数据处理、模型训练、音频合成的代码?open-mmlab 团队推出的 Amphion 正是为解决这个痛点而生:它不只是一个模型,而是一个覆盖音频生成全链路的可复现研究平台,让研究者和工程师能站在同一套基础设施上做创新。
2023 年 12 月,来自上海人工智能实验室(Shanghai AI Lab)和香港中文大学(CUHK)的研究团队在 arXiv 发布 Amphion 论文,随即在 GitHub 获得大量关注。团队的核心判断是:音频生成领域正经历从单一任务模型(如 VITS、FastSpeech2)向统一多任务框架的转变,但社区缺乏一个模块化、可复现、开箱即用的统一工具链。
Amphion 的「北极星目标」(North-Star objective)是:将任意输入转换为音频。这一定位决定了它不是一个针对单一任务优化的模型,而是一个覆盖 TTS、SVS(歌声合成)、VC(声音转换)、SVC(歌声声音转换)、TTA(文字转音频)等多个任务的综合平台。MIT 许可证使其对工业应用和学术研究均十分友好。
Amphion 的架构设计遵循深度模块化原则,核心目录结构如下:
processors/:音频/文本特征提取器,包括声学特征、MFCC、phoneme、content embedding 等模块models/:各任务核心模型实现(TTS、VALL-E、MaskGCT、NaturalSpeech3、VITS、JETS、FastSpeech2 等)bins/:推理入口脚本(tts/vc/svc/tta/vocoder),CLI 方式运行config/:JSON 格式配置文件,统一管理训练/推理参数pretrained/:预训练模型权重(HifiGAN、BigVGAN、WavLM、RoBERTa 等)evaluation/:评估指标集(SMOS、CMOS、FAD、ASR 等)这种设计的好处是:每个模块可以独立替换和升级。研究者想换一个声码器(vocoder),只需修改配置;想尝试新的文本分析器,直接替换 processors/ 下的对应模块即可。

图1:Amphion 多任务统一架构(以 VeVo 语音转换为例)
Amphion 集成了近年来音频生成领域的多个 SOTA 模型:
| 模型 | 任务 | 特点 |
|---|---|---|
| MaskGCT | TTS / SVS | 2024 年新工作,无监督音素解耦,支持多语言零样本 |
| VALL-E | TTS | 首个基于语言模型的零样本 TTS,支持 3 秒音频提示 |
| NaturalSpeech3 | TTS | 自然语音合成三代,支持细粒度韵律控制 |
| JETS | TTS | 端到端联合建模,结合 VAT 和 Flow-matching |
| VITS / VITS-SVC | TTS / VC | 高质量变分推断 + 对抗训练 |
| FastSpeech2 | TTS | 鲁棒时长预测 + 韵律预测 |
| VeVo / VeVo1.5 / VeVo2 | VC / SVC | 歌声与语音统一生成,可控风格迁移 |
| DiffCodec / DualCodec | 音频编解码 | 低码率语义增强型神经音频编解码 |

图2:MaskGCT 模型架构 — 基于掩码条件生成的无监督 TTS 系统
Amphion 提供了丰富的声码器选项,这是决定最终音频质量的关键环节:
这种「声码器即插即用」的设计让研究者可以在同一生成模型下切换不同的声码器,直接对比质量差异,这是其他框架很少提供的灵活性。
Amphion 提供了官方 Dockerfile(基于 nvidia/cuda:11.8.0-cudnn8-devel-ubuntu18.04),通过 docker build + docker run --runtime=nvidia --gpus all 即可在容器内运行,避免了依赖地狱。
优点:conda 环境隔离,依赖版本固定;一键 env.sh 安装所有 pip 依赖;腾讯云镜像加速,国内下载快。
缺点:基础镜像较大(CUDA 11.8 + cuDNN8),Docker 镜像体积约 15GB+;无 docker-compose.yml,多服务编排需自行配置;无 Web UI,仅 CLI 脚本入口,对非技术用户不友好;必须 GPU,没有 CPU fallback,推理至少需要 8GB 显存。

图3:SVC(歌声声音转换)端到端流水线 — 从内容编码到语音合成的完整链路
Amphion 适合的场景:学术研究者(快速复现论文工作,模块化替换实验);语音 AI 工程师(基于成熟架构快速搭建原型);内容创作者(本地运行歌声合成/声音转换,需一定技术背景);数据集构建团队(数据增强和大规模数据集构建工具)。
Amphion 不适合:没有技术背景的普通用户(纯 CLI,无图形界面);需要 CPU 推理的轻量化场景;追求极致实时性(RTF 小于 0.1)的生产部署。

图4:NaturalSpeech3 系统概览 — 细粒度韵律控制的自然语音合成
open-mmlab 此前以 MMSegmentation、MMDetection、MMEditing 等视觉工具箱闻名,Amphion 的出现标志着 open-mmlab 正式将能力边界拓展到音频与语音 AI 领域。其与 HuggingFace、ModelScope、OpenXLab 三大平台的同步支持,以及持续更新的模型发布(Vevo2 于 2026 年 3 月发布),显示出活跃的社区维护。
当前已有超过 9800 颗 stars 和 800+ forks,在音频生成工具类项目中位居前列。它代表了一种趋势:从「追求单个 SOTA 模型」转向「构建可复现的系统化工具链」,这对于降低音频 AI 研究和应用的门槛,有着重要的推动意义。

图5:MeTiS 两阶段微调流程 — 预训练+指令微调的组合策略