MMAudio
CVPR 2025 论文开源 - AI 根据视频和文本自动生成同步音频,支持 44.1kHz 高保真
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
CVPR 2025 论文开源 - AI 根据视频和文本自动生成同步音频,支持 44.1kHz 高保真
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你用 Sora 生成了一段唯美的海浪冲浪视频,想要配上真实的海浪声和环境音——传统做法是花几百块请音效师,或者在素材库里面翻找。但 MMAudio 告诉你:只需要一行命令,AI 就能根据视频内容自动生成听起来很真实的音频。
这听起来像是魔法,但背后是一整套严谨的 CVPR 2025 论文:来自伊利诺伊大学厄巴纳-香槟分校(UIUC)和索尼 AI 的研究团队,提出了名为 MMAudio 的视频到音频(Video-to-Audio)生成模型,GitHub 至今已累计超过 2200 颗星。
![]()
图1:MMAudio 项目图标
MMAudio 的核心作者是来自 UIUC 的 Ho Kei Cheng 以及索尼 AI 的研究团队。从 GitHub 提交记录来看,这个项目从 2024 年中开始开发,作者主页显示他们长期关注音视频联合学习(Audio-Visual Learning)方向。
项目的核心动机很清晰:现有的视频生成模型(如 Sora、Veo 2)已经能生成画面,但配套音频一直是短板。索尼团队认为,音频和视频本质上描述的是同一个场景,天然存在跨模态关联——海浪画面关联海浪声,爆炸场景关联轰鸣声——如果能让模型同时理解视觉和听觉信号,就能实现高质量的视频配音。

图2:项目核心作者 Ho Kei Cheng
MMAudio 的技术核心叫做 Multimodal Joint Training(多模态联合训练)。简单来说,传统的音频生成模型只能从文本生成音频或从视频生成音频,训练数据受限于配对的视频+音频数据,量级有限。而 MMAudio 的创新在于:它同时利用了三种数据——视频-音频配对数据、音频-文本描述数据,以及纯音频数据——让模型在更大规模的数据上进行训练,从而显著提升生成质量。
这项技术最终发表在 CVPR 2025(计算机视觉领域顶级会议),论文标题为《Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis》。
MMAudio 的整体架构可以类比为三个主要工厂流水线的组合:
视觉编码器:使用 OpenAI 的 CLIP 模型,将输入视频的每一帧转换为向量表示,让模型看懂视频内容。
同步对齐模块(Synchformer):这是论文的另一个关键创新。它专门学习视频画面和音频之间的时间对应关系——确保生成的音频和视频画面在时间上完美对齐。比如视频中一个人张嘴说话,Synchformer 会确保说话声恰好出现在对应帧。
扩散模型(Flow Matching):在获得视频特征和文本特征后,MMAudio 使用 Flow Matching 扩散模型来生成高质量 44.1kHz 的音频。Flow Matching 是一种比传统 DDPM 更高效、更稳定的扩散方法,相比 EDM2 等方法有更好的训练稳定性。
音频解码器部分使用了 BigVGAN(来自字节跳动 Make-An-Audio 2 和 NVIDIA 的合作),这是一种专门针对高保真音频生成的神经声码器(Neural Vocoder),能将模型输出的频谱信息转换为可听的波形文件。最终输出的音频格式为 FLAC,采样率 44.1kHz。
MMAudio 并不只是视频配音工具,它实际上支持三种输入组合:
安装过程非常标准:
git clone https://github.com/hkchengrex/MMAudio.git
cd MMAudio
pip install torch torchvision torchaudio # 需 PyTorch 2.5.1+
pip install -e .
推理只需要一行命令:
python demo.py --duration=8 --video=my_video.mp4 --prompt 'waves crashing on the beach'
推理默认使用 large_44k_v2 模型,在 16-bit 模式下显存占用约 6GB,大多数现代 NVIDIA 显卡(RTX 3060 以上)都能运行。
如果不想折腾命令行,项目还提供了开箱即用的 Gradio 界面:
python gradio_demo.py
启动后访问 http://localhost:7860 即可使用图形界面,上传视频、填写提示词、点击生成。README 还特别提到了可以通过 SSH 端口转发远程访问:
ssh -L 7860:localhost:7860 your-server
不过需要注意的是:没有 Docker 支持,如果服务器没有 conda/venv 环境,配置 Python 依赖可能会遇到 CUDA 版本不匹配等问题——这大概是该项目在部署便利性上最大的遗憾。
项目 README 坦诚地列出了当前版本的三个已知局限:
偶尔产生类似人类语音的不可理解声音:模型有时会生成一些听起来像人类说话但实际无意义的声音,这在训练数据中的语音相关内容中有所体现。
背景音乐质量有限:在没有专门音乐训练的情况下,模型有时会不自觉地生成背景音乐片段,质量不如专业音乐生成模型。
生僻概念理解不足:模型能生成枪声但很难生成 RPG 发射这种特定武器的音效——这本质上是训练数据覆盖度的问题。
作者在 FAQ 中也提到,不同硬件环境(是否使用 torch.compile、视频读取库、推理精度、随机种子等)会导致生成结果存在细微差异,这是扩散模型天然的不确定性。
此外需要特别注意的是:预训练模型采用 CC-BY-NC 4.0 许可证,仅限非商业研究使用,直接用于商业产品存在法律风险。
2024-2025 年是视频生成爆发年:Sora、Veo 2、PixVerse、Hunyuan Video 相继登场,但这些模型无一例外都是哑巴——能生成画面但无法生成配套音频。MMAudio 出现的时间节点恰好在这个大背景下,它的目标并非取代专业的音频工作者,而是填补 AI 视频生成流程中音频环节的空白。
从技术趋势看,多模态联合训练正在成为 AI 音频领域的共识方向:音频-视觉对齐(Synchformer)、大规模扩散模型(Flow Matching)、高效神经声码器(BigVGAN)这三项技术的组合,预示着未来可能出现更强大的音视频联合生成模型。
对于 AI 爱好者而言,MMAudio 的开源意味着:你可以用 Sora 生成的视频,配合 MMAudio 生成的音频,再配合现有的唇形同步模型,就能构建一套 AI 视频配音+对口型的完整工作流。
| 指标 | 数值 |
|---|---|
| 会议 | CVPR 2025 |
| 输入模式 | 视频+文本 / 纯文本 / 纯视频 |
| 输出采样率 | 44.1kHz |
| 输出格式 | FLAC |
| 推荐显存 | ≥6GB |
| 推理步数 | 25 步 |
| 主模型 | large_44k_v2 |
| 许可证 | MIT (代码) / CC-BY-NC 4.0 (模型) |