Awesome-Unified-Multimodal-Models
统一多模态模型领域最全论文资源库,收录240+论文/数据集/评测基准
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
统一多模态模型领域最全论文资源库,收录240+论文/数据集/评测基准
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你对着一张照片说"帮我把这张图的风格改成梵高画风,然后配上一段诗意的文字",一个模型同时理解图像、生成图像、写出文字——这就是**统一多模态模型(Unified Multimodal Models)**正在做的事。在传统的 AI 架构中,理解和生成是两套独立的系统,而 2023-2025 年间,一股"大一统"浪潮正在重塑这个领域。Awesome-Unified-Multimodal-Models(AIDC-AI 组织维护)正是这场浪潮的完整编年史。
这个 GitHub 资源库收录了截至 2025 年几乎所有重要的统一多模态研究论文、数据集和评测基准,star 数超过 1200,是该领域最具影响力的社区聚合项目之一。

图1:统一多模态模型的发布年份时间线。图中加下划线的模型为 Any-to-Any 类型,支持文本、图像以外的音频、视频、语音等模态输入输出。可以看到 2024-2025 年是该领域爆发期。
Awesome-Unified-Multimodal-Models 由阿里巴巴达摩院旗下 AIDC-AI 团队维护,该组织还同步发布了配套的 arXiv 综述论文(arXiv:2505.02567),系统梳理了统一多模态模型的技术演进路线。
项目的维护团队同时在招募研究实习生和全职研究员(联系邮箱:qingguo.cqg@alibaba-inc.com),研究方向涵盖多模态理解、生成、推理、AI Agent 等前沿方向。
仓库结构极简,仅包含一份 105KB 的 README.md 文档和两张关键图表,没有任何代码文件——这是一个纯知识聚合型 Awesome List,面向的是 AI 研究者和工程师,帮助他们快速了解这一领域的全貌。
仓库内容分为以下四个板块:
这是最核心的部分,按技术架构分为三大流派,合计收录 92 个模型:
① Diffusion 流派(8 个):以扩散模型为生成骨干,典型代表包括 LaViDa-O(阿里巴巴)、MMaDA(Gen-Verse)、UniDisc(字节跳动)等。
② MLLM AR 流派(71 个,自回归主流):以大型多模态语言模型(MLLM)为骨干,通过自回归方式统一理解和生成,收录了 Emu3.5、Uni-X、Qwen2-VL、InternVL 3 等大量工业界和学术界的最新工作。
③ Hybrid AR+Diffusion 流派(13 个):同时利用自回归模型的推理能力和扩散模型的生成质量,代表作包括 Transfusion(Meta)和 EMMA(Google)。

图2:三类统一多模态架构的分类示意:Diffusion 流派、MLLM 自回归流派、AR+Diffusion 混合流派各自的代表模型及其在图像理解和生成任务上的能力覆盖范围。
这是最前沿的方向——模型不仅能理解和生成文本、图像,还支持音频、视频、语音等任意模态的输入和输出,是迈向 AGI 的关键一步。收录包括 Qwen3-Omni(阿里)、Ming-Omni(阿里)、OmniFlow(南洋理工)等。
衡量模型能力的标准比模型本身还多。仓库系统收录了三大类评测基准:
训练统一多模态模型的数据,按用途分为多模态理解类(LLaVA-OneVision、ShareGPT4V、Cambrian-10M)、文本生成图像类(Infinity-MM、Honey-Data-15M)、图像编辑类(GRIT)、图文交错类等。
作为一个 Awesome List 资源库,本项目无需任何部署——没有代码、没有容器、没有依赖项。研究者可以直接在 GitHub 上 star 并浏览 README 文档,或者 clone 到本地作为书签使用。如果希望离线阅读,直接 clone 仓库后用 Typora 或 Obsidian 等 Markdown 阅读器打开即可。硬件门槛:零要求。
从 2023 年 Chameleon(Meta)首次将图像 token 直接融入 LLM,到 2025 年 Any-to-Any 模型能同时处理 7 种以上模态,这个领域的发展速度惊人。本仓库的价值在于:研究者的地图(面对爆炸式增长的论文,提供清晰的分类体系和研究脉络)、工程师的索引(直接链接到 HuggingFace 模型权重和 arXiv 论文,可一键跳转)、趋势的晴雨表(从 Diffusion→MLLM AR→Hybrid 的演进,清晰展示行业从"分立"走向"统一"的方向判断)。
需要注意的是,作为一个持续更新的论文列表,仓库本身不提供代码实现,使用时请结合各个子项目的官方仓库一起参考。此外,由于论文数量庞大,部分条目可能存在引用格式不统一或链接失效的情况,建议以原始论文为准。
| 目标 | 推荐操作 |
|---|---|
| 快速了解领域全貌 | 从 README 顶部 Figure 1 时间线图开始 |
| 找特定任务模型 | 根据架构流派(Diffusion/MLLM/Hybrid)导航 |
| 找评测基准 | 进入 Benchmark 章节,查找对应任务类型 |
| 找训练数据 | 进入 Dataset 章节,按用途筛选 |
| 深入某个方向 | 点击对应论文的 arXiv/HuggingFace 链接 |
项目信息