Awesome-Multimodal-Large-Language-Models
南京大学团队维护的MLLM领域最全面论文资源库,收录1000+论文,覆盖模型、评测基准、数据集全链路
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
南京大学团队维护的MLLM领域最全面论文资源库,收录1000+论文,覆盖模型、评测基准、数据集全链路
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你是一个 AI 研究者,想要了解多模态大语言模型(MLLM)领域目前最前沿进展在哪里——最新发布的模型是谁家的?哪个基准测试最权威?哪个研究方向最火热?如果一一去搜、去筛选,恐怕要花上好几天。但现在,有一个人已经帮你把这一切整理好了。
这就是南京大学机器智能组(NJU-MiG)打造的开源项目——Awesome-Multimodal-Large-Language-Models。
图1:MLLM 评估体系全景(MME-Survey 封面)
这个仓库从 2023 年 5 月上线至今,已收录超过 1000 篇相关论文,系统性地追踪多模态大语言模型从理论到实践的完整进化路径。它不仅是一个论文列表,更是一部 MLLM 领域的活体百科全书——每篇论文都有分类标签、来源、时间和代码链接,研究者可以按图索骥、快速定位自己需要的资料。
NJU-MiG(南京大学机器智能组)是南京大学计算机科学与技术系旗下的研究团队,长期专注于大语言模型、视觉语言模型以及多模态智能的研究。该团队在 MLLM 领域产出了大量有影响力的工作,包括 VITA 系列(实时视觉与语音交互)、MME 系列(多模态基准评测)以及 Video-MME(视频理解评测)等核心成果。
团队将这些研究成果的系统性梳理公开,建立了这个持续更新的资源库。相比于传统的论文列表,这个项目有几个显著特点:持续高频更新(最近更新为 2026 年 5 月)、分类精细(涵盖模型架构、训练方法、评估基准、数据集等 30+ 维度)、信息完整(每条论文都包含 arXiv 链接、GitHub 仓库、Demo 地址)。
这个资源库的内容可以分为以下几个核心板块:
第一,是模型篇。 仓库系统梳理了 GPT-4V、Gemini、Claude Vision、LLaVA、Qwen-VL、InternVL 等主流多模态模型的演进脉络,还包括大量国产创新模型(如 MiniCPM-V、VITA、Step3 等)。每个模型都标注了发布时间、技术特点和支持能力,帮助研究者快速了解各代际之间的差异。
第二,是评测基准。 MLLM 的评测是一个行业难题——如何衡量一个模型"真正理解"了图像?NJU-MiG 团队贡献了 MME(首个综合评测基准)和 Video-MME(首个视频理解评测基准)。这两个基准被广泛采用,NeurIPS 2025 DB Track 将 MME 选为 Highlight,CVPR 2025 收录了 Video-MME。
图2:Video-MME 覆盖 6 大视觉领域、30 个子类别,支持短中长三种时长的视频评测
第三,是数据集和训练方法。 仓库收录了多模态指令微调(Instruction Tuning)、上下文学习(In-context Learning)、链式思维(Chain-of-Thought)等核心训练范式的代表性数据集和方法论,帮助开发者理解"如何训练好一个 MLLM"。
从代码结构来看,这是一个完全基于 Markdown 的静态资源库,核心文件是单个巨大的 README.md(约 17 万字节),通过 Markdown 表格进行信息组织。文件结构极其简洁:
Awesome-Multimodal-Large-Language-Models/
├── README.md # 核心资源文档(170KB+)
└── images/ # 图表和封面图
这种设计有明显的优势:零学习成本——任何人都可以直接打开 README 浏览;易于贡献——通过 Pull Request 可以轻松添加新论文;天然可搜索——GitHub 自带的搜索功能足够支撑基础检索需求。
值得注意的是,该仓库按照多个维度对论文进行分类:按架构(Encoder-Fusion、Decoder-Only、Native Unified 等)、按训练阶段(预训练、SFT、RLHF 等)、按任务类型(图像理解、视频理解、语音交互等)、按发布时间(最新 Papers 单独成区)。这种多维分类让不同背景的研究者都能快速找到切入点。
NJU-MiG 团队依托这个仓库背后来做研究,产出了多个高影响力成果:
从数据来看,该仓库已收获 17,838 颗 GitHub Stars、1,125 个 Fork,287 人订阅关注,是 MLLM 领域最具影响力的资源库之一。
这个项目几乎是零门槛的。 无论你是 AI 爱好者、研究生、科研人员还是工业界开发者,都可以从中受益:
整个项目通过 Git 克隆即可使用,不需要安装任何依赖,也不消耗任何硬件资源。
需要客观指出的是,这个项目也有其局限性:
这些局限也意味着,这个项目更适合作为"入口",找到感兴趣的方向后再深入到具体论文或代码仓库。
Awesome-Multimodal-Large-Language-Models 的出现,代表了开源社区在 AI 前沿领域的一种重要协作模式:由核心研究团队维护、以论文追踪为载体、持续更新为驱动。这种模式比传统学术综述更新更快、更开放,比社交媒体信息更系统、更可靠。
随着 GPT-4o、GPT-5 等端到端多模态模型的出现,MLLM 的研究正在从"视觉语言融合"走向"全模态统一"(Unified Multimodal)。这个仓库也在同步演进,新增了 Audio、Speech 等模态的追踪。NJU-MiG 团队在 2025 年发布的 Unified Survey 正是这一趋势的系统性总结。
简单来说:无论你是谁,只要关心多模态 AI 的进展,这个仓库就是你的第一站。