MMMU
多学科多模态大模型评测基准,含11500道大学水平图文问答,衡量AI专家级理解能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
多学科多模态大模型评测基准,含11500道大学水平图文问答,衡量AI专家级理解能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,给 AI 一道大学会计学考试的选择题——"根据以下财务报表,计算该公司的流动比率",题目还附带着复杂的表格和图表。人类大学生需要数年专业学习才能回答的问题,AI 能否正确应对?
这正是 MMMU(Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark) 想要回答的核心问题。作为多学科多模态理解与推理基准,MMMU 由西安交大、OSU、滑铁卢大学等机构联合提出,于 2024 年发表于 CVPR,目前 GitHub 获星 578 颗,成为多模态大模型评测领域最重要的基准之一。

图1:MMMU 数据集涵盖六大核心学科,覆盖30个专业方向
早期 VQA(视觉问答)数据集(如 VQAv2、CLEVR)的问题往往浅显直接——"球是什么颜色?""图中共有几个物体?"。这类问题仅考验基础感知能力,无法评估模型的领域知识和深度推理能力。
MMMU 的设计者意识到:如果要衡量 AI 是否真正具备"专家级"多模态理解能力,必须让 AI 面对需要大学水平专业知识才能解答的题目。这些题目要求模型同时具备三项能力:
MMMU 共包含 11,500 个精心收集的多模态问答,数据来源为大学考试、测验和教材,按学科分为六大类:
| 学科类别 | 涵盖专业示例 | 题目数量占比 |
|---|---|---|
| 艺术与设计 | 艺术理论、设计基础 | ~5% |
| 商科 | 会计、金融、经济、管理、市场营销 | ~20% |
| 自然科学 | 生物、化学、物理 | ~15% |
| 健康与医学 | 基础医学、临床医学、药学 | ~15% |
| 人文与社会科学 | 历史、文学、地理、音乐 | ~15% |
| 技术与工程 | 计算机科学、电子、机械、能源电力 | ~30% |
题目类型分为选择题(给定 A/B/C/D 选项)和简答题(自由文本回答)两种,后者对模型的开放式生成能力要求更高。
2024 年 9 月,团队发布了 MMMU-Pro,在 MMMU 基础上引入了更严格的评估方法,核心改进包括三项:
研究团队首先将 MMMU 中仅靠文字信息就能回答的题目剔除,确保剩余题目必须依赖图像信息才能解答。这解决了原版 MMMU 中约 10-15% 题目"图片只是装饰"的尴尬问题。
将选择题选项从 4 个扩充到 10 个,大幅降低随机猜测的正确率(从 25% 降至 10%),使评测结果更能反映模型的真实理解能力。
在 MMMU-Pro 的 Vision-Only 设定下,问题和选项都以图像形式嵌入,AI 必须"看见并读取"——模拟人类在考试中阅读纸质试卷的真实场景,而非接收已经结构化的文字。

图2:MMMU-Pro 采用三步严格评估流程
仓库采用 mmmu/ 和 mmmu-pro/ 两个独立评估目录,分别对应 MMMU 和 MMMU-Pro 两套基准。
MMMU-Benchmark/MMMU/
├── mmmu/ # MMMU 评估
│ ├── README.md # 详细评测指南
│ ├── configs/ # 模型配置(如 llava1.5.yaml)
│ ├── main_eval_only.py # 仅评测:接收预测结果 JSON,直接比对答案
│ ├── main_parse_and_eval.py # 解析+评测:含 LLM 输出解析管道
│ ├── run_llava.py # LLaVA 模型推理示例脚本
│ └── example_outputs/ # 示例输出(含30个学科的 output.json)
└── mmmu-pro/ # MMMU-Pro 评估
├── evaluate.py # MMMU-Pro 评测主脚本
└── infer/ # 多模型推理脚本
├── infer_gpt.py # GPT 系列推理(支持 CoT/direct 模式)
├── infer_gemini.py # Gemini 系列推理
├── infer_transformers.py # HuggingFace Transformers 兼容模型
└── infer_lmdeploy.py # LMDeploy(支持InternVL等国产模型)
以 infer_gpt.py 为例,核心推理流程如下:脚本首先加载 YAML 配置的 prompt 模板(区分 CoT 链式推理和 Direct 两种模式),然后对每个题目构造多模态输入——将问题和选项拼接后,通过正则表达式提取 <image N> 标记并替换为统一 <image> 占位符,同时记录原始图像顺序以供后续使用。对于 MMMU-Pro Vision-Only 模式,则直接将整个问题嵌入单张图像中,完全模拟纸质考试场景。脚本支持 30 个并发 worker 调用 API 评测。
评测完成后,输出结构为:每个学科目录下生成 output.json(原始模型输出)、parsed_output.json(解析后的结构化答案)和 result.json(最终评分结果)三个文件。运行 print_results.py 脚本可汇总所有学科结果并以表格形式输出。
在 MMMU 原始版测试中,即使是当时最强的 GPT-4V,准确率也仅约 56%——这意味着即使是最先进的商业模型,在大学水平多学科推理上仍有近一半的错误率。相比之下,人类考试专家的平均水平约为 85-90%。
在 MMMU-Pro 的 Vision-Only 设置下,所有模型的准确率进一步下降至 16.8% - 26.9%,充分说明当前多模态模型在"真正看图理解"方面仍有巨大差距。
团队还实验了 Chain-of-Thought(CoT,链式推理)提示技术,发现 CoT 在大多数模型上能带来 小幅性能提升(约 1-3%),但并非万能解药——它无法弥补模型本身学科知识的不足。
值得注意的是,InternVL(上海 AI Lab)、Qwen-VL(阿里)等国产多模态模型在 MMMU-Pro 上的表现正在快速追赶,部分指标已接近 GPT-4V 水平,体现了国产多模态模型的快速进步。
MMMU 并非完美,其局限性值得关注:
MMMU 的出现标志着多模态 AI 评测从"简单视觉问答"迈入"专家级领域推理"的新阶段。它不仅为研究者提供了衡量模型真实能力的标尺,更揭示了一个关键洞察:感知能力不等于理解能力,多模态大模型在专业领域的短板远比想象中大。
随着 MMMU-Pro 的推出,评测标准进一步严格化,这有助于推动多模态基础模型向"真正的多模态专家理解"方向发展。对于 AI 研究者和从业者而言,MMMU 已成为评估下一代大型多模态模型不可或缺的基准工具。
项目信息