MMStar
首个揭示多模态大模型评测数据泄露问题的 NeurIPS 2024 基准,含 MG/ML 双指标评估真
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个揭示多模态大模型评测数据泄露问题的 NeurIPS 2024 基准,含 MG/ML 双指标评估真
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你是一名驾校的考官,正在给学员打分。
问题是:你用来考核学员的场地,真的是他们以后开车的真实路况吗?
如果你发现,学员在没有看路的情况下,居然也能靠「背诵答案」通过大部分考核——那这套考核体系还能信吗?
这正是 MMStar 诞生的背景。
2024年,中科大、香港中文大学和上海AI Lab 的研究团队联合发布了一篇论文,标题就叫《Are We on the Right Way for Evaluating Large Vision-Language Models?》(我们评估多模态大模型的方式是否正确?)——并在 NeurIPS 2024 正式发表。
研究团队对当前主流的多模态基准测试做了深度解剖,发现了两个严重问题:
问题一:大量题目根本不需要看图就能回答。
某些 benchmark 中的题目,文字部分(问题+选项)已经包含了足够的信息,答案可以直接推断出来,视觉内容完全多余。比如一个选择题可能问「图中是什么动物」,但选项只有「猫、狗、鸟」,LLM 本身就能猜对——这考的不是多模态能力,而是纯文本推理能力。
问题二:训练数据泄露(L LM Pre-training Data Leakage)。
更致命的是,研究发现 GPT-4V 等顶级模型,即便在完全不读取图片的情况下,也能在很多 benchmark 上获得接近随机的分数。这说明 benchmark 的训练数据早已被 LLM 的预训练语料「污染」了,模型靠记忆通过了测试,而非真正的多模态理解。
论文中的数据显示,在不输入图片的情况下,GeminiPro 在 MMMU 基准上居然拿到了 42.7% 的分数,而随机猜测只有约 24%。这个差距触目惊心。
图1:MMStar 从 22,401 个候选样本中精选出 1,500 个高质量评估样本,数据来源覆盖多种公开多模态基准。
MMStar 是一个多模态大模型评测基准,由三所顶尖机构联合发布:
它的核心设计目标是:所有测试样本,必须真正依赖视觉信息才能回答。
为此,团队制定了一套严格的筛选流程:
最终,1,500 个高质量样本被保留下来,构成了 MMStar 的验证集(val set)。
图2:MMStar 基准测试结果,覆盖 6 大核心能力和 18 个细分维度,评测了 16 个主流多模态大模型。
MMStar 不仅仅是一个数据集,它还提出了两个创新性指标:
| 指标 | 含义 |
|---|---|
| Multi-modal Gain(MG,多模态增益) | 模型在有图片 vs 无图片情况下的性能差值。差值越大,说明模型真正利用了视觉信息。 |
| Multi-modal Leakage(ML,多模态泄露) | 评估基准数据在 LLM 预训练语料中的泄露程度。泄露越严重,基准的可靠性越低。 |
这两个指标让研究者可以同时衡量两件事:这个模型的多模态能力是否真实?这个 benchmark 是否可信?
MMStar 的评测代码基于 VLMEvalKit 构建,这是一个通用的多模态模型评测工具包。核心评估逻辑分为三种模式:
三组分数对比,就能计算出 MG 和 ML。
评测脚本 run.py 支持 torchrun 分布式启动,可以指定模型(如 llava_next_yi_34b)、数据集(MMStar)、生成长度、最大并发数等参数。配置文件 config.py 中硬编码了三个参考模型:LLaMA2-7B、Nous_Yi_34B 和 LLaVA-Next-34B。
此外,评测管道依赖完整的 Python 科学计算栈:PyTorch、transformers、vlm(视觉语言模型推理)、llm(语言模型推理)、evaluate(评估逻辑)、smp(工具函数)六大模块分层设计,职责清晰。
评测环境的依赖由 requirements.txt 明确定义,包含了视觉处理(opencv-python、pillow)、模型推理(torch、transformers)、数据处理(datasets、pandas)、评估工具(pycocoevalcap)以及 UI(Gradio,用于交互展示)。值得注意的是,它依赖 gradio==4.15.0,意味着项目自带 Gradio 网页界面,方便可视化浏览评估结果。
部署流程只需三步:
conda create -n mmstar python=3.10
conda activate mmstar
cd eval && pip install -e .
安装完成后,运行评估:
torchrun --nproc-per-node=4 --master_port ${PORT} run.py \
--verbose \
--data MMStar \
--model llava_next_yi_34b \
--max-new-tokens 32 \
--gen-mode mm
MMStar 的出现填补了一个关键空白:在此之前,业界评测多模态大模型的方式存在系统性缺陷——要么题目不需要看图,要么数据已被训练语料泄露。这导致很多「高分」模型实际上是虚胖,而非真正的多模态能力强者。
MMStar 推动了评测基准的「净化运动」,也迫使研究者重新思考:什么是真正的多模态能力?如何设计一个不会被数据泄露污染的公平评测环境?
该论文在 NeurIPS 2024 发表,代码和数据集均已开源,评测结果同步在 OpenCompass 平台上展示。研究团队还在不断完善中,计划推出线上测试集 MMStar-test。
MMStar 也有自己的局限:
MMStar 不是一个普通的多模态评测数据集,它是一面镜子,照出了当前多模态评测体系的系统性缺陷,并提供了可行的改进路径。对于研究者和开发者来说,MMStar 提供了两个核心价值:更可信的评测基准和多模态增益/泄露两个量化指标。如果你正在训练或评估多模态大模型,MMStar 是目前最值得参考的评估工具之一。