BLINK_Benchmark
ECCV 2024多模态LLM视觉感知评测基准,14类CV任务揭示GPT-4V/Gemini仅达51
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
ECCV 2024多模态LLM视觉感知评测基准,14类CV任务揭示GPT-4V/Gemini仅达51
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你给 AI 看了一张建筑工地的照片,问它「这两个人谁离摄像机更近?」——人类瞄一眼就能回答,但 GPT-4V 和 Gemini Pro 却在这个问题上犯了难,准确率甚至不如随机猜测。这就是 BLINK 基准诞生的直接原因。
BLINK(ECCV 2024)是由宾夕法尼亚大学、华盛顿大学、康奈尔大学联合发布的多模态大语言模型评测基准,专注于评估 AI 的核心视觉感知能力——而非简单的图像识别。论文标题「Can See but Not Perceive」直击要害:当前最强的多模态模型能「看见」图像,但无法真正「感知」空间、深度、对应关系等底层视觉信息。

图1:BLINK项目Logo
现有 VLM 评测普遍聚焦于图像理解、视觉问答等高层任务,这些任务可以通过语言线索(如常识、上下文)间接解决,模型即使没有真正「看懂」图像也能答对。BLINK 另辟蹊径,将 14 类经典计算机视觉问题(共 3,807 道选择题)改造为多模态感知测试,这些任务的共同特点是:人类在「一眨眼」间就能完成,但模型却难以靠语言推理绕过。
这 14 个子任务涵盖:

图2:BLINK 评测任务概览
BLINK 的评测结果揭示了一个尴尬的现实:当前最先进的多模态模型与人类差距悬殊。
人类基准准确率达到 95.70%,而 GPT-4V(vision preview)仅为 51.26%,Gemini Pro 1.0 更是低至 45.72%——仅比随机猜测(38.1%)高出约 7-13 个百分点。
GPT-4o(2024年6月)取得了最大突破,测试集准确率达到 59.0%,但仍未突破 60% 大关。值得注意的是,GPT-4o 的验证集准确率(60.0%)甚至高于测试集,说明 GPT-4o 在 BLINK 上表现仍有波动。Claude 3 Opus 表现平稳但无亮点(44.1%),开源模型 LLaVA-1.5-13B 约 40.6%,MiniGPT-4-v2-7B 垫底(34.6%)。
更值得深思的是,同一任务下,专门针对该任务训练的 CV 模型(专家模型)远超通用多模态模型——这说明感知能力尚未在多模态 LLM 中「涌现」,还需要专门的设计和训练。
BLINK 的评测代码设计得非常模块化,核心依赖:
import datasets
# 加载数据集
data = load_dataset('BLINK-Benchmark/BLINK', 'Art_Style')
评测流程:
datasets 库直接加载 14 个子任务的数据query_model.py 中的 query_gpt4v() 函数向 OpenAI API 发送图片和提示词multiple_choice.py 将模型自由文本回答归一化为 (A)/(B)/(C)/(D) 格式evaluate.py 汇总各子任务预测结果,与 val_answers.json 比对输出准确率# 核心推理调用
from eval.query_model import query_gpt4v
answer = query_gpt4v(image_paths, prompt, retry=10)
代码支持自定义模型扩展,只需实现相同结构的 query_xxx 函数即可。数据集通过 Hugging Face Hub 分发,无需手动下载。
BLINK 是纯评测工具包,不涉及模型训练,部署极简:
git clone https://github.com/zeyofu/BLINK_Benchmark.git
cd BLINK_Benchmark
pip install datasets openai Pillow tqdm
# 设置 OpenAI API Key
export OPENAI_API_KEY=sk-...
验证集评测直接本地运行,测试集需在 EvalAI 提交结果。评测速度取决于 API 调用频率,1,900 条数据约需数十分钟。
BLINK 评测同样存在局限:
BLINK 的出现填补了多模态 LLM 感知能力评测的空白。ECCV 2024 接收本身也说明学界对这一方向的认可。更重要的是,它为行业指明了一条新路:感知能力的提升不能仅靠「更大」的语言模型,还需要专门针对视觉表征的设计。
2024 年中,GPT-4o 和 Gemini 1.5 Pro 在 BLINK 上的显著进步已经验证了这一方向——多模态感知能力确实可以通过更好的训练策略获得。BLINK 将持续作为标准评测工具,推动下一代多模态模型向人类视觉感知水平迈进。
项目信息: | Stars: 171 | Fork: 8 | License: Apache-2.0 | 主页: https://zeyofu.github.io/blink/ | 数据集: HuggingFace BLINK-Benchmark/BLINK | 论文: arXiv:2404.12390