VLMEvalKit
支持 220+ 视觉语言模型、80+ 基准测试的开源多模态评测工具包,由上海人工智能实验室开源
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
支持 220+ 视觉语言模型、80+ 基准测试的开源多模态评测工具包,由上海人工智能实验室开源
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否曾被这样的问题困扰——想要评测一个视觉语言大模型(VLM),但光是配置评测环境、准备数据集、对齐输出格式,就要花上一整周?VLMEvalKit 正是为解决这个痛点而生。它由上海人工智能实验室(OpenCompass 团队)主导开发,是目前 GitHub 上规模最大、覆盖最广的开源 VLM 评测框架之一,支持 220+ 模型和 80+ 基准测试,一键完成从推理到打分的全流程。

图1:VLMEvalKit 项目 Logo
2023 年 GPT-4V 发布后,视觉语言模型迅速成为 AI 领域最热门的方向。短短两年,InternVL、Qwen-VL、LLaVA、GPT-4o、Gemini 等数十个模型相继问世,各家都在宣传「业界领先」的评测分数。但问题随之而来:不同模型在不同榜单上的分数无法横向比较——有的模型专精图表理解,有的模型擅长 OCR,有的模型在视频理解上表现突出。评测基准不统一、评测代码私有化,导致研究社区很难独立复现结果。
OpenCompass 团队敏锐地捕捉到这个需求,于 2024 年初开源了 VLMEvalKit,目标是为所有开源 VLM 提供标准化、公平、可复现的统一评测平台。截至目前,该项目已获得 4100+ GitHub Stars,被 700+ 个项目 Fork,在多模态 AI 领域具有重要影响力。
VLMEvalKit 的核心能力可以概括为三个「一键」:
一键评测:用户只需准备模型权重和配置文件,运行 python run.py 即可自动完成数据下载、推理、结果汇总和打分。以评测 InternVL2 为例,配置文件只需指定模型路径和推理后端(支持 transformers、lmdeploy、vLLM),其余全部自动处理。相比从零编写评测脚本节省 90% 的工作量。
一键扩展:如果想添加新模型或新数据集,不需要修改核心代码,只需在 vlmeval/vlm/ 或 vlmeval/dataset/ 目录下新增适配文件,即可接入整个评测体系。项目维护者定期合并社区贡献的新模型支持,目前已支持 220+ 模型的评测。
一键可视化:项目提供了基于 Gradio 的交互式评测结果可视化工具(scripts/mmb_eval_gradio.py),在浏览器中即可查看各模型在不同基准测试上的雷达图、柱状图对比,免去了手动绘图的工作。

图2:评测结果可视化示例
VLMEvalKit 支持的基准测试覆盖了 VLM 评测的各个方面:
支持的数据集持续增加,2025 年新增了 MMMU-Pro、WeMath、3DSRBench、LogicVista 等十余个新基准,始终保持与学界最新进展同步。
VLMEvalKit 采用高度模块化的架构,核心目录结构如下:
vlmeval/vlm/:VLM 模型适配层,每种模型一个文件,统一推理接口vlmeval/dataset/:数据集加载和预处理,支持 80+ 数据集vlmeval/inference.py:推理引擎,支持多后端(transformers、lmdeploy、vLLM)vlmeval/smp/:评测打分逻辑,支持精确匹配和 LLM 答案提取两种方式run.py:统一入口脚本,解析配置并调度推理scripts/:辅助脚本,包括 Gradio 可视化、自动批量运行等这种设计使得添加新模型或新数据集只需关注各自模块,不需要改动其他代码,降低了社区贡献的门槛。
项目以命令行操作为主,有一定使用门槛:
pip install vlmeval),或在源码目录运行 pip install -e .,依赖较多(约 70+ 包),首次安装可能需要 10-20 分钟scripts/mmb_eval_gradio.py 提供交互式界面,降低了结果查看的门槛没有 Docker 容器化支持是该项目的一个局限,对于需要在服务器环境快速部署的用户来说,需要手动配置 Python 环境。不过项目文档较为完善,提供了详细的中文快速开始指南。
VLMEvalKit 的出现填补了开源 VLM 评测工具的空白。在此之前,研究者评测 VLM 通常需要自己编写评测代码,数据格式不统一、评测结果难以复现。VLMEvalKit 通过统一的推理接口和评测流程,推动了 VLM 评测的标准化。
该项目已发表在 ACM MM 2024 上,并在 OpenCompass 官方排行榜上持续更新评测结果,被上海人工智能实验室、清华大学、Meta 等机构的研究者广泛使用。其评测结果也被多个顶级会议论文引用,成为 VLM 评测的事实标准之一。
# 安装
pip install vlmeval
# 或从源码安装
git clone https://github.com/open-compass/VLMEvalKit
cd VLMEvalKit
pip install -e .
# 运行评测(以 InternVL2 为例)
python run.py --model InternVL2-8B --dataset MMB
# Gradio 可视化
python scripts/mmb_eval_gradio.py