Video-MME
全球首个覆盖短视频到长视频的多模态大模型视频理解评测基准,CVPR 2025 录用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
全球首个覆盖短视频到长视频的多模态大模型视频理解评测基准,CVPR 2025 录用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你给 AI 扔了一段 45 分钟的电影片段,问它「女主角在第三幕换了什么颜色的外套?」,AI 能否准确回答?这背后涉及时序推理、跨模态理解、长期记忆等复杂能力,正是 Video-MME 想要系统化评测的核心。
Video-MME(Multi-Modal Evaluation benchmark for Video)是全球首个全面覆盖短视频到超长视频的多模态大模型(MLLM)视频分析评测基准,入选了 CVPR 2025,已被 Gemini 3 Pro、GPT-5、GPT-4.1、Gemini 2.5 Pro 等顶级模型列为行业评测标准。
2024 年前后,多模态大模型迅速崛起,但大多数评测基准仍停留在静态图像理解层面。视频理解需要模型同时处理时间序列、帧间关系、音频+字幕+画面三模态融合,难度远高于图像评测。
Video-MME 由南京大学、厦门大学、香港大学、北京大学、香港中文大学、华东师范大学、中科院等多家机构联合推出,填补了这一空白。项目负责人 Fu Chaoyou 同时维护了 MME(NeurIPS 2024)和 MME-Survey 等系列评测工作,在多模态评测领域具有较高的学术影响力。
Video-MME 的核心数据集具有四个鲜明特色:
时长维度全覆盖:数据集涵盖**极短(<2分钟)、中等(4-15分钟)、长时(30-60分钟)**三类视频,时长从 11 秒到整整 1 小时不等。这一设计直接挑战了模型的长上下文处理能力——实验数据显示,GPT-4o 在长视频上的准确率显著下降,而 Gemini 1.5 Pro 则展现出更强的长程依赖建模能力。
视频类型多元化:涵盖 6 大视觉领域(知识科普、影视、体育竞技、生活记录、多语言等),细分为 30 个子类别,既包括烹饪教学、纪录片等知识密集型内容,也有体育赛事、电影片段等娱乐型视频。丰富的类别设计确保评测结果具有广泛的场景泛化参考价值。
多模态输入融合:除视频帧外,数据集同时提供字幕(SRT格式)和音频轨道,用于评估模型的多模态融合理解能力。实验表明,字幕和音频信息能显著提升视频理解准确率,尤其在复杂对话场景中。
人工标注质量保障:全部 2700 个问答对均由人工标注,不来源于任何现有视频数据集,从根本上保证了题目新颖性和答案可靠性。标注由专业标注团队完成,经过多轮质量审核。
Video-MME 提供完整的评测 pipeline,分四个步骤:
第一步:帧与字幕提取。用户需从 900 个视频文件中按统一策略采样帧(推荐 10-384 帧,取决于模型 context window),并提取对应时间戳的字幕。使用官方推荐的 video-slicer 工具可自动化完成。
第二步:Prompt 构建。评测采用统一的 MCQ(多项选择题)格式 Prompt,区分「有字幕」和「无字幕」两种设置,Prompt 结构固定以保证公平性。
第三步:模型推理。被测模型返回 A/B/C/D 选项答案。评测支持 VLMEvalKit 和 LMMs-Eval 两个主流评测框架,可对接 OpenCompass 平台进行批量评测。
第四步:评分计算。通过 eval_your_results.py 脚本解析模型答案,输出按视频时长、视频领域、子类别、任务类型等多个维度的准确率。评测过程不引入任何第三方模型(如 GPT 作为裁判),确保结果纯净。
基于 Video-MME 的评测结果,研究社区得出了几个重要结论:
商业模型明显领先:Gemini 1.5 Pro 以约 75% 的平均准确率位居商业模型榜首,GPT-4o 约为 71.9%。但两者在长视频上的差距拉大——Gemini 的 context window 优势在 30 分钟以上视频中体现尤为明显。
开源模型追赶中:国产开源模型如 Qwen-VL、InternVL 等在评测中持续迭代,部分任务类型上已接近 GPT-4o 水平,但综合能力仍有差距。
字幕与音频的显著增益:在加入字幕模态后,多数模型的准确率提升 3-8 个百分点,证明多模态融合是视频理解的关键突破口。
任务类型差异:时空推理类问题(如「物体在第几分消失」)对所有模型均构成挑战,而事实性问答(如「视频中出现的水果是什么」)相对容易。
Video-MME 主要面向以下用户群体:AI 研究者评测自己开发的多模态模型在视频理解上的能力边界;模型厂商在 leaderboard 上提交结果与业界最佳水平对标;高校课程作为多模态 AI 课程的实验基准。
上手需要具备:Python 编程能力、HuggingFace 数据集下载配置、以及被测模型的 API 访问权限。无 GPU 硬件要求——评测本身只涉及数据下载和结果解析,模型推理通过 API 调用完成。
Video-MME 同样存在固有局限:仅支持选择题格式,无法评测开放式问答能力;2700 个 QA 对在 30 个子类别上平均每类仅约 90 道题,统计显著性有限;视频数据集的版权限制使其无法完全开源,仅提供标注和评测代码。
此外,该项目非应用程序,没有 Web UI 和 Docker 支持,研究者需要自行配置 Python 环境、下载数据集(HuggingFace 约数十 GB),门槛对非 AI 研究者不太友好。
Video-MME 的发布标志着视频理解评测从「能用就行」走向「系统化、标准化」。其入选 CVPR 2025 并被多家顶级模型列为评测基准,说明学术界和产业界对其方法论的认可。随着 Gemini 3 Pro 和 GPT-5 相继将其作为官方评测集,Video-MME 正在成为视频多模态领域的里程碑——它定义了什么才算「真正理解视频」。
数据集托管于 HuggingFace:lmms-lab/Video-MME,评测代码和 prompt 模板在 GitHub 仓库中完全开源。