Q-Bench
首个系统性评估多模态大模型低层视觉质量感知能力的研究基准,涵盖感知、描述、评估三大任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个系统性评估多模态大模型低层视觉质量感知能力的研究基准,涵盖感知、描述、评估三大任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你是一名手机摄像头质检员,每天要快速判断成百上千张照片的清晰度、色彩准确度、构图是否合理。这份工作对人类来说需要专业训练,对人工智能呢?Q-Bench 就是这样一个专门考核"AI 视觉质检能力"的测试基准——它不是问 AI"这张图里有什么",而是问"这张图质量怎么样"、"图片哪里有瑕疵"。2024 年,Q-Bench 论文被计算机视觉顶级会议 ICLR 评为 Spotlight 论文,随后扩展为 IEEE TPAMI 期刊论文,成为多模态大模型(MLLM)低层视觉能力评估的标杆工作。
传统视觉基准(如 ImageNet、VQA)考的是"认知识别"能力——图片里是猫还是狗?但现实应用中有大量需求是低层视觉判断:照片清晰吗?色彩偏了吗?曝光过度了吗?人像有没有被裁切?这些能力对于手机摄影优化、图像编辑工具、医学影像分析等场景至关重要。
2023 年,随着 GPT-4V、Gemini-Pro、Qwen-VL 等多模态大模型横空出世,研究者们自然产生了一个问题:这些"通用人工智能"在基础的视觉质量感知上,到底比人类强还是弱?然而,当时并没有一个系统性的评估工具。Q-Bench 正是填补这一空白——它由南洋理工大学(NTU)和上海交通大学(SJTU)联合商汤科技共同研发,是首个针对多模态 LLM 低层视觉能力的大规模基准测试。
Q-Bench 包含三个递进层次的能力评估,形成对多模态大模型视觉感知能力的完整画像:
A1 - LLVisionQA(感知能力)
这是最基础的能力测试:给定一张图片,让模型回答与图像质量、构图、缺陷相关的选择题。例如:"这张照片中人物被裁切掉了哪部分?A. 头部 B. 腿部 C. 手部"。测试集涵盖了多种场景(风景、人像、建筑等)和多种质量退化类型(模糊、噪声、色彩偏移等)。模型需要在 1,500 张真实图片和 3,200 张合成图片上完成选择题,这要求模型不仅要"看见"图片,还要感知其中的微妙质量问题。
A2 - LLDescribe(描述能力)
比感知更高一层的是描述能力。模型需要对图片质量进行自然语言描述,例如"照片右侧有些过曝,导致云层细节丢失"。这一任务更能反映模型对视觉质量问题的深层理解——不仅知道有问题,还能准确表达问题所在。这对于构建可解释的 AI 质量评估系统至关重要。
A3 - AGIQA(评估能力)
最高层次是给出质量评分。模型需要像专业评估师一样,对图像质量打出客观分数。Q-Bench 收集了 7 个主流 IQA 数据集(KADID、KonIQ-10k、SPAQ、LIVE-C 等)的专业标注,涵盖约 30 万张有质量评分的图片,供模型学习和评估。
数据集已发布在 HuggingFace:LLVisionQA(nanyangtu/LLVisionQA-QBench)和 LLDescribe(nanyangtu/LLDescribe-QBench)。

图1:Q-Bench 基准测试框架概览
Q-Bench 最引人注目的发现是多模态大模型的视觉质量感知能力目前与人类存在显著差距。GPT-4V 在感知任务上的准确率仅与人类相当,但在描述和评估任务上明显落后。更关键的是,不同模型之间差距悬殊:GPT-4V 和 Gemini-Pro 明显领先,而开源模型如 LLaVA、InstructBLIP 在低层视觉任务上表现较弱。这意味着虽然大语言模型在高层视觉认知(如图像描述、目标检测)上取得了突破,但在精细化的质量感知这一"基础功"上仍需努力。

图2:GPT-4V 与人类在低层视觉任务上的对比
排行榜托管在 HuggingFace Space(q-future/Q-Bench-Leaderboard),采用 Gradio 构建,支持在线体验和模型对比。
这是一个以 Jupyter Notebook 为核心的研究代码库,没有传统的 Web 服务或 API 接口,定位是"科研复现与基准评测工具"。代码结构如下:
Q-Bench/
├── example_code_for_idefics/ # Idefics 模型评测示例
│ ├── a1_perception_demo.py # A1 感知任务
│ ├── a2_description_demo.py # A2 描述任务
│ └── a3_assessment_all.py # A3 评估任务
├── a3_iqa_databases/ # A3 评估任务数据集 JSON
├── data_release/ # 数据发布说明
├── leaderboards/ # 排行榜(跳转 HF Space)
└── README.md
使用示例(Idefics 模型评测 A1 感知任务):
from transformers import IdeficsForVisionText2Text, AutoProcessor
import torch
device = "cuda" if torch.cuda.is_available() else "cpu"
model = IdeficsForVisionText2Text.from_pretrained("HuggingFaceM4/idefics-9b-instruct", torch_dtype=torch.bfloat16).to(device)
processor = AutoProcessor.from_pretrained("HuggingFaceM4/idefics-9b-instruct")
# ... 输入图片 + 质量感知问题,输出选择题答案
项目主力语言是 Jupyter Notebook(占比最高),评测代码基于 PyTorch + Transformers。支持的模型包括 GPT-4V(API 调用)、Gemini-Pro(API 调用)、Qwen-VL(开源权重)、Idefics(HuggingFace 权重)等。数据处理涉及 PIL 图像库、JSON 数据集管理和 HuggingFace Datasets 接口。整体技术栈以 Python 深度学习生态为主。
Q-Bench 本身是高质量研究,但也存在一些局限。首先,排行榜上的模型评测结果可能存在 prompt 敏感性——不同团队使用不同的 prompt 可能导致同一模型得分差异较大。其次,A3 评估任务的 ground truth 来自人类主观评分(MOS),不同数据集的标注标准不完全一致,模型性能对比需谨慎解读。此外,该仓库仅提供评测代码,不包含训练数据生成流程,对于想复现完整 pipeline 的研究者来说需要额外工作。
Q-Bench 的最大贡献是建立了多模态大模型"视觉基础功"的评估标准。在此基础上,团队又推出了 Q-Bench+(IEEE TPAMI),将评估范围从单张图片扩展到图片对比("哪张图质量更好?"),进一步逼近真实应用场景。结合团队后续发布的 Q-Instruct(大规模低层视觉指令微调数据集),形成了一套完整的"评测-训练"闭环。