vidore-benchmark
视觉文档检索权威评测基准,支持复杂 RAG 流水线评测,覆盖金融/HR/医疗等多领域真实文档数据集
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
视觉文档检索权威评测基准,支持复杂 RAG 流水线评测,覆盖金融/HR/医疗等多领域真实文档数据集
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在企业日常运营中,员工每天要处理成百上千份文档——PDF合同、扫描件发票、PPT演示文稿、Excel报表。这些文档格式各异、大小不一,包含大量的表格、图表、图片和手写内容。当用户问"这份合同里关于违约金的那一条款是什么"时,传统的 RAG(检索增强生成)系统往往力不从心:它们依赖 OCR + 文本分块,在表格密集的财务文档或图片占比高的扫描件面前,正确率大幅下降。
ViDoRe(Vision Document Retrieval)Benchmark 正是为解决这一问题而生。它由法国 AI 公司 illuin tech 推出,是一个专门用于评测视觉文档检索能力的标准化基准。通过将文档的视觉特征(如布局、字体、颜色、表格结构)与语义理解深度融合,ViDoRe 让 RAG 系统真正能够"看懂"文档,而不仅仅是"读出"文字。
图1:ViDoRe Benchmark 支持的文档类型示例(来源:GitHub 仓库 assets/vidore_examples.webp)
ViDoRe 的起源可以追溯到 2024 年 6 月 illuin tech 发表的 ColPali 论文(arXiv:2407.01449)。ColPali 是一种将 Vision Language Model(VLM)引入文档检索的创新架构——它不依赖 OCR,而是直接让模型"看"文档图片,提取视觉语义向量进行检索。这种方法在包含大量表格、图表、印章的文档上效果远超传统方法。
随着 ColPali 的影响力扩大,团队意识到需要一个标准化的评测体系来衡量不同视觉检索方案的性能,于是逐步演进出 ViDoRe v1、v2(2025年),再到如今的 v3(2026年)。目前 ViDoRe v3 覆盖了人力资源、金融、工业、制药、计算机科学、能源、物理等多个领域的真实文档数据集,并支持多语言(英语、法语等)。
ViDoRe Benchmark 目前提供三个层次的评测能力:
1. MTEB 框架下的单一检索器评测
通过集成到 MTEB(Massive Text Embedding Benchmark)框架,开发者可以快速评测任何实现了 ModelWrapper 接口的视觉检索模型。目前已支持 ColPali、ColQwen2、ColPaliEngine 等主流模型。提交结果只需三步:创建模型实现文件 → 评测 → 提交 PR 到 MTEB 结果仓库。评测数据集涵盖 ViDoRe v1-v3 的公开划分(public split),私密划分则需要向 MTEB 团队申请。
2. 流水线评测(Pipeline Evaluation)——核心亮点
这是当前仓库的主线功能,也是 v3 版本的核心创新。流水线评测不局限于单一检索模型,而是支持评估任意复杂的端到端检索系统,包括:
BasePipeline 并实现 index() 和 search() 方法流水线评测框架从 BasePipeline 抽象基类出发,通过 dataset_loader 加载 HuggingFace 上的 ViDoRe v3 数据集,用 pytrec_eval 计算 NDCG@K、Recall@K、MAP 等标准检索指标。CLI 接口友好,vidore-benchmark pipeline evaluate 一条命令即可跑完整流程。
3. 丰富的示例流水线
仓库内置了多个可参考的流水线实现,包括基于 Qwen3 + ZeroRank2Textual 的文本重排方案、JinaV4 视觉重排方案、MXBAI-ColBERT 方案等,覆盖了从入门到生产级别的多种场景。
从代码结构来看,viDoRe Benchmark 的架构非常清晰:
vidore_benchmark/
├── cli/ # Typer CLI 接口层(pipeline 评测命令)
├── evaluation/ # 评测引擎(基于 pytrec_eval)
├── pipeline_evaluation/ # 流水线评测核心(BasePipeline、数据加载器、评估器)
├── retrievers/ # 各类视觉检索器实现(ColPali、BM25、BGE-M3、Cohere API 等)
├── ocr/ # OCR 支持(Tesseract 集成)
└── utils/ # 工具函数(日志、数据处理、图像处理、GPU 管理)
依赖生态:核心依赖包括 transformers(模型推理)、sentence-transformers(向量编码)、mteb(评测框架)、datasets(数据加载)、pydantic(配置验证)、typer(CLI)。可选依赖则覆盖了 BGE-M3、BM25、Cohere、ColPaliEngine、Jina-CLIP、SigLIP 等多种检索方案。
开发者体验:项目通过 pyproject.toml 标准化打包,pip install vidore-benchmark 即可完成安装,Python API 和 CLI 两套接口满足了从快速实验到自动化评测的各种需求。
ViDoRe Benchmark 是一个GPU 强依赖项目。视觉语言模型(如 ColPali)的推理需要大量显存,推荐配置为 16GB+ VRAM 的 NVIDIA GPU,内存 16GB+,硬盘 10GB+(用于存储数据集和模型权重)。CPU 环境虽然可以运行部分功能(如 BM25),但无法发挥视觉检索的核心能力。
部署难度为"中等"——pip install 本身没有门槛,但 GPU + CUDA + cuDNN 的环境配置对没有 ML 经验的开发者来说有一定挑战。项目没有提供 Docker 支持,不支持一键部署,适合有深度学习环境的研发团队使用。
ViDoRe 的出现填补了视觉文档检索评测的空白。在 RAG 系统从"纯文本检索"向"多模态 RAG"演进的过程中,一个关键问题是:如何衡量系统对视觉密集型文档的理解能力?传统的信息检索 benchmark(如 BEIR)以纯文本为主,无法覆盖表格、图表、图片占比高的真实办公文档。
ViDoRe v3 的发布(arXiv:2601.08620, 2026年1月)将评测范围扩展到了8个真实领域的数据集,并引入了流水线评测机制,使得评测不再局限于单一模型,而是覆盖完整的 RAG 检索链路。这对于构建生产级多模态 RAG 系统的团队具有重要参考价值。
| 角色 | 关注点 |
|---|---|
| 多模态 RAG 开发者 | 参考 ColPali/ColQwen2 在真实文档上的检索性能,决定技术选型 |
| 视觉语言模型研究者 | 使用 MTEB 框架提交 ViDoRe v3 评测结果,对比 SOTA |
| 企业 AI 团队 | 评估内部文档智能系统(合同处理、发票识别、知识库检索)的能力上限 |
| ML 工程师 | 学习 BasePipeline 设计模式,构建自己的多模态检索流水线 |
一句话总结:ViDoRe Benchmark 是视觉文档检索领域的权威评测标准,通过标准化数据集 + 灵活流水线评测框架,为多模态 RAG 系统提供了可量化的性能参照,是 ColPali 论文的工程化落地,也是当前该领域最具参考价值的开源评测工具之一。