beir
信息检索模型的标准化评测基准,覆盖18+异构数据集,支持DPR/SBERT/ColBERT横向对比
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
信息检索模型的标准化评测基准,覆盖18+异构数据集,支持DPR/SBERT/ColBERT横向对比
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:某位同学数学成绩优异,在班级里名列前茅,但一参加全省统一模考就「水土不服」。问题出在哪里?缺乏统一标准的衡量尺度——班级题目太简单,全省联考才是真正的试金石。
BEIR(Benchmarking Evidence-IR)正是信息检索(IR)领域的这样一份「全省统一模考卷」。它由德国 TU Darmstadt 大学 NLP 小组于 2021 年初发表(曾在 NeurIPS 2021 Spotlight),旨在解决 NLP 检索模型缺乏统一评测基准的困境——让研究者和工程师可以在同一个尺子下,客观比较 Dense Passage Retrieval(DPR)、Sentence-BERT(SBERT)、ColBERT 等不同架构模型的真实表现。

图1:BEIR 官方 Logo
2021 年之前,检索模型领域面临一个尴尬局面:每篇论文自带评测数据集,自己出题自己考,缺乏横向对比。有人宣称自己的模型在某数据集上 SOTA,另一人换了个数据集又反超,缺乏公信力。
BEIR 的核心贡献是构建了一个异构基准(Heterogeneous Benchmark):整合了 18+ 个来自不同领域、不同任务类型的信息检索数据集,覆盖医学领域的 BioASQ、法律检索的 Legal-IR、问答系统的 NQ(Natural Questions)、多语言检索的 Mr.TyDi 等。这种异构性使得模型必须具备真正的泛化能力,而非在单一数据集上过拟合。
论文发表后迅速获得了学术界认可,成为 NeurIPS 2021 的 Spotlight 论文,目前在 GitHub 上已积累超过 2200 颗星、246 个 Fork,被 DeepMind、Google、Microsoft 等机构的检索研究引用。

图2:BEIR 与 HuggingFace 深度合作,提供开箱即用的模型和数据集
BEIR 收录的 18+ 数据集横跨多个领域:
这种广覆盖意味着:即使某个模型在某个数据集上表现优异,也必须接受其他领域的检验,才能证明其真正具备通用检索能力。
BEIR 提供标准化的 EvaluateDataset 类,支持一键评测:
from beir import EvaluateDataset
from beir.retrieval import BM25, DenseRetrieval
# 加载数据集 + 评测模型
evaluator = EvaluateDataset(dataset='beir/nq', model='sentence-transformers/msmarco')
results = evaluator.evaluate(BenchmarkModel)
支持的基线模型涵盖 BM25(传统稀疏检索)、DenseRetrieval(DPR、SBERT、ColBERT 等神经网络检索)、以及基于生成模型的Query Generator(用于数据增强)。
BEIR 的 beir/generation 模块提供了 QueryGenerator,可基于大语言模型(如 BART)生成伪查询,用于扩充训练数据或做数据增强。这为 RAG(检索增强生成)场景提供了端到端的评测能力。
此外,项目还支持 Elasticsearch 集成(beir/pyserini),方便将传统 BM25 与神经检索模型放在同一框架下对比。
BEIR 的代码结构清晰,主模块包括:
| 模块 | 说明 |
|---|---|
beir/retrieval/ | 核心检索评估,支持 BM25、Dense、Sentence-BERT、ColBERT |
beir/generation/ | 查询生成,QueryGenerator + PassageExpansion |
beir/reranking/ | 重排序模块 |
beir/losses/ | 自定义损失函数 |
beir/datasets/ | 数据集下载与管理 |

图3:BEIR 由德国 TU Darmstadt 大学 UKP 研究所发起,联合滑铁卢大学开发
BEIR 是一个纯 Python 库,无 Web UI,面向具备 Python 编程能力的研究者和开发者。安装极其简单:
pip install beir
核心依赖为 Python >= 3.9,配合 sentence-transformers、pytorch 等主流 ML 库。评测一个模型在全部数据集上的表现,约需数小时(取决于硬件)。
BEIR 并非完美。其局限性值得使用者了解:
BEIR 的最大贡献是推动了检索模型研究的可复现性和可比较性。在它出现之前,不同论文各自为战,结果难以横向比较;在它出现之后,所有新模型都必须「上榜」,形成了健康的学术竞争生态。
随着 RAG(检索增强生成)在 LLM 应用中的广泛落地,BEIR 的价值进一步凸显:选择哪个检索模型作为 RAG 的 Context Provider,直接决定了生成质量上限。BEIR 提供的横向对比数据,成为 RAG 系统选型的重要参考。
该项目目前由 Nandan Thakur(nandant@gmail.com)维护,发布于 2021 年 1 月,最近活跃更新于 2025 年 10 月,版本已迭代至 2.2.0,社区活跃度持续稳定。