EnterpriseRAG-Bench
企业RAG评估基准:50万+合成文档 + 10类500题,覆盖Slack/Gmail/Jira等9大
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
企业RAG评估基准:50万+合成文档 + 10类500题,覆盖Slack/Gmail/Jira等9大
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象这样一个场景: 你是一家 200 人 AI 创业公司的 CTO,团队花了大半年搭建了内部知识库 RAG 系统,产品发布会上信心满满地演示——结果员工一提问"Q3 季度的模型延迟优化进展如何",系统答非所问,场面一度尴尬。这不是你的工程师不给力,而是你的 RAG 系统根本没有在真实企业数据上测试过。
这就是 EnterpriseRAG-Bench 诞生的背景。
企业 RAG 系统面临的最大挑战是数据复杂度和噪声程度远超想象。不像公开的 Wikipedia 问答数据集,企业内部文档有以下特点:
Onyx(一家做企业搜索的 AI 公司)花了大量精力构建了这套基准测试,模拟了一家名为"Redwood Inference"的 AI 推理服务公司,内部数据涵盖 9 大数据源、50 万+文档、500 道精心设计的问题,全部通过 LLM 生成但经过人工审核确保质量。
整个数据集的来源分布经过精心设计,比例接近真实企业数据:
| 数据源 | 近似规模 | 特点 |
|---|---|---|
| Slack | 27.5 万条 | 口语化、实时性强、有表情符号 |
| Gmail | 12 万封 | 正式、信息密度高 |
| Linear | 3.5 万条 | 结构化、项目管理相关 |
| Google Drive | 2.5 万份 | 文档为主,格式多样 |
| Hubspot | 1.5 万条 | CRM、销售数据 |
| Fireflies | 1 万份 | 会议记录,口语转文字 |
| GitHub | 0.8 万条 | 代码讨论、技术性强 |
| Jira | 0.6 万条 | 支持工单,缩写多 |
| Confluence | 0.5 万份 | 文档、Wiki |
题目被分为 10 个难度递增的类别,每类考察不同能力:
这套题目体系的核心思想是:好的企业 RAG 不只是找到答案,还得知道什么时候没有答案、什么时候答案不完整。
代码结构清晰,采用经典的 Python 项目布局:
src/
├── llm/ # LLM 抽象层,支持 OpenAI / Anthropic 双后端
├── prompts/ # 30+ 个提示模板,覆盖各类问题生成场景
├── tools/ # Agent 工具集(类文件系统操作)
├── utils/ # 文档处理、UUID 索引、评估工具
└── scripts/ # 四阶段数据生成流水线
src/llm/factory.py 实现了工厂模式,通过 LLM_PROVIDER 环境变量切换 OpenAI 和 Anthropic 两个后端。src/llm/interface.py 定义了统一的生成器接口(generate 方法返回流式 chunk),src/llm/auto_conversation.py 实现了完整的 Agent 循环——包含上下文窗口溢出检测与自动截断(_MAX_CONTEXT_CHARS = 200_000)、工具调用协调、以及 Braintrust 链路追踪。
系统为数据生成 Agent 提供了一组类似文件系统的工具:
这些工具通过 src/tools/runner.py 的 ToolRunner 统一调度,每个工具有 30 秒超时限制,防止单个操作卡死整个 Agent。
src/scripts/ 目录组织了完整的数据生成流程:
最值得注意的是数据生成的可配置性:用户可以指定虚拟公司的行业、规模、数据源偏好,流水线会自动生成符合特定场景的数据集。
src/utils/eval_utils.py 实现了多层评估:
从 pyproject.toml 可以看出项目的工程标准:
disallow_untyped_defs = true),整个 src/ 目录强制类型注解requirements.txt + pyproject.toml 管理,依赖简洁(pydantic、openai、anthropic、qdrant-client、opensearch-py 等)使用门槛非常低——只要有 Python 3.10+ 环境和 LLM API Key,5 分钟就能跑起来:
pip install -r requirements.txt
export LLM_PROVIDER="openai"
export LLM_API_KEY="sk-..."
# 评估你的 RAG 系统,或生成新数据集
数据集可以从 GitHub Release 或 HuggingFace 下载,提供了全量压缩包和按数据源分片的版本,方便只关注特定场景。
值得指出的几点:
EnterpriseRAG-Bench 的发布填补了企业 RAG 评估的一个关键空白——此前业界缺乏覆盖多种数据类型、多难度梯度、有明确 ground truth 的基准测试。目前已有 HuggingFace 上的公开 Leaderboard,多个 RAG 系统在上面竞争排名。
从趋势看,企业 RAG 正在从「能搜到」进化到「搜得准」,这类细粒度的评估工具将成为推动技术进步的重要基础设施。