XRAG
首个ICDE顶会级RAG组件基准测试框架,支持10种检索器横评
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个ICDE顶会级RAG组件基准测试框架,支持10种检索器横评
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,当你对着一个 RAG 问答系统抛出复杂问题时,它的回答质量取决于一系列「幕后组件」的表现:检索器能否找到最相关的文档块?分块策略是否破坏了语义完整性?重排序模型是否正确筛选了候选结果?生成模型是否忠实于检索内容?
现实情况是,大多数 RAG 系统将这些组件打包成黑盒方案,开发者只能在最终效果上反复调参,却无法定位真正的瓶颈所在。XRAG(eXamining the Core)正是为解决这一痛点而生——它由北京航空航天大学 DocAILab 开发,2026 年 2 月被数据库领域顶会 ICDE 2026 正式录用,是首个系统性地对 RAG 流程各阶段组件进行独立基准测试的开源框架。
图1:XRAG 项目 Logo
XRAG 将 RAG 流程拆解为四大阶段,每个阶段支持多种可替换组件,研究者可以单独替换某个模块而保持其他模块不变,从而精确定位性能瓶颈。
分块策略直接影响检索质量的上限。XRAG 支持以下分块器:
用户可通过 config.toml 中的 split_type 参数自由切换,chunk_size、overlap 等参数均可独立配置。
XRAG 支持 10 种检索器,覆盖了主流检索范式:
| 检索器类型 | 核心算法 | 适用场景 |
|---|---|---|
| BM25 | 经典词项频率算法 | 关键词精确匹配 |
| Vector | 向量语义检索 | 语义相似性查询 |
| Hybrid | BM25 + Vector 混合 | 兼顾精确与语义 |
| Tree | 树结构层次检索 | 多跳推理问答 |
| Keyword | 关键词搜索 | 简单 FAQ 类查询 |
| Summary | 摘要检索 | 长文档快速筛选 |
| QueryFusion | 多检索器融合 | 提升召回率 |
| AutoMerging | 自动合并相关块 | 减少碎片化 |
| Recursive | 递归多粒度分块 | 复杂文档结构 |
| SentenceWindow | 窗口上下文检索 | 需要上下文的问题 |
检索结果并非越相关越好——过多无关上下文会稀释 LLM 的注意力。XRAG 集成了多种后处理器,包括 long_context_reorder(长上下文重排序),将关键块优先置顶,减少 hallucination 风险。
生成阶段的策略同样可配置:
传统 RAG 是「查完即生成」的线性流程。XRAG 进一步引入了 Agentic RAG 编排层,通过多种工作流编排模式实现智能自适应检索。
图2:Agentic RAG 五大编排模式
XRAG 定义了五种编排模式:
此外,框架内置了多种 Agentic RAG 实现:
XRAG 提供三层评测维度,覆盖从传统统计指标到深度学习指标的全谱系:
继承信息检索经典评测体系,适合有标准答案的问答数据集评测。
基于大模型的评估,通过提示词让另一个 LLM 判断生成内容的:
XRAG 提供三种使用方式,满足不同场景需求:
安装后直接可用:
pip install examinationrag
xrag-cli run --override embeddings="BAAI/bge-large-en-v1.5"
通过 --override 参数动态覆盖 config.toml 中的任意配置项,无需修改文件即可切换实验参数。
Streamlit 构建的交互界面,包含完整的五步评测流程:数据集上传 → 索引构建 → 策略配置 → 交互测试 → 综合评测报告。
图3:WebUI 数据集配置界面
图4:WebUI 索引构建与参数配置
图5:RAG 策略配置与结果可视化
支持将 XRAG 作为后端服务部署,通过 HTTP 请求调用评测能力:
xrag-cli api --port 8000 --json_path data.json
通过 POST /query 接口传入 query 和 top_k 参数,返回答案和来源文档。
XRAG 的技术选型围绕 LlamaIndex 构建核心编排层:
LLM 后端支持 OpenAI(GPT-4o/DeepSeek-chat)、HuggingFace 本地模型、Ollama 本地模型四种模式,通过 config.toml 一键切换。
尽管 XRAG 设计精巧,仍有几处值得关注的局限:
jiwer<4.0.0),在非 conda 环境下安装可能出现冲突XRAG 的出现填补了 RAG 系统「组件级评测」的开源工具空白。在过去,评估 RAG 系统只有端到端的 QA 准确率,无法回答「换掉 BM25 用 Vector 能否提升」这类问题。XRAG 通过模块化设计让这类问题有了系统性的实验方法。
作为被 ICDE 2026 录用的学术成果,XRAG 代表了 RAG 研究从「调参炼丹」向「系统化实验」演进的趋势。随着 RAG 在企业知识库、医疗、法律、金融等知识密集型场景的广泛落地,这类评测工具的价值将持续凸显。
图6:XRAG 整体架构与组件关系图