GraphRAG-Benchmark
ICLR'26 接收的首个 GraphRAG 系统性评测基准,从图索引、检索质量、答案生成三维度量化
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
ICLR'26 接收的首个 GraphRAG 系统性评测基准,从图索引、检索质量、答案生成三维度量化
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你让 AI 阅读一本医学教科书,然后问它:「糖尿病患者的足部神经病变与血糖控制之间有什么关联?」传统 RAG 可能会给出一个听起来正确但缺乏深度的答案,而基于知识图谱的 GraphRAG 则能沿着「糖尿病→神经病变→血糖波动→治疗方案」这条关系链路给出更精准的推理。
但问题来了——GraphRAG 真的在所有场景都比传统 RAG 强吗?
GraphRAG-Bench 就是为回答这个问题而生的。它由厦门大学和吉林大学联合开发,是 ICLR 2026 接收的 GraphRAG 领域首个系统性基准评测框架,被 8 篇顶会论文引用或基于其构建延伸工作。
GraphRAG-Bench 的代码分为三大核心模块:
负责评估 GraphRAG 系统生成的最终答案质量。评估指标根据问题类型动态切换:
核心实现在 Evaluation/generation_eval.py,基于 LangChain 的异步并发架构,支持控制并发度(max_concurrent 参数)避免 API 限流。使用 RAGAS 库计算指标,通过 LangChain 的 ChatOpenAI/Ollama 接口灵活切换 LLM 评判器。
评估 GraphRAG 知识图谱检索到的上下文质量,关注两个核心指标:
同样支持 API 和本地 Ollama 两种模式,适配不同隐私需求的评测场景。
这是 GraphRAG 独有的评估维度——评测知识图谱本身的构建质量。通过 igraph 库分析图结构指标:
支持的框架包括 Microsoft GraphRAG、LightRAG、Fast-GraphRAG、HippoRAG2,覆盖了主流 GraphRAG 实现。
GraphRAG-Bench 提供两个数据集域:
| 域 | 主题 | 问题类型 | 数据规模 |
|---|---|---|---|
| Medical | 医学教科书(糖尿病/甲状腺/高血压等) | 事实+推理+摘要+创意 | 1000+ 问题 |
| Novel | 小说数据集 | 同上四类 | 1000+ 问题 |
问题类型从「直接查事实」到「多跳推理」再到「开放式创意」,难度逐级递增。
README 显示已验证支持的框架:
基于 GraphRAG-Bench 衍生的顶会论文还包括 MemGraphRAG(KDD'26)、ProbeRAG(ACL'26)、LegalGraphRAG(ACL'26)、LinearRAG(ICLR'26)等,覆盖记忆增强、忠诚度评测、法律推理、高效 GraphRAG 等方向。
依赖生态:
langchain==0.3.26 + langchain-openai/ollama:LLM 接口抽象层ragas==0.2.15:RAG 评测指标标准库datasets==3.3.2:统一数据格式(Parquet 存储)igraph==0.11.x:图结构分析numpy、pydantic:数值计算和数据验证代码结构特点:
async/await + asyncio.Semaphore 控制并发git clone https://github.com/GraphRAG-Bench/GraphRAG-Benchmark.git
cd GraphRAG-Benchmark
pip install -r requirements.txt
export LLM_API_KEY=sk-your-key-here
python -m Evaluation.generation_eval \
--mode API \
--model gpt-4o-mini \
--base_url https://api.openai.com/v1 \
--embedding_model BAAI/bge-large-en-v1.5 \
--data_file ./results/your_framework.json \
--output_file ./results/evaluation_results.json
python -m Evaluation.retrieval_eval \
--mode API \
--model gpt-4o-mini \
--embedding_model BAAI/bge-large-en-v1.5 \
--data_file ./results/your_framework.json \
--output_file ./results/evaluation_results.json
python -m Evaluation.indexing_eval \
--framework lightrag \
--base_path ./Examples/lightrag_workspace \
--folder_name graph_store \
--output ./results/indexing_metrics.txt
硬件需求:评测 1000 题约需 8GB+ GPU(如用 GPT-4o-mini API 则无 GPU 要求),存储 5GB+。
operate.py 和 lightrag.py 返回 context),适配新框架有一定工作量GraphRAG-Bench 的出现填补了 GraphRAG 领域缺乏系统性评测基准的空白。在它之前,GraphRAG 的效果对比大多是小规模、场景单一的定性分析;GraphRAG-Bench 提供了统一量化标准,让研究者能够科学地回答「什么场景适合用 GraphRAG」这个核心问题。
从论文引用可以看出,顶会已经开始将 GraphRAG-Bench 作为标准基线——这意味着未来 GraphRAG 相关研究都需要在此框架下汇报结果,GraphRAG-Bench 有望成为该领域的「ImageNet 时刻」。
项目信息