VeritasGraph
用知识图谱结构替代向量检索,让AI的多跳推理和答案溯源成为可能
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用知识图谱结构替代向量检索,让AI的多跳推理和答案溯源成为可能
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你的企业知识库里有上万份合同、财务报告和技术文档。当你向AI助手提问:"今年有哪些采购订单违反了我们的权责分离政策?"传统RAG会怎么做?
它会把问题向量化,在海量文本片段中寻找"语义相似"的内容——就像在一堆乱糟糟的便签里,凭感觉随手抓几张相关便签来回答问题。结果呢?要么遗漏了关键的关联信息(比如某供应商同时出现在采购和财务两个角色中),要么给出的答案缺乏可追溯的来源依据。这种"上下文失明"问题,正是当前RAG系统最致命的短板。
VeritasGraph 正是为解决这个问题而生。它不靠"感觉",而靠"结构"来回答复杂问题。
传统向量检索RAG的本质是相似性匹配:把文档切成小块(chunk),每个块转成向量,查询时找最相似的N个块。但这种方式有三个天然缺陷:
知识图谱(Knowledge Graph)用**节点(实体)+ 边(关系)**的结构来表示知识,天然支持多跳推理。但纯图谱的缺点是构建成本高、语义搜索能力弱。VeritasGraph 的核心创新是将两者融合:先用图谱结构捕捉实体关系,再结合语义检索,同时获得结构推理和语义理解的双重优势。
VeritasGraph 是一个开源的知识图谱+GraphRAG双引擎框架,全称 "Veritas" 源自拉丁语"真理"——项目的核心理念是让AI的回答100%可溯源、可验证。
项目由印度开发者 bibinprathap 创建和维护,GitHub 收获 295 Stars(本文分析时),已发布 PyPI 包 veritasgraph,支持 pip 一键安装。代码主要使用 Python 3.10+,采用 MIT 开源许可证,仓库已有 136 次提交。
VeritasGraph 的核心是一个精心设计的四阶段流水线:
文档输入
↓
[阶段1] 自动知识图谱构建
TextUnits → (head, relation, tail) 三元组
↓
[阶段2] 混合检索引擎
树形导航(TOC)+ 图遍历 双重检索
↓
[阶段3] LoRA微调推理核心
基于上下文的推理生成
↓
[阶段4] 归属与溯源层
每个答案精确指向源文档位置
这是 VeritasGraph 最独特的设计。它不是单纯建一个图谱,而是在图结构之上叠加了树形层级导航(类似 PDF 阅读器的目录结构),同时图中的边可以跨层级、跨分支建立关联。
这种设计带来了三个传统RAG做不到的能力:
VeritasGraph 提供了灵活的三级部署选项:
| 模式 | 需求 | 说明 |
|---|---|---|
--mode=lite | OpenAI/Anthropic API Key | 快速体验,无需GPU,适合Demo |
--mode=local | Ollama + 8GB RAM | 完全本地运行,保护数据隐私 |
--mode=full | Docker + Neo4j | 完整功能,支持生产环境 |
Lite 模式和 Local 模式都不需要GPU,这对个人开发者和中小企业非常友好。
安装只需一行命令:
pip install veritasgraph
三行代码即可完成知识图谱构建+查询:
from veritasgraph import VeritasGraph
vg = VeritasGraph(mode="local") # 或 "lite" / "full"
vg.ingest("path/to/your/documents/")
result = vg.query("Which POs violate SoD policy this quarter?")
整个过程对用户屏蔽了图谱构建的复杂性,API 设计简洁直观。
VeritasGraph 支持多种数据源的自动解析:
摄入模式也可灵活切换:document-centric(整页/整节为单位)、page(每页一个节点)、section(每节一个节点)、chunk(传统token分块)。
项目内置了一个基于 FastAPI + 单页前端 的 Studio 工作台,提供完整的图形化操作界面:
Live Demo: https://bibinprathap.github.io/VeritasGraph/studio/
Studio 的启动脚本支持 Linux 服务化部署,提供了 systemd service 文件,适合将服务长期运行在服务器上。
VeritasGraph 还有一个姐妹模块 VeritasReason,专门针对结构化数据的规则评估场景,比如:
它的处理流程是将非结构化政策文档(PDF合同、手册)和结构化业务数据(ERP、HRIS数据库)分别建图,然后通过规则引擎进行合规推理。
仓库核心目录结构:
| 目录 | 说明 |
|---|---|
studio_api/ | FastAPI 后端,提供 Studio 的 REST API |
veritas-reason/ | 独立的企业合规规则评估子模块(含独立Dockerfile和README) |
rules/ | SOD策略规则配置(YAML格式) |
scripts/ | Linux服务安装脚本、tunnel启动脚本 |
docs/ | 部署文档(Linux部署指南等) |
demos/ | 演示示例(agent-studio、foundry-studio、policy-compliance) |
tests/ | 测试用例 |
VeritasGraph 的主力技术栈:
核心 AI 组件包括:基于图遍历的多跳推理引擎、混合检索(树+图)系统、以及可选的 LoRA 微调推理模块。
尽管设计理念先进,VeritasGraph 当前仍存在一些局限:
Lite 模式依赖外部API:如果你选择不部署 Ollama,就必须把数据发送给 OpenAI/Anthropic,数据隐私无法完全保证。尽管项目强调"100%本地",但这仅在 --mode=local 或 --mode=full 时成立。
Neo4j 的运维复杂度:full 模式需要运维 Neo4j 图数据库,对于没有图数据库经验的团队来说,学习曲线不低。
知识图谱构建质量依赖LLM:从文本自动抽取三元组(head, relation, tail)的质量高度依赖所使用的语言模型能力,较弱的模型可能产生噪音实体和关系。
缺乏规模化测试:目前仅有约 295 Stars 和 1 个 issue,项目的生产环境稳定性尚未经过大规模社区验证。
VeritasGraph 代表了 RAG 技术演进的一个重要方向——从向量相似性搜索,走向结构化知识推理。
随着企业 AI 应用深入,用户对回答质量的要求从"大致正确"提升到"精确可溯"。传统 RAG 的天花板正在显现:单纯的 chunk + vector 组合已经无法满足复杂业务场景的需求。
GraphRAG 赛道正在快速升温:微软研究院提出了基于知识图谱的 GraphRAG,Neo4j 推出了自己的 GraphRAG 工具链,LangChain 和 LlamaIndex 也都在积极集成图谱能力。VeritasGraph 作为这一趋势下的开源选手,以 MIT 许可证、完全本地运行的核心卖点,为开发者提供了一个有价值的参考实现。
如果你在构建企业知识库、智能客服、合规审计类应用,VeritasGraph 值得重点关注。

图1:VeritasGraph 作者 bibinprathap 的 GitHub 头像
图2:VeritasGraph GitHub 仓库概览图