AutoKG
首个系统性评估GPT-4/ChatGPT知识图谱构建与推理能力的研究框架,含多智能体AutoKG自动化构建方案
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个系统性评估GPT-4/ChatGPT知识图谱构建与推理能力的研究框架,含多智能体AutoKG自动化构建方案
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你问ChatGPT「蜘蛛侠纵横宇宙的剧情」,它能流畅回答——但它真的「理解」这部电影吗?它的回答是否准确?背后的知识结构是怎样的?这正是知识图谱(Knowledge Graph, KG)要解决的问题:用图结构将世界知识组织成「实体-关系-实体」的结构化形式,让AI的推理过程可解释、可追溯。
传统知识图谱构建依赖大量人工标注数据,耗时耗力。2023年,浙江大学团队提出了一个灵魂拷问:GPT-4、ChatGPT这些大型语言模型,是否已经具备「凭空」构建知识图谱的能力? 带着这个问题,AutoKG项目应运而生,并在2024年发表在国际期刊 World Wide Web(WWWJ) 上。
AutoKG是浙江大学知识图谱实验室(zjunlp)开源的综合性研究框架,GitHub星标 468颗。它不仅仅是一个工具,更是一套系统性评估LLM知识图谱能力的方法论。项目围绕三个核心研究方向展开:
基础能力评估(Basic Evaluation):用DuIE2.0、SciERC、RE-TACRED、MAVEN等权威数据集,评估GPT-4、ChatGPT、text-davinci-003在知识抽取(关系抽取、事件抽取)和知识推理(链接预测)任务上的表现,为后续研究提供基准参考。
虚拟知识抽取(Virtual Knowledge Extraction):团队构建了 VINE数据集,专门评估LLM对「隐含知识」的理解能力——即模型内部权重中存储的、但尚未被显式表达的知识,探索大模型作为「隐式知识库」的潜力边界。
AutoKG多智能体框架:核心创新——基于 CAMEL框架 和 LangChain 实现多智能体协作,模拟「知识图谱领域专家」与「顾问」两个角色的对话交互,自动完成知识图谱的构建与推理。SerpAPI提供网络搜索增强,让智能体能实时补充外部信息。
AutoKG采用典型的多智能体协作(Multi-Agent)架构,核心代码位于AutoKG/目录,文件结构清晰:
Autokg.py:主程序入口。定义两个智能体角色——Consultant(顾问)和Knowledge Graph Domain Expert(知识图谱专家)。主智能体负责任务分解和知识输出,专家智能体负责校验和补充。两者通过LangChain的ChatOpenAI接口调用GPT-4/ChatGPT,通过HumanMessage/AIMessage交替对话,最长进行30轮交互后自动终止。
LC_CAMEL.py:CAMEL智能体框架的LangChain实现。核心是CAMELAgent类,封装了消息历史管理(stored_messages)、模型调用(step方法)和角色指令注入逻辑。系统提示词(SystemMessage)通过模板注入角色身份,确保智能体不越界。
RE_CAMEL.py:检索增强模块。通过SerpAPI搜索相关网页内容,以Retrieval_Msg函数将外部知识注入对话上下文,弥补LLM知识时效性不足的问题。
运行示例中,任务被设定为「构建《蜘蛛侠:纵横宇宙》的知识图谱」,智能体通过多轮对话自主完成实体识别、关系抽取和图谱补全。
AutoKG提供了完整的数据处理管道,每个子任务都包含:
| 数据集 | 任务类型 | 来源 |
|---|---|---|
| DuIE2.0 | 关系抽取 | 百度 |
| SciERC | 科学文献实体关系抽取 | 华盛顿大学 |
| RE-TACRED | 远程监督关系抽取 | 斯坦福 |
| MAVEN | 事件抽取 | 清华大学 |
| FB15k-237 | 知识图谱链接预测 | 纽约大学 |
| ATOMIC2020 | 常识推理 | 艾伦AI研究院 |
| FreebaseQA / MetaQA | 知识图谱问答 | 密歇根大学 |
每个数据集配有processor.py(数据预处理)和prompts.py(0-shot/1-shot提示词生成),研究者可一键复现实验。
主力语言:Python,代码简洁直观,依赖明确,主要依赖:
langchain / langchain-chat-models:智能体框架与LLM调用openai:GPT系列模型接口colorama:终端彩色输出,提升可读性serpapi:网络搜索增强(可选)架构模式:多智能体协作(Multi-Agent Role-Playing)+ 检索增强(RAG),是当前Agent研究的主流范式之一。CAMEL框架的引入确保了智能体对话的稳定性和目标导向性。
代码质量评估:代码结构清晰,模块划分合理(KG Construction / KG Reasoning / AutoKG / Virtual Knowledge Extraction),配有完整的数据集说明文档。但作为研究代码,单元测试覆盖率较低,无Docker化部署,生产环境直接使用有一定门槛。
适用场景:
局限性:
AutoKG反映了LLM与知识图谱融合的三大趋势:评估基准化(用标准化数据集量化LLM的KG能力)、构建自动化(多智能体减少人工干预)、知识虚拟化(探索LLM内部权重作为隐式知识库)。随着GPT-4o、Claude 3等更强模型的出现,这类评估框架的价值将进一步凸显。同时,浙大PromptKG家族(AutoKG、xKG、Generative KG等)已成为该领域的标杆开源资源。
本报告基于GitHub仓库(2026年6月25日)和WWWJ 2024论文综合分析生成。