all-agentic-architectures
35个生产级AI Agent架构的统一实现库,基于LangGraph,支持跨LLM提供商的对比评测与
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
35个生产级AI Agent架构的统一实现库,基于LangGraph,支持跨LLM提供商的对比评测与
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你正在构建一个复杂的 AI 助手——它要能联网搜索、会用代码计算、能在对话中回忆之前的上下文、遇到错误能自我反思、甚至能和另一个 AI 一起"辩论"出更好的答案。这每一个能力,背后都需要一套精心设计的「思维框架」,而这些框架,正是 AI 圈子里所说的 Agent 架构。
一个 AI 模型本身是"大脑",而 Agent 架构就是给大脑装上的"操作系统"——它决定了大脑如何感知输入、如何调用工具、如何记忆信息、如何做多步推理。不同的任务需要不同的操作系统,这就催生了今天要介绍的主角:FareedKhan-dev/all-agentic-architectures。
这个仓库由独立开发者 Fareed Khan 创建并维护,是目前 GitHub 上最完整的生产级 Agent 架构合集之一。截至目前,它收录了 35 个经过实际代码实现的 Agent 架构,涵盖从经典的 ReAct、Reflection,到前沿的LATS(Language Agent Tree Search)、MemGPT、GraphRAG 等,每一种架构都配有独立运行的 Jupyter Notebook,读者可以直接在浏览器中阅读完整执行过程和真实 LLM 输出。
图1:项目作者 Fareed Khan 的 GitHub 头像
项目采用 MIT 许可证,代码完全开源,已获得超过 3400 颗星 和 600 次 fork,属于同类资源中增长最快的之一。仓库目前处于活跃维护状态(最后更新 2026 年 6 月),作者持续添加新架构并优化现有实现。
为什么 Agent 架构突然变得这么重要?答案在于 2023-2024 年大语言模型能力的大幅跃升。当 GPT-4、Claude 3 这些顶级模型具备了强大的推理能力之后,研究者和工程师们开始思考:如何让模型不仅"回答问题",更能像人类一样"完成任务"——调用外部工具、查阅文档、操作浏览器、与数据库交互、甚至调用其他模型协作。
这个需求催生了 Agent(智能体)概念的大爆发。不同团队提出了各自的框架:OpenAI 推崇的 Tool Use + Function Calling、斯坦福的 ReAct、香港科技大学的 Tree of Thoughts、Meta 的 Reflexion……一时间百花齐放,但也给学习者带来了巨大的选择困难。
Fareed Khan 正是看到了这个痛点,决定打造一个"一站式"的 Agent 架构百科——不是简单的论文列表,而是每一个架构都有可运行的代码 + 真实输出,并且用统一的风格(LangGraph)实现,方便横向对比。
从技术实现角度看,这个项目的选型非常务实:
LangGraph 是核心引擎。LangGraph 是 LangChain 团队打造的图结构 Agent 框架,用节点(Node)+ 边(Edge)的概念来描述 Agent 的状态流转。相比纯 Prompt 方式,LangGraph 提供了显式的控制流——你可以精确指定:模型输出什么时走哪条分支、遇到错误时如何回退、多轮对话的状态如何维护。这对教学和生产都很有价值。
多 LLM 提供商支持 是另一个亮点。项目没有绑定某一家的 API,而是通过src/agentic_architectures/llm/providers.py 和 factory.py 实现了统一的抽象层,目前支持 Nebius(默认)、OpenAI、Anthropic、Groq、Ollama(本地)、Together、Fireworks、Mistral、Google GenAI、HuggingFace 等十余家提供商。切换方式仅需改一行环境变量,极大降低了实验门槛——你可以在云端用 GPT-4o 测试,换成本地 Ollama 跑轻量场景。
丰富的工具生态。在 tools/ 目录下,项目实现了四类核心工具:- code_exec:安全的代码执行环境(沙箱化)- filesystem:文件读写操作- search:网页/文档搜索(支持 Tavily)- simulator:模拟器(用于测试场景)这些工具通过 LangChain 的统一 Tool 接口注册,35 个架构可以自由组合调用。
记忆系统 覆盖了 Agent 的四大记忆类型:episodic(情景记忆,记住做过的事)、semantic(语义记忆,存储知识)、graph(知识图谱记忆)、vector(向量检索记忆)。其中 graph 记忆默认支持 Neo4j 图数据库,配合 docker-compose.yml 可一键拉起服务。
35 个架构覆盖了 Agent 设计的几乎所有主流范式,按功能可以分成以下几类:
推理增强型:reflection(自我反思)、reflexion(带验证的自我纠错)、react(推理+行动交替)、chain_of_verification(验证链)、self_consistency(自洽性投票)、self_discover(自我发现推理策略)——这些架构专注于让模型在给出答案前进行更多的"思考",通过多轮推理或投票来提升准确率。
规划与控制型:planning(显式规划)、tree_of_thoughts(思维树,搜索多条推理路径)、lats(语言 Agent 树搜索,结合规划与蒙特卡洛树搜索思想)、storm(结构化知识生成)、meta_controller(元控制器,动态选择子架构)——这类架构的核心是"做计划",让 Agent 在行动前先想清楚步骤和目标。
记忆增强型:memgpt(类似微软 MemGPT 的层次记忆)、episodic_semantic(情景+语义双记忆)、graph_memory(图结构记忆)、agent_workflow_memory(工作流历史记忆)——解决的是长对话或长任务中的信息遗忘问题。
RAG 增强型:agentic_rag(Agent 驱动的 RAG,主动决定何时检索)、graph_rag(图增强 RAG)、corrective_rag(纠错型 RAG,检索后验证再回答)、adaptive_rag(自适应 RAG)——这些是当前 RAG 领域的前沿方向,从被动查资料进化到智能查、验证用。
多 Agent 协作型:multi_agent(多 Agent 协作)、debate(Agent 间辩论)、ensemble(多 Agent 投票集成)、blackboard(黑板模式,多专家协作)——当单个 Agent 能力有限时,多个 Agent 分工协作、取长补短是常见解法。
工具使用型:tool_use(基础工具调用)、voyager(Minecraft 中的终身学习 Agent)、browser_agent(浏览器自动化)、computer_use(计算机操作)、swe_agent(软件工程专用 Agent)——这些架构让 Agent 从聊天走向真实世界的操作。
价值观与安全型:constitutional_ai(AI 宪法,约束 AI 行为)、rlhf(人类反馈强化学习)——解决的是 Agent 的"如何做对的事"。
其他特殊型:pev(预测-执行-验证循环)、mental_loop(心理循环)、dry_run(干跑测试)、reflexive_metacognitive(反思性元认知)、cellular_automata(元胞自动机)——这些是前沿实验性架构。
项目内置了一套 17 任务基准测试(定义在 benchmarks/tasks.yaml),并且提供了 benchmarks/run_benchmark.py 可以对所有架构打分。评分机制包括:- Judge LLM 评分:用更强的 LLM(如 GPT-4o)来评判各架构输出的质量- Rubrics(评分标准):每类任务有明确的评分规则- 横向对比 Leaderboard:方便你看出哪个架构在哪些任务上表现最好
这套测试框架基于 pytest + nbval(Notebook 测试),集成测试通过 RUN_INTEGRATION=1 环境变量开关,确保不误伤正式测试。
对于想认真比较不同 Agent 范式的开发者来说,这种标准化、可复现的评估体系非常珍贵,省去了自己搭建 benchmark 的繁琐工作。
方式一:pip 安装为库
pip install agentic-architectures
# 或安装特定提供商支持:
pip install 'agentic-architectures[openai,anthropic]'
然后在代码中 import 想要的架构,直接调用,非常适合集成到自己的项目中。
方式二:Docker 一键启动
cp .env.example .env # 填入 API Key
docker compose -f docker/docker-compose.yml up
这个 compose 文件会同时拉起四个服务:- app:主 Python 容器(挂载本地代码,热重载)- neo4j:图数据库(GraphRAG 等架构的后端)- qdrant:向量数据库(可选,向量检索增强)- ollama:本地 LLM 服务(可选,完全离线运行)
整个环境启动后,可以通过 Jupyter Notebook 访问 http://localhost:8888,运行任意一个架构的 Notebook 进行实验。硬件需求方面,CPU 模式完全可跑,不需要 GPU,需要约 1GB 磁盘空间和 4GB 内存。如果要用 Ollama 本地跑模型,才需要 GPU 支持。
这个项目也有它需要注意的局限性:
API 依赖是双刃剑。虽然支持多提供商,但本质上仍是调用远程 API。这意味着:网络不稳定时体验大打折扣,每次调用都有费用,长上下文任务成本会快速攀升。本地 Ollama 方案虽然存在,但需要自行下载模型,配置有一定门槛。
Notebook-first 的工程化门槛。对于习惯用 Python 脚本或 API 的开发者来说,每个架构都是 Jupyter Notebook 格式,上手时需要额外了解 Notebook 的执行逻辑,直接集成到自己项目里的工程化改造工作量不小。
生产环境的谨慎评估。虽然代码标记了"生产级",但实际用于关键业务系统前,强烈建议在测试环境充分验证——特别是在 computer_use(操作计算机)和swe_agent(软件工程自动化)这类高风险操作场景下,误操作可能造成实际损失。
从更宏观的视角看,这个项目的出现代表了 AI 开发领域的一个趋势:从"调 API"到"建系统"的转变。当单纯调用大模型已经无法满足复杂任务需求时,Agent 架构就成了下一代 AI 应用的核心基础设施。
类似的趋势在 GitHub 上有迹可循:LangGraph 本身的高速增长、各类 RAG 框架的爆发、OpenAI 的 Agents SDK、Anthropic 的 Agent 最佳实践……Fareed Khan 的项目独特之处在于:它不是又一个 Hello World 级别的 Demo,而是真的在教大家如何对比和选择——35 个架构放到同一基准下测试,让"哪个架构适合哪个任务"这个问题第一次有了数据支撑。
如果你正在构建 AI 应用、想了解 Agent 设计的前沿方案、或者需要一个标准化的测试环境来验证你的想法,这个项目值得花一整个下午认真过一遍。