Awesome-Agentic-Reasoning
收录 300+ 篇论文的系统性 Agentic Reasoning 综述资源库,覆盖规划推理、工具调用、多智能体协作的完整技术图谱
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
收录 300+ 篇论文的系统性 Agentic Reasoning 综述资源库,覆盖规划推理、工具调用、多智能体协作的完整技术图谱
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,为什么 ChatGPT 能写诗、能编程,但在真实的办公室里却寸步难行?它能回答"北京的人口是多少",却不知道该如何打开公司的内部系统、自动填写报销单、或者帮你在纷繁的邮件中找到那封关键合同——因为它从来没有行动过。
这正是 Agentic Reasoning(智能体推理)要解决的问题。weitianxin/Awesome-Agentic-Reasoning 是一个围绕"Agentic Reasoning for Large Language Models"(大语言模型的智能体推理)综述论文构建的精选资源库,收录了超过 300 篇相关论文,覆盖从规划推理、多工具调用到多智能体协作的完整技术图谱。
2025 年之后,LLM 领域出现了一个明显的技术转向:研究者们不再满足于让模型"Thinking",而是要让模型"Acting"。这背后有三个关键驱动因素。
第一,测试时计算(Test-time Scaling)的瓶颈初现。 单纯靠增大模型参数和训练数据带来的提升正在边际递减,研究者开始探索在推理阶段通过更长思考链(Longer Chain-of-Thought)来提升效果,但这很快遇到了成本和效率的天花板。Agentic Reasoning 提供了另一条路——不是让模型想得更慢,而是让模型借助外部工具(搜索、代码执行、API 调用)来高效行动,以行动代替思考。
第二,Web Agent 和 Coding Agent 的商业化突破。 Devin、SWE-agent、Claude Computer Use 等产品的出现,证明了 LLM Agent 在真实工作场景中的可行性。GitHub Copilot 的编程辅助、Cursor 的 AI 代码生成,背后都有 Agent 框架的影子。这些应用场景反过来刺激了学术界对 Agentic Reasoning 基础理论的系统梳理需求。
第三,多智能体系统(Multi-Agent Systems)重新站上舞台。 传统多智能体系统过于依赖人工设计的规则和协议,而 LLM 赋能的 Agent 可以自主规划、相互协商、动态进化。这使得"一群 AI 协作解决问题"从概念走向了实验验证。
该资源库将 Agentic Reasoning 组织为三个层次,每个层次对应不同的环境动态和推理范式:

图1:多智能体系统的记忆与演进机制
第一层:基础智能体推理(Foundational Agentic Reasoning)
这是 Agent 能力的基石,包含三大核心模块:
第二层:自演进智能体推理(Self-Evolving Agentic Reasoning)
基础能力之上,Agent 需要通过与环境的持续交互来学习和适应:

图2:Agentic Reasoning 在科学研究、代码生成等领域的应用
第三层:集体多智能体推理(Collective Multi-Agent Reasoning)
单个 Agent 的能力有上限,多个 Agent 的协作可以突破这一瓶颈:
除了三层架构,该综述还从优化设置的角度,区分了两条不同的 Agent 能力提升路径:
上下文内推理(In-Context Reasoning):在测试时(test-time)通过精心设计的提示词、工作流编排和工具组合来提升 Agent 效果。优点是无需重新训练,缺点是对提示词质量高度敏感,泛化能力有限。
后训练推理(Post-Training Reasoning):通过监督微调(SFT)、强化学习(RLHF/DPO/GRPO)等手段,在训练阶段优化 Agent 的行为策略。代表工作包括 Agent Q(结合 MCTS 和在线 RL)等。
两条路径并非互斥,实际上当前最优的 Agent 系统往往同时采用两种策略。
该资源库详细梳理了 Agentic Reasoning 在多个领域的落地情况:
代码生成与编程辅助:SWE-agent、CodeNav、MARCO 等工作让 Agent 能够自主阅读代码库、理解需求、编写和调试代码。vibe coding(氛围编程)的兴起正是这一方向的产物——开发者用自然语言描述需求,Agent 负责生成代码并自动集成。
科学研究加速:Agent 能够自主设计实验方案、分析数据、撰写论文摘要,在化学、生物、物理等领域已有初步探索。
具身智能(Embodied Agents):将 Agent 部署到机器人或虚拟环境中,使其能够感知环境、执行物理操作。典型工作包括 Inner Monologue(结合语言模型与机器人控制)、Do As I Can(语言引导的机器人操作)等。
医疗健康:医疗 Agent 需要具备专业知识(来自医学文献)、隐私保护(不能泄露患者数据)、以及不确定性处理能力(医学诊断的本质是概率推理)。
Benchmark 生态:资源库收录了多个评估 Agent 能力的标准测试集,包括 Web Agent 的 Mind2Web、编程 Agent 的 SWE-bench、医学 Agent 的 MultiMed 等。
作为一份有"方法论支撑"的资源库,它不仅仅是一个 GitHub Awesome 列表,而是与一篇正式的 arXiv 综述论文(arXiv:2601.12538)绑定。资源库结构清晰:
尽管 Agentic Reasoning 发展迅速,该领域仍有大量未解决的核心问题:
推理效率与质量的权衡:更长的推理链通常意味着更好的结果,但也带来更高的延迟和成本。System-1.x 等工作尝试在"快速直觉"和"慢速深思"之间找到平衡,但目前尚无通用解决方案。
多 Agent 的协调开销:多个 Agent 之间的通信、冲突解决和集体决策机制还不够成熟。当 Agent 数量增加时,系统复杂度呈指数增长。
安全性与可靠性:Agent 在真实环境(特别是医疗、金融)中执行自主行动时,错误的后果可能是严重的。如何在开放域中保证 Agent 行为的可信度,是一个尚未完全解决的问题。
评估体系不完善:现有的 Benchmark 往往针对特定任务设计,缺少能够跨领域评估 Agent 综合能力的通用标准。
从这份资源库可以看出,Agentic Reasoning 正处于从"单点突破"到"系统整合"的阶段。过去一年的研究重心在于让单个 Agent 更好地使用工具、进行规划;而接下来的趋势,将是多 Agent 协作和长期自主学习——让 Agent 能够在真实任务中持续积累经验、自我改进,而不仅仅依赖预先训练的固定策略。
对于 AI 研究者,这份资源库是快速摸清 Agentic Reasoning 领域全貌的最佳起点;对于开发者,理解 Agentic Reasoning 的三层架构和两条优化路径,是在实际项目中选择技术方案的底层依据。
论文引用:
Wei et al., "Agentic Reasoning for Large Language Models", arXiv:2601.12538, 2026