ai-agent-papers
AI Agent 领域必关注的论文导航站,每周更新 Arxiv 精品,只收录有新思路的 Agent 框架、能力与应用研究
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI Agent 领域必关注的论文导航站,每周更新 Arxiv 精品,只收录有新思路的 Agent 框架、能力与应用研究
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你是 AI 领域的研究者或工程师,每天 Arxiv 上新论文如潮水般涌来,光是找到"真正有价值的那几篇"就要花掉大半天。而这个项目,用一句话说就是——帮你省掉这大半天。
ai-agent-papers 由独立研究者 masamasa59 维护,每周定期在 Arxiv 上检索 AI Agent 相关论文,只收录"有新思路或新概念"的精品,拒绝水文。经过近两年积累,项目已收录数百篇论文,涵盖从基础框架到前沿应用的完整生态。
截至目前,该项目已获得 1482+ GitHub Stars,在同类 AI Agent 论文合集中属于增长较快的项目,被多个学术社区推荐为 AI Agent 领域必关注的资源之一。
该项目将 AI Agent 学术论文组织为六大维度,结构清晰、覆盖面广:
能力维度(Capability Papers) 聚焦 Agent 本身具备的各项核心能力,包括:环境感知(Environment)、创意生成(Ideation)、任务规划(Planning)、推理(Reasoning)、工具使用(Tool Use & Skills)、记忆(Memory)、自我修正(Self-Correction)、安全(Safety)、自我进化(Self-Evolution)等。这些能力维度构成了评估和比较不同 Agent 系统的基础框架。
架构维度(Agent Frameworks) 收录单 Agent 架构、多 Agent 协作系统、以及 Agent-Ops 与用户体验相关的研究。
应用维度(Application Papers) 是最丰富的板块,涵盖具身 Agent(Embodied Agents)、数字 Agent(包括 GUI Agent、Web Agent、Mobile Agent)、软件 Agent、数据 Agent、研究 Agent、API Agent、深度研究 Agent、企业 Agent、金融 Agent 等细分方向。
新闻通讯(Newsletters) 按月整理当月论文亮点,已覆盖 2025 年 10 月至 2026 年 5 月。

图1:AI Agent 工作流程示意 — 展示了感知、推理、规划、工具使用、行动执行的完整链路。
从 README 中记录的月度亮点,可以清晰看到 2026 年 AI Agent 学术研究的几个核心趋势:
Harness(智能体脚手架) 成为今年最火的研究方向之一。"Harness" 指的是为 LLM Agent 设计运行时支撑架构——包括工具调用框架、记忆管理、任务编排接口等。代表性论文包括"An Agent Harness System for Complex Long-Horizon LLM Reasoning"(RefAct 系列)、"Agent Harness Engineering: A Survey"(OpenReview 发表综述)等十余篇。这些工作共同指向一个判断:模型能力上限之外,Harness 的设计质量直接决定了 Agent 在实际任务中的表现。
2026 年 5 月是 Harness 相关论文最密集的月份,单月收录相关工作超过 15 篇,涵盖从理论框架("A Methodology for Selecting and Composing Runtime Architecture Patterns")到基准测试(Harness-Bench)的完整链条。
Skills(技能系统) 是另一条并行的主线。Agent 需要调用外部工具和 API,Skills 研究关注如何让 Agent 更好地获取、组合、评估工具技能。相关论文包括"SkillScope: Fine-Grained Least-Privilege Enforcement for Agent Skills"、"SkillOS: Learning Skill Curation for Self-Evolving Agents"等,涵盖技能发现、生命周期管理、安全合规等多个子方向。

图2:API Agent 的调用与技能编排架构
2026 年最受关注的研究方向之一是自我进化 Agent(Self-Evolving Agents)。这类研究探索 Agent 如何在运行时持续优化自己的策略、记忆结构和工具集,而不仅仅依赖训练时的知识。
代表性工作包括:CORAL(自主多 Agent 开放域探索)、EvoSkills(通过协同验证实现技能自我进化)、EVOSPARK(面向长程叙事的 Agent 社会演化)等。这些论文表明,自我进化正在从"美好的愿景"变成"可工程化的方向",虽然距离实用化还有距离,但论文数量和质量都在快速提升。

图3:Agent 推理能力在多层架构中的位置
项目中专设的"Research Agents"板块,汇集了 AI 驱动的科学研究自动化相关工作。亮点包括:
EvoScientist:多 Agent 协作的端到端科学发现框架,已在多个科学领域验证;DeepXiv-SDK:面向科研文献的 Agentic 数据接口;Agentic Scientific Simulation:执行导向的模型构建与重建。这类工作正在推动 AI 从"辅助工具"向"科研协作伙伴"演进。FIRE-Bench 和 AIRS-Bench 等基准测试的出现,表明该方向正在建立科学的评估体系。

图4:研究 Agent 的核心工作流程——从文献检索到假设生成
应用板块中,数字 Agent(Digital Agents)是落地最快的方向,包含 Web Agent(自动化浏览器操作)、GUI Agent(操作系统级自动化)、Mobile Agent(移动端任务自动化)。这类 Agent 的优势在于有明确的 Benchmark(WebArena、Mobile-Agent 等),工程路径清晰,商业价值直观。
质量优先而非数量优先。相比其他追求"全面覆盖"的论文列表,该项目坚持"只收录有新思路的工作",这使得列表的信号噪声比很高。对于需要快速了解某方向最新进展的开发者或研究者,可以节省大量筛选时间。
实时跟进最新动态。每月更新的 Newsletter 和持续追踪 Arxiv 新论文,保证了内容的时效性。2026 年 5 月的 Highlight 已在 README 中更新,说明维护者仍在活跃投入。
分类体系具有参考价值。项目对 AI Agent 的分类方式(能力→架构→应用)本身就是一套值得借鉴的分析框架,对于理解整个领域结构很有帮助。

图5:数字 Agent 的主要应用场景分类
这是一个纯文档型项目,本身不需要部署,但使用时也有一些注意事项:
从该项目两年来的论文追踪可以看出,AI Agent 领域正经历从"单点能力突破"到"系统性架构整合"的转变。2024 年的热点可能是单个 Agent 的推理能力,而 2025-2026 年的核心命题已经变成:如何在多 Agent 协作、技能系统、Harness 设计、自我进化等多个维度协同突破。这个项目为观察这一转变提供了高效的一线入口,值得 AI 从业者定期关注。