awesome-ai-agent-papers
VoltAgent 团队维护的 2026 年 AI Agent 论文精选库,按 Multi-Agent、记忆、RAG、评估、安全五大方向分类,每周从 arXiv 更新
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
VoltAgent 团队维护的 2026 年 AI Agent 论文精选库,按 Multi-Agent、记忆、RAG、评估、安全五大方向分类,每周从 arXiv 更新
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你是一名 AI 工程师,最近在研究如何在推荐系统中引入 Agent 仿真评估,翻遍了 arXiv 发现每周新增论文数量多到根本看不完,一个个点进去筛选既费时又容易遗漏。Awesome AI Agent Papers 正是为解决这个问题而生——VoltAgent 团队每周从海量 arXiv 论文中筛出与 AI Agent 直接相关的最新研究,按五大主题分类整理,让你用喝一杯咖啡的时间就能掌握本周最值得读的 Agent 论文。
图1:VoltAgent 项目 Logo
AI Agent(AI 智能体)是 2026 年最活跃的 AI 研究方向之一。从 2024 年的"LLM 元年"到 2026 年的"Agent 元年",学界和工业界的关注点已从"如何训练更强的大模型"逐步转向"如何让大模型真正代替人完成任务"。Multi-Agent 协作、长期记忆、RAG 增强、Agent 评估、安全与对齐等细分方向论文呈爆发式增长,仅 2026 年第一季度就有超过 1500 篇相关论文发布在 arXiv 上。
VoltAgent 团队敏锐地捕捉到了这一痛点。他们此前已开源了 VoltAgent 框架,一个用于构建生产级 AI Agent 的开发工具包。在维护框架的过程中,团队发现社区对高质量 Agent 论文的需求非常强烈——不同于通用 AI 论文列表,这套列表专注于 Agent 系统本身,包括 Agent 的设计范式、工程实践和行业落地经验。awesome-ai-agent-papers 由此诞生,每周更新,只收录当年发表的论文,确保时效性。
这份列表将 363+ 篇论文划分为五个方向,总有一类适合你:
工具调用(Tool Use)是 Agent 区别于普通 LLM 的核心能力之一。列表收录了大量关于 Agent 如何调用外部 API、操作文件系统、执行代码、访问数据库的论文。其中比较有代表性的是 RuleSmith 系列,研究用 Multi-Agent LLM 做游戏数值平衡自动调优,让 AI Agent 扮演"策划 + 数值策划 + 测试"三个角色协作迭代。此外还包括 Agent 调用浏览器、API 调用规划、函数调用协议标准化等工程实践类论文。
随着 Agent 开始操作数据库、发送邮件、执行交易,安全问题变得前所未有的重要。这个分类收录了 Agent 越权访问、Prompt 注入攻击、Agent 间通信的隐私泄露、Reward Hacking 在 Agent 场景下的新形态等论文。相比传统 LLM 安全研究,Agent 安全更关注"多步执行链"中的累积风险——单个步骤看起来没问题,但串联起来可能产生严重后果。
评估 Agent 比评估 LLM 更难——Agent 的行为是动态的、交互式的,传统的 BLEU/ROUGE 指标根本不适用。这个分类收录了 Context-Aware Agent 仿真评估、在线 A/B 测试替代方案、Agent 轨迹可观测性(Observability)建设、多维度 Agent 能力评测框架等论文。Beyond Offline A/B Testing 提出了用上下文感知的 Agent 仿真替代线下测试,在推荐系统场景下验证了效果。
没有记忆的 Agent 每次对话都是"失忆"状态,如何让 Agent 在长周期任务中保持上下文一致是一个核心难题。这个分类涵盖了 Graph RAG 在 Agent 记忆中的应用、Procedure Memory(过程记忆)学习、结构化 SOP 文档的 RAG 增强(SOPRAG)、工业标准操作流程的知识图谱表示等方向。
当一个 Agent 不够用时,多个 Agent 如何分工协作?列表收录了 CORAL(自主多 Agent 进化)、DyTopo(基于语义匹配的动态拓扑路由)、PDE 科学计算的 AutoNumerics 多 Agent 流水线等论文,展示了多 Agent 在科学研究、游戏开发、供应链优化等多种场景下的协作模式。
作为 VoltAgent 生态的一部分,这份论文列表体现了团队一贯的产品设计思路:
严格的时效性过滤:列表只收录 2026 年 1 月 1 日之后发表的论文。在 AI 这个日新月异的领域,去年的论文可能已经落后,"只读最新"大幅降低了信息筛选成本。
arXiv 原生采集:所有论文直接链接到 arXiv,附上 arXiv ID 和 PDF 链接,读者可以一键跳转阅读原始论文,无需中间跳转页。
主题覆盖全面:五大方向覆盖了 Agent 系统从"感知-决策-执行-评估-安全"的完整生命周期,既适合想做 Agent 基础设施的开发者,也适合关注具体应用场景的算法工程师。
社区共建机制:项目接受 GitHub Pull Request,任何人发现了值得补充的论文都可以提交,VoltAgent 团队审核后合并,保持列表的持续更新。
对于普通 AI 爱好者,这个列表是了解 AI Agent 前沿进展的最佳入口。打开 GitHub 页面,按自己感兴趣的方向点击目录跳转即可。每篇论文都有标题 + 一句话描述,扫完五分钟就能知道当前 Agent 领域在关注什么。
对于 AI 开发者,建议重点关注 Agent Tooling 和 Eval & Observability 两个分类。前者告诉你业界在用什么方式给 Agent 装上"手脚"(工具调用);后者告诉你如何在实际产品中衡量 Agent 的真实效果——这是工程落地的关键一环。
对于学术研究者,Multi-Agent 和 Memory & RAG 是最值得深挖的方向,大量论文还处于早期阶段,有充足的创新空间。
必须指出的是,awesome-ai-agent-papers 是一份人工策展(Curated)的列表,而非系统化的文献调研。VoltAgent 团队的选择标准虽然透明,但不同筛选者的主观判断会导致某些方向的论文被低估或遗漏。此外,列表按 arXiv 采集,缺乏对论文同行评审版本的追踪——arXiv 论文在正式发表前可能经历多轮修订,列表中的摘要描述可能与最终版存在偏差。
从技术趋势看,当前 Agent 论文普遍存在"基准测试饱和"问题:大多数论文在同一套评测基准上刷分,真实场景下的泛化能力难以验证。这也是列表中 Eval & Observability 方向论文最多的原因之一——整个社区都在为"如何真正评估 Agent"而焦虑。
awesome-ai-agent-papers 的出现折射出一个更大的趋势:2026 年的 AI Agent 领域正从"框架热"走向"系统化"。早期各种 Agent 框架(AutoGPT、LangChain、HuggingFace Agents 等)百花齐放,开发者们兴奋地尝试用 LLM 驱动 Agent 执行复杂任务。到了 2026 年,行业重心已转移到 Agent 的工程难题——如何让 Agent 可靠地调用工具、如何评估 Agent 的行为、如何保障 Agent 的安全——而这些问题都需要扎实的学术研究支撑。
VoltAgent 作为 Agent 框架提供商,同时维护这份论文列表,本质上是在构建一个从"学术研究"到"工程落地"的闭环生态。开发者既可以用 VoltAgent 框架快速搭建 Agent 应用,又能通过论文列表追踪最新学术进展,两者相互促进。
这份列表目前已获得 1387+ GitHub Stars,是 2026 年 AI Agent 领域增长最快的论文精选项目之一。随着 Agent 在企业级场景的落地加速,可以预见这类策展型资源的需求会持续增长。