AgentsMeetRL
LLM Agent 强化学习领域最全开源项目汇总:312 个仓库 + 16 分类 + Claude Code 诊断 Skill
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
LLM Agent 强化学习领域最全开源项目汇总:312 个仓库 + 16 分类 + Claude Code 诊断 Skill
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,小张盯着 WandB 曲线发呆——Reward 曲线像一条死鱼,平得没有一丝波澜。他尝试了调学习率、改 KL 散度系数、换 batch size,折腾了整整一周,实验结果依然原地踏步。「GRPO 和 PPO 到底该怎么选?」「为什么我的 KL 散度会爆炸?」「工具调用解析失败的问题怎么解决?」——这些问题在传统的强化学习教材里找不到答案,因为 LLM Agent + RL 是一个全新的交叉领域。
AgentsMeetRL(Awesome List for Agentic RL)正是为解决这类问题而生的。它是目前 GitHub 上最全面的 LLM Agent 强化学习开源项目汇总,收录了 312 个开源仓库,覆盖从基础训练框架到具体场景应用的完整生态。
2024 年下半年开始,随着 o1-preview、DeepSeek-R1 等推理模型的爆火,LLM Agent 与强化学习的结合成为 AI 领域最受关注的方向之一。传统 RL 框架(如 RLlib、Stable-Baselines3)无法直接处理 LLM 的离散 token 输出空间;而传统 NLP 的 SFT(有监督微调)又难以让模型学会自我纠错、工具调用和多步推理。
这一交叉领域的核心挑战在于:如何为 LLM 设计有效的 reward shaping?如何处理超长上下文的 credit assignment?如何让模型在多轮交互中学会使用工具?——AgentsMeetRL 的作者 thinkwee 正是看到了这一空白,于 2025 年初创建了本项目,旨在系统性地梳理这一新兴领域的开源生态。
项目官方网站(交互仪表盘):https://thinkwee.top/amr/,可按分类、Stars 数等维度浏览全部收录项目。
AgentsMeetRL 不是一个简单的链接列表,它构建了 三层递进的内容体系:
项目将收录的 312 个项目分为 16 个细分类别,每个类别代表一种特定的 Agentic RL 技术方向:
| 分类 | 数量 | 代表项目 | 核心问题 |
|---|---|---|---|
| Environment(环境) | 47 | OSWorld, SWE-bench, WebArena | 为 Agent 提供训练和评测环境 |
| Search & RAG(搜索增强) | 38 | Search-R1, RAG-Search-RL | 检索增强推理与 RL 结合 |
| Web & GUI(网页操作) | 29 | ToolCUA, ClawGUI | 训练 Agent 操作浏览器/桌面 GUI |
| Base Framework(基础框架) | 20 | veRL, OpenRLHF, trl | 通用 RL 训练框架 |
| Tool Use(工具调用) | 20 | ReAct, Toolformer, MCP | 外部工具调用的 RL 训练 |
| Code & SWE(代码智能) | 22 | SWE-agent, OpenCodeAgent | 代码生成与软件工程任务 |
| Reasoning(推理) | 18 | GRPO, STaR, ProcessReward | 思维链推理的强化学习 |
| VLM Agent(多模态) | 19 | ParaVT, OpenSearch-VL | 视觉-语言模型的 Agent 训练 |
| Multi-Agent(多智能体) | 14 | CAMEL, MetaGPT | 多 Agent 协作的 RL 方法 |
| General/MultiTask(通用) | 21 | T²PO, SkillZero, SDAR | 跨任务泛化的通用 Agent |
| Safety(安全对齐) | 9 | — | RL 在安全对齐中的应用 |
| Memory(记忆管理) | 6 | — | Agent 长期记忆的 RL 学习 |
| Self-Evolution(自我进化) | 10 | — | Agent 通过 RL 反馈实现自我迭代 |
| Domain-Specific(垂直领域) | 9 | — | 医疗、金融等专业领域 Agent |
| Reward & Training(训练方法) | 6 | DAPO, DR.GRPO, VAPO | 过程奖励模型与新型训练算法 |
| Embodied(具身智能) | 3 | — | 物理/仿真环境中的 RL Agent |
项目提供了一个完全基于前端的交互式仪表盘(thinkwee.top/amr/),使用 Chart.js 构建,可按分类、Stars 数、更新时间等维度过滤和搜索所有收录项目,并实时展示各分类的项目数量分布。
这是项目最有技术深度的产品化形态。它将 312 个项目的元数据(包含每个项目的 takeaway 一句话总结、GitHub URL、论文链接、组织信息)打包为一个 Claude Code 插件,让 AI 编程助手在处理 Agentic RL 相关问题时,能够引用具体的论文和代码库来给出有据可查的回答。
Skill 触发条件包括:用户正在训练/评估/设计 RL 训练的 LLM Agent;出现 reward 不涨、KL 散度爆炸、工具调用解析失败等训练异常;需要选择框架/算法/数据整理方案等。Skill 内置了问题分类索引(problems/_INDEX.md),将典型症状映射到对应的项目参考路径。
AgentsMeetRL/
├── README.md # 主列表页面(50KB)
├── index.html # 交互仪表盘(40KB,纯前端)
├── logo.png # 项目 Logo
├── AgentsMeetRL_Skill.png # Skill 使用截图
├── .claude-plugin/
│ └── plugin.json # Claude Code 插件注册信息
└── skills/agents-meet-rl/ # Claude Code Skill 核心
├── SKILL.md # 触发条件 + 使用规范
├── database.json # 312 条目的机器可读语料库(242KB)
├── problems/ # 按症状分类的问题诊断文件
├── references/ # 按分类整理的项目参考
└── evals/ # 评测方法参考
技术栈极为简洁:index.html 仅依赖 Chart.js CDN,无任何服务端组件。所有数据通过 GitHub API 动态加载,Markdown 文件直接提交到仓库维护。这种"代码即配置"的设计思路,使项目本身零运维,却实现了高达 1558 Stars 的社区影响力。
从 database.json 的 takeaway 字段可以看出,项目对每个收录仓库都做了深度解析,不仅标注 Stars 数和机构,还提炼出核心技术贡献。例如:
作为 Awesome List 项目,AgentsMeetRL 没有可执行代码,不需要 Docker 或任何运行环境。使用方式分为三种:
方式一(最简):直接访问仪表盘 访问 https://thinkwee.top/amr/,在浏览器中按分类浏览所有项目,点击每个项目可跳转到 GitHub 仓库。零门槛,适合快速了解某一方向的现有工作。
方式二(推荐开发者):作为 Claude Code Skill 使用 安装命令:
# 通过 Claude Code marketplace 安装
/plugin marketplace add thinkwee/claude-plugins
/plugin install agents-meet-rl@thinkwee
# 或手动克隆
git clone https://github.com/thinkwee/AgentsMeetRL
cp -r AgentsMeetRL/skills/agents-meet-rl ~/.claude/skills/
安装后,Claude Code 在识别到 Agentic RL 相关问题时会自动触发 Skill,返回基于真实论文和代码库的诊断建议。
方式三:贡献新项目 项目持续更新,欢迎通过 Issue 或 PR 提交新的 Agentic RL 项目。提交标准:必须具备多轮交互或工具使用能力(即包含 Tool-Integrated Reasoning,TIR),不接受纯 TIR 项目。
局限性一:Awesome List 的时效性问题 Agentic RL 是当前发展最快的 AI 子领域之一,项目快照为 2026-05-23,但项目本身的最后更新也在此日期附近。对于发布于 2026 年 5 月之后的新项目,Skill 明确声明"可能不覆盖"。依赖本项目的用户需要自行确认引用的项目是否在收录范围内。
局限性二:Skill 能力的边界 agents-meet-rl Skill 明确声明它是一个"知识库"而非"诊断工具"——它不能读取用户的训练日志、WandB 曲线或实时指标。用户在描述自己的问题时需要主动提供具体的错误信息,Skill 才能将其映射到相关项目中。问题描述的精确度直接影响 Skill 的可用性。
局限性三:收录标准的模糊地带 Tool-Integrated Reasoning(TIR)项目是否应该被收录,是一个持续讨论的问题。作者将 TIR 项目纳入 Awesome List,但 Skill 的触发条件中明确排除了"不包含 RL 成分的通用 LLM 微调"项目。这意味着某些看起来相关的仓库可能因为缺少 RL 训练环节而被排除。
AgentsMeetRL 的意义不仅在于"汇总了 312 个项目",更在于它完成了一次从数据到知识的工程化转换:
填补了 Agentic RL 的方法论空白:此前,LLM Agent 开发者遇到训练问题时,只能在 Reddit、Discord 或 GitHub Issue 中零散搜索。AgentsMeetRL 将这些碎片知识系统化,按症状分类整理,使问题有路可循。
开创了"AI 辅助 AI 研究"的新范式:将 Awesome List 转化为可被 AI 编程助手调用的 Skill,是一次Meta-Learning 的有趣实践——让 AI 学会使用 AI 社区的集体智慧来解决 AI 训练中的具体问题。
反映了 Agentic RL 的发展趋势:从分类分布看,环境类(47)和搜索增强类(38)项目数量最多,说明当前 Agentic RL 的核心瓶颈仍在评测环境构建和外部知识检索上;多模态 VLM Agent(19)和 Web/GUI 操作(29)的快速增长,则反映了 Agent 从纯文本向多模态交互演进的趋势。
AgentsMeetRL 是 LLM Agent 强化学习领域最具影响力的知识库和工具集。它以 312 个开源项目为底座,构建了"16 分类列表 + 交互仪表盘 + Claude Code Skill"三层内容体系,为 Agentic RL 研究者和工程师提供了从项目发现到问题诊断的一站式解决方案。尽管作为 Awesome List 存在时效性和完整性局限,但其将知识工程化的思路值得借鉴。对于正在进行 LLM Agent 训练的开发者,建议将 agents-meet-rl Skill 集成到工作流中,能显著加速问题定位和方案选型。