AgentGym-RL
通过多轮强化学习训练LLM Agent在真实复杂场景中持续进化的开源框架,7B模型可超越GPT-4o
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
通过多轮强化学习训练LLM Agent在真实复杂场景中持续进化的开源框架,7B模型可超越GPT-4o
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年9月,一支来自复旦、字节跳动、上交等机构的研究团队在arXiv上发表了一篇论文,提出了一个让大语言模型在真实复杂场景中持续进化的新框架——AgentGym-RL。不同于传统Agent研究往往只在单一、简单的任务上做实验,这个框架的野心要大得多:让LLM Agent在网购、论坛操作、游戏、具身推理、科学探索等多种真实环境中,通过强化学习自主提升决策能力。2026年2月,该论文被ICLR 2026录用为Oral(口头报告),这在AI Agent研究领域是相当高的认可。
图1:AgentGym-RL在27个跨域任务上的性能表现,7B模型匹配或超越商业模型
为什么这件事重要?当前主流的Agent训练方式有两种:一是行为克隆(Behavior Cloning),即让模型模仿人类示范数据;二是直接用强化学习在简单任务上训练。但问题在于:行为克隆只能让Agent'及格',很难超越人类演示的水平;而现有RL方法大多局限在单轮任务上,无法处理需要多轮交互的真实复杂问题。AgentGym-RL的核心贡献是:构建了一个统一的RL训练框架,覆盖27个跨域任务,让开源7B模型能在多轮交互中持续进化,最终甚至超越GPT-4o这样的商业模型。
图2:AgentGym-RL三大模块架构:环境模块、Agent模块、训练模块通过HTTP协议解耦
图3:AgentGym-RL伪代码,展示了多轮交互的完整训练循环
AgentGym-RL的架构分为三大核心模块,通过解耦合的模块化设计实现了灵活的训练流程。**环境模块(Environment Module)**负责接入多种真实世界场景,以标准化的Server-Client架构通过HTTP协议进行并行交互,支持WebArena(网购/论坛/协作开发/内容管理)、Search-R1(检索增强推理)、TextCraft(文字冒险游戏)、BabyAI(网格世界具身推理)、SciWorld(科学实验模拟)等环境。**Agent模块(Agent Module)**封装了Agent在多轮交互中的推理与决策过程,支持长程规划、自我反思等高级机制,并能通过vLLM引擎进行高效的批量推理。**训练模块(Training Module)**基于verl框架实现了完整的RL训练管线,支持PPO、GRPO、RLOO、REINFORCE++等主流在线RL算法,以及SFT、DPO、AgentEvol等补充训练范式。
图4:ScalingInter-RL核心思想——渐进式扩展交互边界,前期小轮数稳定积累,后期扩展探索深度
图5:AgentGym-RL支持的环境类型,包括Web导航、深度检索、文字游戏、具身推理、科学探索
ScalingInter-RL是团队提出的核心训练策略,用来解决多轮RL中'探索与利用'的根本矛盾。传统的RL训练要么给Agent固定一个交互轮数上限,要么让轮数从一开始就很大——前者限制了探索深度,后者导致训练不稳定、Reward容易崩溃。ScalingInter-RL的做法是渐进式扩展交互边界:先用较小的轮数开始训练,让Agent在简单任务上稳定积累能力;随着训练步数增加,逐步放宽轮数上限,引导Agent探索更长的决策路径,从而涌现出更高阶的认知行为。实验表明,这种策略让7B模型在WebArena上超越了GPT-4o,并在整个训练过程中保持reward的稳定增长。
项目还提供了一个可视化交互界面,用于回放和分析Agent与环境的完整交互轨迹。这对于研究人员调试Agent行为、理解多轮决策过程、迭代优化策略非常有价值。训练数据来源于HuggingFace上的AgentGym-RL-Data-ID数据集,包含了预训练好的轨迹样本。代码库基于verl框架做了深度定制,主要改动包括:引入RolloutHandler正确计算多轮场景下的注意力掩码和损失掩码、引入EnvClient处理环境交互、支持多环境并行Rollout以提升采样效率。部署方面,该项目是纯研究级框架,不支持Docker一键部署,需手动配置Python 3.10 + CUDA 12.4 + PyTorch 2.4环境,GPU显存需求至少16GB。
图6:WebArena基准评测结果,ScalingInter-7B超越GPT-4o,匹配DeepSeek-R1和Gemini-2.5-Pro
AgentGym-RL代表了LLM Agent研究从'单轮任务'向'多轮真实世界任务'演进的重要趋势。它的核心价值在于:提供了统一的训练框架让开源模型能在复杂多轮场景中持续进化,同时提出了ScalingInter-RL这一简单有效的训练策略来平衡探索深度与训练稳定性。ICLR 2026 Oral的录用也印证了学术界对这一方向的强烈关注。对于希望深入LLM Agent RL训练的开发者,该项目提供了从环境配置到训练评估的完整参考实现,但需要足够算力支撑(推荐A100 80G或等效GPU)。