rllm
用强化学习训练任意框架AI Agent的开源基础设施,4B模型可超越235B大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用强化学习训练任意框架AI Agent的开源基础设施,4B模型可超越235B大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你的 AI 助手刚刚完成了一次复杂的代码编写任务,你希望它在下次遇到类似问题时能更聪明——但传统微调需要大量数据和计算资源,普通开发者根本玩不起。rLLM 的出现打破了这个瓶颈,它让任何人都能用强化学习来训练 AI Agent,只需几行代码,就能让 4B 参数的小模型在金融推理任务上超越 235B 的庞然大物。
大语言模型(LLM)经过预训练后已经具备强大的基础能力,但面对特定领域任务时,往往需要对齐(Alignment)才能真正发挥作用。传统的 RLHF(人类反馈强化学习)流程复杂,需要昂贵的 reward model 训练和大量人工标注数据,普通团队难以承担。
rLLM(Reinforcement Learning for Language Model)诞生于这一痛点,它将 RL 训练能力抽象为一个通用框架:不关心你用哪个 Agent 框架,不关心你的模型是什么,只关心一件事——如何高效地让 Agent 从反馈中自我进化。项目由 rLLM Team 发起,Apache-2.0 开源,GitHub 5,581 颗星,574 个 fork,是 RL+LLM 融合领域最受关注的开源项目之一。

图1:rLLM CLI 界面,支持 rllm eval 和 rllm train 一键评估与训练。
rLLM 的架构可以用四个关键词概括:Agent → Traces → Rewards → RL Update。整个流程是一个数据流管道:
@rllm.rollout 装饰器自动拦截所有 LLM API 调用,记录 token IDs 和 logprobs。rLLM 内置 Model Gateway,透明地捕获推理过程中的关键信号。@rllm.evaluator 定义任意奖励函数——可以是数学题的对错判断,可以是代码执行结果验证,也可以是调用外部工具的评分。奖励函数完全自定义,不依赖 reward model。
图2:rLLM 训练流程,Agent 运行→轨迹采集→奖励计算→RL策略更新。
rLLM 在多项基准测试中展现了惊人的小模型超越大模型现象:
这些成绩说明了一个核心观点:RL 训练的关键不只是模型规模,更重要的是训练信号的质量和训练范式的设计。小模型经过精心设计的 RL 训练,完全可以在特定任务上打败傻大个。
rLLM 的代码仓库组织清晰,采用模块化插件架构:
核心技术依赖:Python >= 3.11,pydantic 数据建模,litellm 多模型网关,verl/tinker 作为训练后端。代码质量较高,有完整测试套件(tests/),pre-commit 配置完善,文档质量极佳(docs/ 目录有 24 个子目录)。

图3:rLLM 系统架构,Model Gateway 透明捕获 token 流。
rLLM 最大的卖点是极低的接入成本。如果你是 CLI 用户,只需三步:
rllm model setup # 配置模型提供商
rllm eval gsm8k # 在基准上评估当前模型
rllm train gsm8k # 用 RL 训练模型
如果你是 Python 开发者,只需要在现有 Agent 代码上加两个装饰器——@rllm.rollout 装饰 rollout 函数,@rllm.evaluator 装饰评估函数,然后交给 AgentTrainer 启动训练。原有的 Agent 代码一行不用改。
训练后端选择上:
需要注意:verl 后端需要 NVIDIA GPU(推荐 16GB+ 显存),且依赖 PyTorch、flash-attention 等底层库,安装过程相对复杂。tinker 后端则对硬件要求宽松,但训练效率也相应较低。
rLLM 不绑定任何框架,这让它成为一个真正的框架中立层。官方已测试并支持:
openai.OpenAI 也支持。社区项目中已有阿里巴巴的 DeepResearch、Terminal-Bench-RL 等生产级应用接入 rLLM。

图4:rLLM 与 AWS Bedrock AgentCore 的集成示例。
rLLM 也不是银弹,以下几点需要客观看待:
rLLM 的出现标志着 RL 在 LLM 领域从阳春白雪走向下里巴人。它证明了:
随着 AI Agent 在各行业的落地,RL 训练能力将成为下一代 AI 基础设施的关键组件。rLLM 目前走在前列,5,581 颗星和 574 个 fork 说明了社区的认可度。如果你在构建 AI Agent,不妨试试用 rLLM 给它装上进化能力。