Trinity-RFT
阿里百炼开源的三组件通用 LLM 强化微调框架,支持 PPO/GRPO/DPO 等十余种 RL 算法
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里百炼开源的三组件通用 LLM 强化微调框架,支持 PPO/GRPO/DPO 等十余种 RL 算法
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Trinity-RFT 项目标识
想象一下:你是一位调酒师,要把一个大语言模型(LLM)训练成某个特定领域的专家——比如让它学会数学推理、网页搜索,或者在虚拟环境中完成复杂任务。传统的做法是你得从头学调酒配方,但 Trinity-RFT 告诉你:「不用,从这瓶基酒开始,按我的配方来就行。」
Trinity-RFT 是一个专为 LLM 强化微调(Reinforcement Fine-Tuning,RFT)设计的三组件通用框架,由阿里百炼团队(agentscope-ai)开发维护。它将 LLM 的强化学习训练流程拆解为三个核心组件:**Explorer(探索者)**负责生成经验数据——让模型与环境互动,产出「做对了加分、做错了扣分」的反馈信号;**Trainer(训练器)**负责更新模型权重——基于这些反馈信号,通过各种 RL 算法(PPO、GRPO、DPO 等)优化模型行为;**Buffer(缓冲区)**则像一条流水线,负责数据的清洗、增强、存储和调度,让 Explorer 和 Trainer 高效协作。
LLM 后训练的两大范式——SFT(监督微调)和 RLHF(人类反馈强化学习)各有局限。SFT 需要大量高质量的专家标注数据,成本高且难以覆盖长尾场景;传统 RLHF(如 PPO)依赖单独的奖励模型(Reward Model),训练流程复杂,调参难度大。Trinity-RFT 提出了更灵活的方案:它支持免奖励模型的 RL 算法(如 GRPO、REINFORCE、ReMax),可以直接用规则化的奖励函数(如准确率检查、格式校验)驱动训练,大幅降低了 LLM RL 训练的门槛。
2026 年 6 月,Trinity-RFT 相关成果更是双喜临门——两个工作同时被 ICML 2026 接收,分别是 Learn-to-Ask(让模型学会在推理过程中主动提问)和 LLM-RL entropy dynamics(研究强化学习中熵动态对训练稳定性的影响)。此外,Trinity-RFT 还驱动了 CoPaw-Flash 小模型的训练,该模型已在 ModelScope 和 HuggingFace 开源,专为中文本地化场景优化。
Trinity 的三层架构设计非常清晰,每一层都有明确的职责边界:
Explorer(探索层):通过 workflow_runner 驱动模型与环境的交互。内置支持多种工作流环境,包括 AgentScope(阿里自研的多智能体开发框架)、ALFWorld(文本冒险游戏)、WebShop(网购模拟)、Intercode-SQL(数据库查询)、SciWorld(科学实验推理)等。工作流引擎支持 ReAct(推理+行动)范式,支持工具调用(function calling),支持 Gradio Web 界面交互。
Trainer(训练层):支持多种后端训练引擎,包括 verl(VeRL,一个高性能 RL 训练框架,支持 Megatron 并行和 FSDP 混合并行)和 tinker(轻量级微调引擎)。支持的 RL 算法涵盖 PPO、GRPO、DPO(直接偏好优化)、SPPO(自我博弈策略优化)、CISPO、REINFORCE++、REMAX、IS-PPO(重要性采样 PPO)、On-Policy Distill(在线策略蒸馏)、GIGPO、Recoil(Rec)等十余种。每一类算法都有独立的 loss 函数模块(policy_loss_fn/)和 advantage 估计模块(advantage_fn/),实现了真正的模块化设计。
Buffer(数据层):负责经验数据的生命周期管理。支持文件(JSONL)、SQLite、Redis Queue 等多种存储后端;提供数据清洗算子(experience_operator)、过滤算子(reward_filter)、映射算子(reward_shaping_mapper);支持难度估计(difficulty_estimator)、数据增强(pass_rate_calculator);内置 DataJuicer 服务集成,用于大规模预训练数据的清洗。
Trinity-RFT 在模型支持方面非常全面。从支持的模型系列来看:Qwen 全系列(包括 Qwen2.5、Qwen3)、LLaMA 系列、DeepSeek 系列、GLM 系列、Mixtral、Qwen-VL(视觉语言模型)均有官方支持。通过 vLLM 后端可以高效推理,通过 vllm_patch 插件实现对 grouped-query attention、routed experts 等特性的支持。
框架还内置了大量开箱即用的奖励函数(Reward Functions):数学奖励(math_reward,基于 GSM8K、GPQA 等基准)、工具调用奖励(tool_reward)、格式奖励(format_reward)、Agent 专用奖励(agents_reward)、倒计时谜题奖励(countdown_reward)等。这些奖励函数可以通过 YAML 配置自由组合,配合不同的 RL 算法,形成完整训练 pipeline。
以 GRPO(Group Relative Policy Optimization)在 GSM8K 数学任务上的训练为例,整个流程只需配置两个 YAML 文件:explorer.yaml(定义数据源、模型、工作流)和 trainer.yaml(定义算法、超参数)。数据通过 TaskPipeline 自动下载和预处理,奖励函数使用内置的 MathReward,训练结果通过 TensorBoard 可视化。整个过程无需编写一行 Python 代码。
对于更高级的用户,框架支持 LoRA/QLoRA 微调(lora_utils)、多阶段训练(TaskPipeline 支持 curriculum learning)、人类在环(Human-in-the-Loop)DPO 训练,以及分布式训练(Megatron + FSDP)。
需要正视的是,Trinity-RFT 的部署门槛并不低。它需要 NVIDIA GPU(推荐 A100/H100),至少 24GB 显存,CUDA 12.1+ 环境,以及 NCCL 等分布式训练依赖。没有 docker-compose 支持意味着无法一键启动,需要手动构建 Docker 镜像并配置数据路径。此外,框架目前没有 Web UI,训练过程的监控依赖 TensorBoard 和命令行日志。
另一个值得关注的点是,由于缺乏 docker-compose,分布式多节点训练的部署文档相对分散,对于没有分布式训练经验的团队来说,从单机 7B 模型微调到多机 70B 模型训练的跨越,仍需要一定的学习和踩坑过程。
Trinity-RFT 的出现,代表了 LLM 后训练领域的一个趋势:从「定制化」走向「通用化」。过去,每个研究团队都需要维护自己的一套 RL 训练代码,导致大量重复劳动和复现困难。Trinity-RFT 提供了统一的抽象层和丰富的算法库,让研究者可以专注于算法本身,而不必重新造轮子。
从社区影响力来看,654 个 GitHub Stars、Apache-2.0 许可、ICML 2026 论文接收、以及支撑实际业务模型训练(CoPaw-Flash),都说明这个框架已经过了真实场景的验证。随着 Agent 应用和垂直领域 LLM 定制的需求爆发,Trinity-RFT 这类通用 RFT 框架的价值将会越来越凸显。
如果你在构建 Agent、训练垂直领域模型、或者研究 RL 算法,Trinity-RFT 值得一试——它不是一个玩具项目,而是一个真正能跑生产任务的 LLM 强化微调框架。