verl
字节跳动Seed团队开源的大模型强化学习训练框架,支持GRPO/PPO/DAPO等算法,吞吐量达SO
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
字节跳动Seed团队开源的大模型强化学习训练框架,支持GRPO/PPO/DAPO等算法,吞吐量达SO
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你可能听说过 GPT、Claude、LLaMA 这些大语言模型——它们能力惊人,能写代码、能作诗、能把一段话翻译得地道流畅。但很少有人知道,这些模型在出厂前,其实经历了漫长的"调教"过程。
最初,模型只是"词语接龙高手":给它一段上文,它预测下一个最可能出现的词,然后循环往复。这时的模型叫做基座模型(Base Model),它的回答可能是"正确的废话",也可能完全跑偏。真正让它变得"有用"的,是**后训练(Post-Training)**阶段——用人类偏好数据教会它,什么是好答案,什么是坏答案。
传统的后训练靠的是人类反馈强化学习(RLHF),核心是 PPO(Proximal Policy Optimization)算法。但 PPO 在大模型时代遇到了瓶颈:训练流程极其复杂,需要多个模型协同工作(策略模型、奖励模型、参考模型、价值模型),还要在 GPU 集群上进行分布式训练。开源社区虽有众多 RLHF 实现,但大多要么灵活性不足、难以适配新算法,要么吞吐量低、资源利用率差。
veRL(Volcano Engine Reinforcement Learning for LLMs)正是为解决这些问题而来。
veRL 由字节跳动 Seed 团队发起并开源,是其内部生产级框架 HybridFlow 的社区版本。2024 年 9 月,团队在 EuroSys 学术会议上发表了 HybridFlow 论文,详细阐述了框架的设计理念和性能数据。
为什么要把内部框架开源?团队在 GitHub 首页给出了答案:希望推动整个 LLM 后训练生态的发展。目前 veRL 已被 NVIDIA GTC 2026、PyTorch Conference Europe 2026 等顶级会议邀请演讲,trick 平台 Mind Lab 也在用它训练万亿参数级别的 GRPO LoRA 模型——这说明框架已经过真实生产环境的检验。
veRL 的设计哲学可以概括为一句话:把 RL 训练流程拆成可组合的"积木块",再按需拼装。
传统 RLHF 框架要么是"单控制器"(一个中心节点统筹所有计算),要么是"多控制器"(各模块独立运行,靠通信同步)。这两种方案各有缺陷:前者缺乏灵活性,后者通信开销大、吞吐量受限。
veRL 采用了混合控制器(Hybrid-Controller)编程模型,将两种范式的优势结合:
这种设计使得 verl 能够灵活扩展 GRPO、PPO、DAPO 等主流 RL 算法,只需少量代码即可构建训练数据流;同时无缝集成 PyTorch FSDP、Megatron-LM、vLLM、SGLang 等主流训练和推理引擎,用户无需从头适配。此外,3D-HybridEngine 实现了 actor 模型的三维重分片,消除了训练和生成阶段之间的显存冗余,显著降低了 GPU 间通信开销。
根据官方 benchmark,veRL 相比主流开源 RLHF 框架,在不同场景下实现了 1.5 倍到 20 倍的吞吐量提升。这一提升主要来自三个方面:SOTA 推理引擎集成(continuous batching、PagedAttention 等优化)、生成和训练的异步流水线 overlap 执行、以及训练和推理节点间的零拷贝数据传输。
veRL 支持 FSDP(Mixed Precision)和 Megatron 两种训练后端,以及 vLLM、SGLang、TensorRT-LLM 三种推理后端,用户可以根据硬件环境灵活选择最优组合。
verl 对硬件要求较高。官方推荐配置为 NVIDIA A100/H100(单卡 80GB 显存起步),最低也需要 RTX 3090 以上显卡。CUDA 版本要求 12.4+,Python 版本 3.10+,还需要 NCCL 和 Ray 分布式框架。
安装方式有两种:pip 直接安装或 Docker 容器。verl 提供了多套预配置的 Dockerfile,分别针对 vLLM、SGLang、TensorRT-LLM 等不同推理后端。例如 verl0.6-cu128-torch2.8.0-fa2.7.4 镜像基于 CUDA 12.8 + PyTorch 2.8 构建,开箱即用。
不过需要注意的是,verl 目前没有 Web 界面,本质上是一个命令行工具。用户需要通过 YAML 配置文件定义训练参数,典型的训练流程包括:配置训练引擎、下载预训练模型、启动 PPO/GRPO 训练。对于没有分布式 GPU 环境的研究者或个人开发者,更适合通过 Lightning AI 的托管环境或云计算平台的 GPU 集群来使用。
verl 的野心不止于文本模型的 RLHF。2026 年 5 月,团队发布了 VeRL-Omni,基于 verl 构建的统一后训练框架,支持扩散模型和多模态模型的强化学习训练。同时还开源了 Vexact:与 HuggingFace 零失配的 rollout 库,通过 batch-invariant 内核和共享模型定义,解决了 rollout 阶段的性能瓶颈。
这些动向表明 verl 正在向 Agent 训练 领域延伸——让 AI 不仅能回答问题,还能使用工具、规划任务、在真实环境中持续学习。
verl 目前的局限也比较明显:部署门槛高(需要多卡 GPU 集群)、配置复杂(调参和故障排查需要 MLinfra 经验)、文档偏向英文(中文社区资料相对较少)。此外,veRL 目前主要针对英文场景的 LLM 训练,对中文特定任务的优化程度还有待观察。
veRL 的出现,标志着大厂生产级 RLHF 框架向社区开放的一个重要节点。在此之前,类似 OpenRLHF、TRLX 等开源框架虽然可用,但在吞吐量和灵活性上始终与闭源方案存在差距。veRL 用 1.5x-20x 的性能数字,证明了开源方案同样可以达到生产级别。
更重要的是,verl 将 HybridFlow 论文中的技术细节完整地开源,这为学术界研究新型 RL 算法提供了高质量的实验平台。随着 VeRL-Omni 和 Vexact 的发布,verl 正在成为多模态和 Agent 后训练的基础设施——这个方向,恰恰是 2026 年 AI 领域最热门的赛道。
图1:veRL PPO 训练流程示意图

图1展示了 veRL 中 PPO 训练器的核心工作流程:Actor(策略模型)与 Critic(价值模型)协同训练,通过 Reward Model 获取奖励信号,由 Reference Model 维持 KL 约束,vLLM 或 SGLang 引擎负责高效的序列生成。