SimpleVLA-RL
首个开源 VLA 强化学习训练框架,通过 RL 让机器人从「背诵动作」升级为「自主探索」,冷启动性能提升 430%
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个开源 VLA 强化学习训练框架,通过 RL 让机器人从「背诵动作」升级为「自主探索」,冷启动性能提升 430%
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:SimpleVLA-RL 项目 Logo
想象一下:你花了一整天教机器人学会「把杯子从桌子左侧挪到右侧」,结果第二天换个桌子、换个杯子,它就彻底懵了——这不是段子,而是当前视觉-语言-动作模型(VLA)在机器人领域真实面临的困境。传统监督微调(SFT)就像让学生背答案,换了新题就抓瞎。
SimpleVLA-RL(ICLR 2026 论文)给出的解法很直接:别背答案了,做题。引入强化学习(RL),让机器人在仿真环境中自主探索、试错、迭代,最终获得真正的泛化能力。
VLA 是当前机器人领域最热门的模型范式之一:输入图像帧 + 语言指令,输出机器人控制动作。OpenVLA、RT-2 等模型已经展示了令人印象深刻的效果,但它们的通病是依赖大规模监督微调数据——收集成本极高,且模型容易陷入「数据陷阱」:只能在见过类似场景的任务上表现良好。
SimpleVLA-RL 由清华大学、智谱 AI 等机构的研究者提出,核心动机是:用强化学习打破数据瓶颈,让 VLA 在稀缺数据下也能习得强泛化能力。作者发现了一个有趣现象——RL 训练中模型会自发涌现「pushcut」行为(推切动作),即学会将长程任务分解为更短、更精准的子动作来完成,这是 SFT 完全无法产生的行为。
项目于 2025 年 5 月开源,2025 年 9 月发布论文,2026 年 1 月宣布已成功将 RL 训练迁移到真实机器人,在灵巧手长程任务上取得约 300% 的性能提升。
SimpleVLA-RL 构建于字节跳动 veRL 分布式训练框架之上,针对 VLA 模型做了深度适配。它支持两条主流仿真基准路线:
LIBERO 基准(居家/办公场景机器人任务):
RoboTwin 2.0 基准(双臂机器人场景):
关键创新包括:
项目采用三层架构设计:
底层:veRL 分布式引擎
位于 verl/ 目录,源自字节跳动开源的高效 RL 训练框架。核心模块包括:
trainer/main_ppo.py:PPO 训练入口,Ray 集群初始化trainer/ppo/ray_trainer.py:主训练循环——数据加载、VLA rollout、策略更新、验证、检查点保存workers/fsdp_workers.py:FSDP 分布式训练 worker,整合模型初始化、序列生成、熵计算、策略更新workers/rollout/rob_rollout.py:VLA rollout 实现——创建仿真环境、批量并行渲染、VLA 动作生成、与环境交互、轨迹收集utils/dataset/rob_dataset.py:LIBERO / RoboTwin 数据集接口utils/vla_utils/:VLA 模型(OpenVLA / OpenVLA-OFT)封装中层:VLA 特化适配
workers/actor/dp_rob.py:VLA 策略梯度计算——对数概率计算、熵计算、策略更新modified_codes/robotwin2/:RoboTwin 2.0 环境的适配 patchprotocol.py:分布式通信协议定义上层:运行脚本
examples/run_openvla_oft_rl_libero.sh:LIBERO 基准训练脚本examples/run_openvla_oft_rl_twin2.sh:RoboTwin 2.0 基准训练脚本训练脚本接受参数:WandB API Key、实验名称、SFT 模型路径、检查点保存路径、数据集名称、GPU 数量、节点数量。

图2:SimpleVLA-RL 框架总览,展示 VLA 模型如何通过 RL 在仿真环境中学习
从工程维度看,SimpleVLA-RL 具备以下特点:
优势:
局限:

图3:SimpleVLA-RL 在 LIBERO 基准上的核心实验结果,显著超越 SFT 基线
论文核心实验结果(在 LIBERO 基准,OpenVLA-OFT 模型):
| 场景 | SFT 基线 | SimpleVLA-RL | 提升 |
|---|---|---|---|
| LIBERO-Long | — | 97.6 | SOTA |
| 单轨迹冷启动(libero-10) | 17.3 | 91.7 | +74.4 (+430%) |
最令人震惊的是冷启动场景:仅用 1 条轨迹的 SFT 数据作为起点,RL 训练后性能从 17.3 飙升至 91.7,提升超过 4 倍。这说明 RL 能在极少量人类示范数据的基础上,自主探索出高效的策略。
团队还在真实机器人上验证了方案:2026 年 1 月宣布在灵巧手长程任务上,RL 训练的模型相对 SFT 基线取得了约 300% 的性能提升,并展现了意外的自恢复(auto-recovery)能力——当任务执行出现偏差时,模型能自主纠偏。项目已在 HuggingFace 上的 SimpleVLA-RL Collection 发布预训练 SFT 模型。
硬件门槛制约广泛使用:8 卡 A800 80GB 的要求意味着大多数研究团队无法在本地复现,严重限制了项目的学术影响力。
仿真-真实迁移鸿沟:尽管已在真机上验证,仿真环境和真实物理世界的差异仍是 Robotics RL 领域的公认难题,当前结果能否泛化到更多任务类型尚待验证。
VLA 模型支持有限:目前仅支持 OpenVLA 和 OpenVLA-OFT,对扩散策略(pi0/pi0.5)、其他 VLA 架构的支持还在 roadmap 中。
分布式训练的复杂性:FSDP + Ray 的分布式训练对工程能力要求较高,SETUP.md 中多次提到依赖版本冲突问题,新手容易踩坑。
SimpleVLA-RL 的核心价值不在于某一个具体 benchmark 的分数,而在于验证了一个重要假设:强化学习可以成为 VLA 泛化能力的催化剂。
长期以来,机器人领域的 VLAs 依赖海量的监督数据,数据收集成本是阻碍技术落地的最大瓶颈。SimpleVLA-RL 证明,仅需极少量轨迹数据作为冷启动,RL 就能让 VLA 自发涌现出超越 SFT 的长程规划和空间泛化能力——包括那个被研究者称为「pushcut」的推切动作现象。
从技术趋势看,这条路线正在形成新的研究范式:Physical Intelligence 的 pi0 系列、Google 的 RT-2、清华的 PRIME 系列都在向「RL + VLA」方向收敛。SimpleVLA-RL 作为首个开源的完整 VLA-RL 训练框架,降低了这个方向的复现门槛,对推动机器人具身智能研究具有重要价值。