MobileVLA-R1
首个将 GRPO 强化学习引入四足机器人 VLA 控制,支持多模态推理链(RGB+深度+点云)
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个将 GRPO 强化学习引入四足机器人 VLA 控制,支持多模态推理链(RGB+深度+点云)
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象这样一个场景:你对着一台四足机器人说"去帮我把书房的笔记本拿过来",它不需要你画地图、不需要你提前建模,只需要理解你的自然语言指令,就能自己判断走哪条路、绕开障碍物、把东西稳稳地叼回来——这就是 MobileVLA-R1 想要解决的问题。
ECCV 2026 接收的这篇论文,来自 AIGeeksGroup 研究团队,给出了目前四足机器人视觉-语言-动作(VLA)控制领域最完整的解决方案之一:通过强化学习让视觉-语言模型真正"学会"控制物理世界。
机器人控制领域有个经典难题:语义理解和物理执行之间的鸿沟。你告诉机器人"往前走两步然后左转",它能听懂;但你说"去客厅把茶几上的杯子拿过来",它就懵了——因为这需要:
现有的 VLA(Vision-Language-Action)方法在自然语言理解上已经很强,但一到连续动作控制,要么推理不稳定,要么泛化能力差,真实机器人上一跑就露馅。
MobileVLA-R1 的核心思路是先用思维链(CoT)让模型"想清楚",再用强化学习让它"做到位",分为两阶段训练:
团队构建了 MobileVLA-CoT 数据集,包含 38K 条多粒度思维链标注的具身轨迹数据。每条数据包含:
在训练时,输入不是简单的"图像+文字",而是图像 + 深度 + 点云三路融合,让模型同时理解"看到了什么"和"距离有多远"。
思维链的作用在这里尤为关键:模型不只是输出"往前走",而是要输出推理过程——"检测到前方2米处有障碍物,需要向左绕行,步态切换为小步慢速"。这种结构化的中间推理,显著提升了控制的稳定性和可解释性。
SFT 之后,模型已经具备基本的推理-控制能力,但还不够"细腻"。团队引入了 GRPO(Group Relative Policy Optimization) 强化学习方法,通过生成-评估的迭代循环进一步优化策略:
整个 GRPO 训练流程完全基于真实的室内导航数据(Nav_CoT JSONL),在VLN(视觉语言导航)和 VLA(视觉语言动作)两个任务上验证,相比强基线方法提升约 5%。
代码架构上,项目基于 VILA(On Pre-training for Visual Language Models)框架,核心推理类为 NaVILAImageInference,其工作流程如下:
输入: 自然语言指令 + RGB图像 + 深度图 + 点云
↓
多模态编码: Qwen2-VL-7B 视觉编码器 + 深度/点云专用编码器
↓
融合层: 图像 token 与文本 token 拼接输入 LLM 主干
↓
推理链 (CoT): 生成结构化推理文本
↓
动作解码: 从推理文本中提取连续动作参数
↓
输出: 机器人控制指令
训练侧采用 DeepSpeed ZeRO-3 分布式策略,配合 FlashAttention-2.5.8 加速,LoRA rank 可配置。推理侧支持 Gradio Web UI(pyproject.toml 中 gradio==3.35.2),但模型加载依赖 Qwen2-VL-7B 基座 + LoRA 权重,需从 HuggingFace 下载。
从工程实现来看:
| 维度 | 评价 |
|---|---|
| 代码组织 | 模块化清晰,llava/ 目录封装了模型核心,scripts/ 分离训练脚本,evaluation/ 处理评测 |
| 技术栈深度 | PyTorch 2.3 + Transformers 4.37.2 + PEFT + DeepSpeed + FlashAttention,工程量级较高 |
| 数据准备 | 提供了完整的环境配置脚本 environment_setup.sh,但数据集(MobileVLA-CoT、Matterport3D)需自行下载准备 |
| 测试覆盖 | 有 test_remote.py,但未见单元测试目录,测试覆盖率较低 |
| 文档质量 | README 完整,包含数据准备、训练、推理全流程,有预训练权重和数据集链接 |
| 安全问题 | 无明显安全漏洞,代码未涉及外部网络请求或敏感操作 |
代码质量综合评分:75/100(工程量大、文档完善,但测试覆盖不足)。
部署难度是该项目最明显的短板。由于依赖 Qwen2-VL-7B(7B 参数),加上多模态融合需求(深度图 + 点云),最低需要 24GB 显存的 GPU(RTX 3090 及以上),且必须配置 CUDA 12.2 环境。
安装流程:
整个过程对没有大规模模型训练经验的开发者不太友好,且目前没有 Docker 一键部署方案,是纯研究向的代码仓库。
亮点:
局限:
MobileVLA-R1 属于当前具身智能(Embodied AI)研究浪潮中的代表性工作。随着 VLM(视觉语言模型)能力的快速提升,如何将其"落地"到真实的物理控制任务是下一阶段的核心命题。GRPO 相比 PPO 更加 sample-efficient,适合数据稀缺的具身场景,MobileVLA-R1 在这方面提供了一个有价值的实践参考。
从增长趋势看,该项目 2025 年 11 月开源,目前 star 增速平稳。作为 ECCV 2026 论文的配套代码仓库,其学术价值大于工程实用价值——如果你是做具身智能、视觉语言导航(VLN)或 VLA 的研究者,这个仓库值得细读;如果你是想快速部署一个对话机器人的开发者,它目前还不太适合你。