foundation_models
深度解析 ACT/Octo/OpenVLA/Helix 等前沿 VLA 模型,覆盖模仿学习、数据集架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
深度解析 ACT/Octo/OpenVLA/Helix 等前沿 VLA 模型,覆盖模仿学习、数据集架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你走进一间工厂流水线,看到两条笨重的机械臂正在精准地完成手机组装——这不是预设程序在驱动,而是一个「大脑」在实时理解视觉信息、理解「把红色的杯子放到蓝色的碗右边」这样的自然语言指令,并将其转化为精确的关节运动。这听起来像是科幻电影,但这项技术已经真实存在,并正在以极快的速度走向成熟。Foundation Models for Manipulation(Argo-Robot/foundation_models)就是一份面向研究者和工程师的深度技术调研,系统梳理了当前最前沿的视觉-语言-动作(VLA)模型、模仿学习方法与动作表征策略。
图1:机器人 Foundation Models 全景 — 从感知到动作的技术演进路线
这个 GitHub 仓库由 Argo-Robot 团队维护,并非一个可运行代码的代码库,而是一份约 25,000 字的高质量技术综述文档。它以 ALOHA 项目的 Action Chunk Transformer(ACT)为起点,一路延伸到 Figure AI 的 Helix 双系统架构,全面覆盖了从「单任务低成本模仿学习」到「通用人形全身控制」的完整技术演进路径。对于 AI 研究者和机器人工程师而言,这份文档既是入门地图,也是进阶参考文献。
故事要从 2023 年说起。斯坦福团队发布 ALOHA(Advanced Learning for Open-Form Automation)项目,其中的核心模型 ACT(Action Chunk Transformer) 证明了用低成本的演示数据就能训练出高成功率的精细操控策略。与传统 RL 方法需要数百万步交互数据不同,ACT 只需要 10 分钟的人工遥操作演示,就能让双臂 7-DOF 机械臂达到 80-90% 的任务成功率。 ACT 的核心创新在于「动作分块」(Action Chunking)机制。传统策略学习方法一次只预测下一步动作,这种单步预测会在多步执行中产生复合误差——每一步的小偏差累积起来,最终导致任务失败。ACT 改而一次预测接下来 $k$ 步(通常 $k=100$)的完整关节轨迹,这大幅降低了误差累积效应,让机器人的动作更加平滑稳定。 ACT 的训练流程巧妙地结合了 CVAE(条件变分自编码器)架构:encoder 部分学习一个隐变量 $z$(代表动作的「风格」),decoder(也就是真正的策略网络)接收 ResNet18 提取的视觉特征加上关节状态,输出确定性动作序列。推理时 $z$ 被固定为零向量,整个策略退化为纯确定性的,降低了行为变异性,更适合精确复现。 对于爱好者的意义:ACT 让「用爱发电」式的机器人研究成为可能。你不需要价值百万的仿真集群,只需要一台 ALOHA 遥操作装置(可用 3D 打印成本自制),加上 10 分钟的演示数据,就能训练出一个能完成精细任务的机器人。这打破了「机器人研究=大实验室专属」的壁垒。
ACT 证明了模仿学习的有效性,但它的局限在于只能处理单一机器人、单一任务。真正的通用机器人策略需要跨机器人、跨任务、跨环境的泛化能力——这正是 Octo 项目的目标。Octo 由斯坦福大学、UC Berkeley 和 Google DeepMind 联合开发,是一个基于 Transformer 架构的通用机器人策略模型,训练数据来自 Open X-Embodiment 数据集中的 80 万条机器人演示轨迹。 Open X-Embodiment 数据集的规模是革命性的:它整合了来自 9 种不同机器人平台的数据,涵盖抓取、放置、工具使用、抽屉操作等多种任务类型。数据高度异构——摄像头视角不同(腕部摄像头 vs 第三方视角)、机器人自由度不同、任务描述形式不同(有的是语言指令,有的是目标图像)。Octo 通过模块化的输入 tokenizer 巧妙地处理了这种异构性:语言指令用 T5-base 编码,图像用浅层 CNN 编码,所有 token 拼接后统一送入 Transformer backbone,输出通过 diffusion-based action head 生成动作块。 Octo 最重要的设计创新在于模块化适应能力:在下游微调时,可以新增传感器、新增机器人形态、新增输出头,而完全不需要修改预训练好的 Transformer 权重。这对于实际部署意义重大——你不需要为每种新机器人重新从零训练一个策略,只需在预训练模型上嫁接一个新的 adapter。
在 Octo 的基础上,OpenVLA 迈出了更激进的一步:直接复用大语言模型(LLM)的架构和预训练知识,将其变成机器人的「大脑」。OpenVLA 拥有 70 亿参数,基于 LLaMA 2 语言模型,结合 DINOv2 + SigLIP 双视觉编码器,在 97 万条真实机器人演示 上微调而来。
图2:OpenVLA 的 Vision-Language-Action 架构 — 视觉编码器融合 LLaMA 2 推理能力
OpenVLA 的工作方式非常直观:输入一张 RGB 图像和一条自然语言指令(如「把苹果放到碗里」),模型将视觉 token 和语言 token 拼接后送入 LLaMA 2,autoregressive 地生成 tokenized 的动作序列。这种「用 LLM 生成动作」的设计天然继承了 LLM 的泛化能力——模型能理解「把蓝色的杯子放到红色盘子的左边」这样的长程空间关系描述,这在纯视觉策略中是非常难以表达的。
给开发者的启发:OpenVLA 的开源性质(Apache 2.0 许可证)使其成为目前最容易获取的高性能 VLA 基础模型。你可以直接从 HuggingFace 下载预训练权重,在自己的机器人上用 LoRA 微调。文档中详细对比了四种微调策略:Full Fine-tuning(最高计算成本)、Last Layer Only(成本低但效果差)、Sandwich Fine-tuning(平衡之选)以及 LoRA(强烈推荐——仅更新 1.4% 的参数就能达到接近全量微调的效果)。
Figure AI 的 Helix 是这份综述中最前沿的技术代表。它解决了人形机器人面临的一个核心矛盾:低速语义理解(System 2)和高速运动控制(System 1)之间的频率不匹配。人类的运动控制系统天然具有这种分层结构——快系统负责本能反应(伸手抓取),慢系统负责规划推理(决定去哪里抓)。Helix 将这种双系统思想引入 VLA 架构:
图3:Helix 的 System 1/2 双系统架构 — 慢系统做语义理解,快系统做 200Hz 实时控制
文档中对三种主流动作表征方法进行了严谨的数学对比:
| 方法 | 核心思想 | 优势 | 局限 | 代表模型 |
|---|---|---|---|---|
| MSE 回归 | 直接用 MSE 回归预测下一个动作 | 训练稳定,推理快 | 无法建模多模态分布 | ACT |
| 离散化 | 将连续动作空间划分为 K 个 bin,作分类问题 | 支持多模态预测 | 量化误差,行为粗糙 | RT-2 |
| Diffusion | 用 diffusion 模型生成动作块 | 建模连续多模态分布,质量高 | 推理延迟(需多步去噪) | Octo, Diffusion Policy |
| Diffusion 方法正在成为主流,因为它能同时解决多模态问题(MSE 和离散化各只能解决一个)和精度问题(离散化有量化误差)。Octo 和 Diffusion Policy 都采用了 chunked action prediction(每次预测一个动作块),结合 diffusion 的高质量生成能力,大幅提升了复杂任务的成功率。 |
这份文档的技术价值在于它不仅描述了各个模型,还梳理了它们之间的演进关系和取舍权衡。以下几个关键洞察对实际工作最有指导意义: 1. 数据是核心瓶颈:几乎所有 SOTA 模型的成功都建立在超大规模演示数据之上(80 万到 970 万条轨迹)。模型架构固然重要,但数据集的质量和规模往往决定了性能上限。这也是为什么 Open X-Embodiment 数据集被认为是机器人领域最接近 ImageNet 级别的里程碑。 2. 动作表征决定了上限:MSE 方法简单但限制了表达能力;离散化虽然支持多模态但损失精度;Diffusion 是当前最优解,但推理延迟仍是挑战。如果你在设计自己的策略,动作表征的选择是第一个要做的关键决策。 3. 预训练+微调是主流范式:从 Octo 到 OpenVLA,所有通用策略模型都遵循「大规模预训练 + 轻量微调」的路线。对于资源有限的团队,最优策略是选择一个预训练好的模型(如 OpenVLA),用 LoRA 在自己的小数据集上微调。 4. 硬件成本在快速下降:ALOHA 项目的成功证明,低成本硬件(3D 打印的遥操作装置 + 市售机械臂)完全足以支撑有意义的研究。这让更多个人研究者和小型团队参与到这场技术革命中。
尽管技术进展迅猛,这份文档也隐含地揭示了当前领域面临的核心挑战: Sim-to-Real 鸿沟:大多数模型在仿真环境中训练,如何高效迁移到真实机器人仍是开放问题。物理属性(摩擦力、接触刚度、传感器噪声)的差异会导致策略失效。 长程任务规划:当前 VLA 模型在短程技能执行上已经相当可靠(如「拿起杯子」),但在需要多步规划的长程任务(如「做饭」)上仍然脆弱。Helix 的双系统架构是一个有前景的方向,但尚未完全解决这一问题。 安全与对齐:当机器人开始理解自然语言指令并执行物理动作时,一个错误的指令可能导致物理损害。如何建立有效的安全机制和 human-in-the-loop 审核流程,是未来必须面对的问题。
| 维度 | 评估 |
|---|---|
| 项目类型 | 纯技术调研文档(非可运行代码) |
| 内容深度 | 极高(覆盖 5 个 SOTA 模型 + 3 种动作表征方法) |
| 受众覆盖 | 研究者(学术引用完整)+ 工程师(实践指南详尽) |
| 时效性 | 截至 2024-2025 年初,覆盖最新 VLA 进展 |
| 维护活跃度 | 低(无代码更新,但文档内容完整稳定) |
| 适用场景 | 技术调研入门 / 论文写作参考 / 工程选型依据 |