giga-brain-0
世界模型驱动的机器人视觉-语言-动作(VLA)基础模型,通过合成数据降低真实数据依赖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
世界模型驱动的机器人视觉-语言-动作(VLA)基础模型,通过合成数据降低真实数据依赖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你在家里对机器人说"把桌上的咖啡杯放到水槽里",一个机器人立刻理解了你的意图——不仅识别了咖啡杯的位置,还理解了水槽在哪里、杯子需要绕过哪些障碍物。更重要的是,它能在完全陌生的厨房环境中完成这个任务,甚至能处理你从未演示过的物品摆放方式。这听起来像科幻,但 GigaBrain-0 正在让这件事变得真实。
痛点切入: 传统 VLA 模型的训练极度依赖真实机器人数据——每一小时的真实机械臂操作数据都需要专业团队耗费数周时间精心采集。这种数据瓶颈严重限制了 VLA 系统的规模化发展和跨任务泛化能力。高昂的数据成本让学术界和中小企业几乎无法参与这场机器人 AI 革命。
GigaBrain-0 给出了创新答案:它引入了世界模型(World Model)生成数据引擎。简单来说,世界模型就像一个"物理模拟器",能根据物理规律生成大量高质量的机器人操作数据——包括不同光照下的场景、不同形状的物体、不同的机械臂姿态组合。研究团队只需约 1000 小时真实机器人数据作为种子,世界模型就能"想象"出数十倍于此的多样化训练场景。这种"小样本启动 + 大规模生成"的范式,大幅降低了数据采集成本,同时显著提升了模型在陌生环境中的泛化能力。

图1:GigaBrain-0 系统概览——世界模型驱动的 VLA 训练框架
GigaBrain-0 的核心创新还体现在具身 Chain-of-Thought(CoT)推理机制。不同于传统端到端 policy 网络直接输出动作,GigaBrain-0 在执行过程中会先进行空间几何推理:理解物体的相对位置、评估物体状态(如"杯子是满的还是空的")、规划长时序操作步骤(如"先抓取、再搬运、最后放下")。这种"先思考再行动"的推理模式,让机器人能更好地处理需要多个步骤的复杂任务,比如整理桌面、收拾房间这类涉及多物品的操作序列。
在数据层面,GigaBrain-0 训练数据包含约 1000 小时真实机器人操作(涵盖 AgileX Cobot Magic 和 Agibot G1 等多种机械臂平台),再辅以世界模型生成的百万级合成数据。GigaBrain-0.1 版本更是将数据规模扩展至 10 小时,训练数据组成如{img_data} 所示。

图2:GigaBrain-0.1 的训练数据组成
面向开发者: 从代码结构来看,GigaBrain-0 构建于三个自研基础设施之上:
项目采用 LeRobot 数据格式作为标准数据交换格式,这一选择使得 GigaBrain-0 能方便地与 Hugging Face 生态系统对接。训练时,数据通过 scripts/compute_norm_stats.py 计算状态和动作的均值/标准差,然后送入 giga_brain_0.GigaBrain0Trainer 进行分布式训练。
代码架构遵循模块化设计原则:
giga_brain_0/giga_brain_0_transforms.py:数据预处理和归一化变换giga_brain_0/giga_brain_0_loss.py:定制的训练损失函数giga_brain_0/giga_brain_0_trainer.py:核心训练循环实现scripts/inference.py:推理脚本,支持单图/视频输入、动作预测输出代码质量方面,项目提供了完整的环境配置(setup.cfg 包含 isort/black/flake8/codespell 配置)、pre-commit hooks,以及详细的配置管理系统。文档质量极高——包含完整的安装指南、快速开始文档、多硬件平台(AgileX/Agibot)的配置示例。

图3:GigaBrain-0 完整架构——从 RGBD 输入到具身 CoT 推理再到动作输出
项目还提供了两篇技术报告(存储于 tech_report/ 目录),详述了从零训练和微调的完整流程。对于想深入理解 VLA 训练细节的研究者来说,这些报告比 README 更具参考价值。
从技术栈角度,GigaBrain-0 基于 PyTorch 2.x 构建,依赖 ONNX/TensorRT 用于推理优化,支持 Python 3.11+。训练过程需要 NVIDIA GPU(建议 16GB+ VRAM,如 RTX 3090 或 A100)。
RoboChallenge 夺冠: GigaBrain-0.1 在 RoboChallenge 真实机器人挑战赛上斩获第一名,测试任务覆盖纸巾盒准备、杯子分拣、多物体搬运等日常家务场景。这些任务的特点是:任务目标看似简单,但机器人在完全陌生的家庭环境中执行时,需要处理未曾见过的家具布局、光照条件和物体摆放。
从性能曲线可以看到,GigaBrain-0.1 相比 GigaBrain-0 在所有真实机器人任务上都有显著提升,尤其在复杂长时序任务上与 $\pi_{0.5}$ 性能相当。关键在于世界模型生成数据的多样性——它让模型见过"各种可能的失败方式",因此真正部署时能更好地规避错误。

图4:GigaBrain-0.1 在各真实机器人任务上的性能对比

图5:GigaBrain-0.1 获得 RoboChallenge 2026 真实机器人挑战赛第一名

图6:GigaBrain-0 在多种操作任务上的泛化能力测试
尽管 GigaBrain-0 取得了令人瞩目的成绩,但我们需要客观看待其局限:
1. 数据依赖门槛依然存在。 虽然世界模型降低了部分数据成本,但约 1000 小时的真实机器人种子数据对普通研究团队来说仍然是一道不低的门槛。更重要的是,世界模型本身的质量直接决定了生成数据的有效性——如果世界模型存在物理模拟偏差,生成数据中的错误也会被 VLA 学进去。
2. 推理速度瓶颈。 VLA 模型的推理通常涉及多模态大语言模型前向传播,在边缘设备上实时运行仍具挑战。GigaBrain-0 目前仅提供了基于 Hugging Face Diffusers 的推理管道,尚不支持实时的端到端控制频率(通常需要 10-30Hz)。
3. 物理接触任务表现存疑。 从公开的 benchmark 来看,GigaBrain-0 在需要精确力控的任务(如插拔 USB 线、拧螺丝)上的表现仍有提升空间。这类任务对触觉感知的要求更高,RGBD 视觉输入的信息量可能不足以支撑精细力控决策。
GigaBrain-0 的开源意义远超模型本身。它代表了一种新的 VLA 训练范式——用世界模型来弥补真实数据的不足,这一方向如果得到验证,将从根本上改变机器人 AI 的数据供给模式。
GigaAI 团队还宣布将于 CVPR 2026 举办 GigaBrain Challenge 2026,包含 RoboTwin(仿真)、GigaWorld(世界模型)和 RoboChallenge(真实机器人)三条赛道。这为学术界和工业界提供了统一的评估基准,有助于推动 VLA 领域的可复现研究。
总体而言,GigaBrain-0 是一款面向研究型开发者的机器人 VLA 训练框架,上手需要一定 ML/机器人背景,但它提供的世界模型数据生成范式和完整的训练-推理 pipeline,为机器人 AI 研究者提供了极具价值的参考起点。