BEHAVIOR-1K
斯坦福大学推出的1000种家庭日常活动具身AI仿真基准平台,集成OmniGibson GPU加速物理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
斯坦福大学推出的1000种家庭日常活动具身AI仿真基准平台,集成OmniGibson GPU加速物理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:清晨七点,你让一台机器人去厨房帮你准备早餐。它需要打开冰箱、取出鸡蛋、打着煤气灶、用锅铲翻动煎蛋——这一系列在我们看来毫不费力的动作,对一台机器人来说,却涉及视觉感知、物体操作、任务规划、力反馈调节等几十项能力的协同。
斯坦福视觉与学习实验室(Stanford VL)推出的 BEHAVIOR-1K 正是为解决这一类问题而生的基准测试平台。它以「1000种家庭日常活动」为测试场景,让机器人在高度仿真的虚拟环境中完成从「擦桌子」到「清理泳池」的真实任务,从而系统性地评估和推进具身智能(Embodied AI)的研究进展。
BEHAVIOR-1K 的诞生并非一蹴而就。项目起源于斯坦福大学 C. Karen Liu 和 Jiajun Wu、Li Fei-Fei 团队联合推动的 BEHAVIOR 计划。第一代 BEHAVIOR-100 于2020年发布,定义了100种日常活动任务。而 BEHAVIOR-1K 则将规模扩展了10倍,覆盖1000种活动,涵盖烹饪、清洁、收纳、整理、维修等真实家庭场景——每一种活动都经过真实人类时间使用调查数据筛选,确保任务具有现实意义。
论文发表在arXiv(arXiv:2403.09227),作者列表包含超过30位研究者,横跨斯坦福、卡内基梅隆、MIT 等顶尖机构。项目的官方网站(behavior.stanford.edu)提供了详细文档和基准排名。
BEHAVIOR-1K 的底层仿真引擎是 OmniGibson,一个基于 NVIDIA Isaac Sim(即 Omniverse 平台)的 GPU 加速物理仿真框架。相比于传统的 CPU 仿真(如Mujoco、PyBullet),OmniGibson 能够处理更复杂的家庭场景几何、更密集的物体交互,以及更真实的材质物理属性。
OmniGibson 的核心设计采用插件化架构,通过注册表机制动态加载各类组件:
在 OmniGibson/omnigibson/__init__.py 中,所有模块通过统一导入接口暴露,形成了一个干净的分层架构:
from omnigibson.controllers import REGISTERED_CONTROLLERS
from omnigibson.envs import Environment, VectorEnvironment
from omnigibson.objects import REGISTERED_OBJECTS
from omnigibson.robots import REGISTERED_ROBOTS
from omnigibson.sensors import ALL_SENSOR_MODALITIES
from omnigibson.tasks import REGISTERED_TASKS
这种设计使得 OmniGibson 本身就是一个通用的具身AI仿真平台,而不仅限于 BEHAVIOR 基准测试。
为了让1000种任务能够被机器理解,BEHAVIOR-1K 设计了 BDDL(Behavior Domain Definition Language)——一种基于谓词逻辑的任务描述语言。BDDL 受 PDDL(经典规划领域定义语言)启发,但针对物理仿真环境做了扩展。
一个典型的 BDDL 任务定义包含三个部分:
:objects:场景中的物体列表及其语义类别(如 pool.n.01_1 - pool.n.01):init:初始状态,用一阶谓词描述(如 inside(scrub_brush.n.01_1, shelf.n.01_1)):goal:目标状态,用逻辑表达式描述(如 (and (on(scrub_brush.n.01_1, floor.n.01_1)(not (inside(scrub_brush.n.01_1, shelf.n.01_1))))这种声明式任务描述的好处是:同一个任务可以无缝切换不同的仿真引擎实现,也为自动化任务生成和大规模任务库扩展提供了可能。
BEHAVIOR-1K 不仅是一个仿真平台,还包含真实机器人数据采集框架 JoyLo。JoyLo 使用 7 DoF 的 R1-Pro 机器人和 Nintendo JoyCon 手柄进行遥操作数据收集——用户通过 JoyCon 控制真实机器人执行任务,同时记录所有传感器数据和关节状态。
JoyLo 的代码库中包含了完整的 udev 规则配置和蓝牙设置指南,支持 USB 和蓝牙双模式连接 Pro Controller。采集的数据支持 HDF5 和 LeRobot 两种格式导出,可以直接用于模仿学习和强化学习训练。
BEHAVIOR-1K 的安装流程极其复杂,这是其最大的使用门槛。项目提供了 setup.sh 脚本支持模块化安装,但实际依赖链极长:
OmniGibson → Isaac Sim (NVIDIA闭源) → CUDA 12.8 → PyTorch 2.7.0
数据集 → 需接受 BEHAVIOR Data Bundle EULA + NVIDIA Isaac Sim EULA
加密数据 → 仅限 OmniGibson 内部使用,禁止提取
Primitives支持 → 需 nvcc 编译自定义 CUDA 算子
Dockerfile 提供了容器化方案,基础镜像为 nvcr.io/nvidia/base/ubuntu:noble-20250619,包含了完整的 Isaac Sim 环境。但实际运行仍需要 NVIDIA GPU 和驱动支持。
项目还提供 GPU 资产下载接口(download_omnigibson_robot_assets())和 BEHAVIOR-1K 场景资产下载(download_behavior_1k_assets()),单个数据集可达数十GB。
BEHAVIOR-1K 的最大局限在于其封闭的生态依赖。Isaac Sim 是 NVIDIA 的商业闭源产品,虽然通过 pip 可以简化安装,但用户必须接受 NVIDIA EULA,且 Isaac Sim 的内部机制对用户完全不透明。数据集经过加密处理,禁止提取和逆向工程,这意味着研究者无法查看或修改底层3D模型。
此外,由于 GitHub 仓库内的大文件(图片资产可达数MB到数GB),部分 GH API 请求会超时,contents API 返回空列表,需要通过 git trees API 或直接文件 API 绕行。
BEHAVIOR-1K 的发布反映了具身智能研究从「单一任务」向「大规模多样化任务」演进的趋势。1000种家庭活动的规模已经接近真实人类日常的复杂度,而 GPU 加速的物理仿真则让大规模强化学习训练成为可能。
结合 JoyLo 的真实机器人数据采集能力,BEHAVIOR-1K 正在构建一条从「仿真训练 → 域迁移 → 真实部署」的完整管线——这是具身智能走向实用化的关键一步。
图注:BEHAVIOR-1K 覆盖的家庭活动类型涵盖清洁、烹饪、收纳、维修等真实场景,每种活动由 BDDL 精确描述初始状态和目标状态。