LW-BenchHub
NVIDIA Isaac Lab 上的具身智能Benchmark平台,支持7种机器人268项任务的全链路评测
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NVIDIA Isaac Lab 上的具身智能Benchmark平台,支持7种机器人268项任务的全链路评测
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你训练了一个机器人抓取厨房里的水壶,在仿真环境中,它的成功率高达 95%——但当它真的走进现实厨房时,却连一个抽屉都打不开。这不是模型的错,而是**仿真与现实之间的巨大鸿沟(Sim-to-Real Gap)**在作祟。LW-BenchHub 正是为了解决这个问题而诞生的。

图1:LW-BenchHub 构建了10种厨房布局与10种装修风格的组合,提供100种独特配置,高保真资产通过 Lightwheel SDK 实时加载
通用语言模型的评测有 MMLU、Harness,但机器人领域的评测长期处于碎片化状态。不同研究团队使用不同的仿真器(MuJoCo、Isaac Sim、RaiSim)、不同的任务定义、不同的机器人型号,导致"论文结果很好,但换了环境就崩"的困境。
Lightwheel 团队(专注具身智能基础设施的公司)认为,一个成熟的机器人 Benchmark 必须同时满足三个条件:(1)仿真环境足够逼真;(2)任务定义统一可复现;(3)能够支持从数据采集→策略训练→评测的完整闭环。LW-BenchHub 就是这个理念的实现。
该项目在 GitHub 上已获得 176 颗星,有 9 个 open issues,表明社区正在活跃地使用和改进这一平台。
LW-BenchHub 支持 7 种适配后的机器人类型,共 27 个具体变体,包括:
这种多机器人覆盖的意义在于:同一个任务可以在不同机器人上评测,评估策略的跨实体迁移能力——这正是具身智能走向通用化的关键指标。
项目支持多种输入设备进行真实演示数据采集:
采集的数据以 HDF5 格式保存,包含关节状态、动作序列和多视角相机图像。采集到的数据直接喂入 Imitation Learning 或 RL 训练流程,真正做到了数据不出仿真环境,直接用于训练。
任务体系分为两大类:
每个任务都精确定义了成功标准(Success Criteria)、相关资产控制和物品放置规则,确保不同实验、不同实验室之间的结果可严格对比。
LW-BenchHub 提供了一套完整的 RL 训练框架,无缝集成两大开源 RL 库:
训练配置通过 装饰器绑定机制(Decorator-based Binding) 实现模块化注册:同一种 RL 算法配置,通过改变装饰器参数就可以切换到不同的机器人和任务上。这种设计大幅降低了"换机器人调参"的工程成本。
这是 LW-BenchHub 最具技术含量的设计之一。项目采用 Server-Client 架构:策略执行(Policy Server)和仿真环境(Simulation Client)完全解耦,通过 零拷贝数据交换(Zero-Copy Data Exchange) 进行通信。
零拷贝的意义在于:避免了 Python 对象序列化/反序列化的开销,实现了超低延迟、高吞吐的策略-仿真交互。这对于需要实时控制的机器人场景至关重要。
项目发布了 21,500 个演示片段(episodes),覆盖:
数据集托管在 HuggingFace(LightwheelAI/datasets),可直接下载使用。
LW-BenchHub 底层基于 NVIDIA Isaac Lab(Isaac Sim 的机器人仿真层),这是目前学术界最接近工业级的机器人仿真平台。相比 MuJoCo,Isaac Lab 提供了:
作为对比,HomebrewHW-Bench 和 RoboMABench 这类竞品通常基于 IsaacGym,性能上限较低。
项目采用模块化设计,核心模块包括:
| 模块 | 功能 |
|---|---|
lw_benchhub.core.scenes | 仿真场景生成与管理 |
lw_benchhub.core.robots | 机器人控制与模型加载 |
lw_benchhub.core.tasks | 任务定义与成功判定逻辑 |
lw_benchhub.core.simulators | 仿真器底层封装 |
lw_benchhub_rl | RL 算法实现与训练脚本 |
lw_benchhub_tasks | 具体任务规格定义 |
policy/ | 策略算法(GR00T、PI 等) |
坦白说,LW-BenchHub 不是给普通开发者准备的。安装过程需要:
install.sh 编译 IsaacLab 等子模块git lfs pull 下载大型仿真资产官方提供了 Dockerfile 简化依赖安装,但完整的 Isaac Sim 仍需商业许可。
对于有硬件条件的研究者/工程师,典型使用流程为:
# 1. 配置遥操作环境,采集演示数据
python ./lw_benchhub/scripts/teleop/teleop_main.py --task_config pandaomron
# 2. 回放验证数据质量
python ./lw_benchhub/scripts/teleop/replay_demos.py --dataset_file "/path/to/dataset.hdf5"
# 3. 开始 RL 训练
bash train.sh # 默认使用 LiftObj 任务
# 4. 评测训练好的策略
bash eval.sh
整个流程有完整的配置文件支撑(configs/ 目录下),调参不需要改代码,只改 YAML 配置即可。
Isaac Sim 许可壁垒:这是最大的门槛。Isaac Sim 是 NVIDIA 商业产品,虽然有学术许可,但限制了项目的开源可复现性。
硬件要求极高:需要 NVIDIA RTX GPU(建议有 RTX 3090/4090 或更高)才能流畅运行,光线追踪更是显存杀手。
安装复杂度:子模块、Git LFS、环境编译依赖链较长,即使是经验丰富的工程师也可能遇到坑。
任务偏向厨房场景:268 个任务虽然不少,但主要聚焦厨房操作和桌面操作,对其他场景(如户外、工厂)的覆盖有限。
Python 3.11 硬性要求:限制了与旧有 Python 生态的兼容性。
LW-BenchHub 的出现代表了具身智能 Benchmark 领域的一个重要方向:从单一任务评测走向完整Pipeline评测。
过去几年的趋势是:CALVIN、Benchmark-ALK、RLBench 等项目逐步建立了任务评测标准。而 LW-BenchHub 的独特贡献在于:
随着 Figure、1X、宇树等公司加速人形机器人商业化,这类统一 Benchmark 的需求只会越来越大。LW-BenchHub 的设计思路——统一仿真器 + 多机器人 + 完整Pipeline——很可能成为未来具身智能研究的标准基础设施之一。
总结:LW-BenchHub 是面向具身智能研究者的专业级仿真评测平台,底层基于 NVIDIA Isaac Lab,提供从遥操作数据采集到 RL 训练的全链路支持。适合有高性能 GPU 和 Isaac Sim 许可的实验室使用,不适合普通开发者或爱好者快速部署体验。