ProtoMotions
GPU加速的人形机器人/数字人运动学习框架,12小时训练40+小时人类动作数据
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
GPU加速的人形机器人/数字人运动学习框架,12小时训练40+小时人类动作数据
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
ProtoMotions 3:让数字人和机器人学会人类运动的开源框架
你有没有想过,迪士尼动画里的角色动作是如何做到如此自然流畅的?答案是:动作捕捉(MoCap)+ 物理仿真 + 强化学习。传统方式需要专业团队耗费数月,而 NVIDIA 的 ProtoMotions 3 正在让这一过程变得民主化——它是一个开源的 GPU 加速人形机器人/数字人训练框架,能够在 12 小时内让一个物理仿真的人形角色学会 AMASS 数据集中 40+ 小时的全身运动技能。
图1:G1 人形机器人跟踪 AMASS 动作数据
ProtoMotions 由 NVIDIA 研究院的 Chen Tessler 和 Yifeng Jiang 主导开发,核心目标是解决人形机器人运动学习中的两大痛点:数据获取成本高(传统动作捕捉需专业设备和场地)和 仿真到现实迁移困难(Sim2Sim 泛化能力弱)。该项目脱胎于 NVIDIA 在自动驾驶仿真领域积累的 Isaac Gym 平台技术,Apache-2.0 开源许可使其可以自由商用。
团队同时维护了姐妹项目 MimicKit,专注于轻量级动作模仿学习,两个项目形成了从研究到生产力的完整工具链。
ProtoMotions 3 最大的技术亮点是对多物理引擎的原生支持,这在同类开源项目中极为罕见:
这种多引擎架构的价值在于:Sim2Sim 能力。同一个训练好的策略(policy),可以在 IsaacGym → Newton → MuJoCo 之间一键切换测试,验证策略的跨引擎泛化能力,大幅减少「只在仿真里有效」的陷阱。
项目内置了丰富的 RL 算法实现:
加上 PathFollower(路径跟踪)和 Steering(转向控制)等决策模块,覆盖了从底层动作生成到高层行为规划的完整链条。
开箱即用支持:
用户还可以通过 PyRoki 绑定的逆运动学工具,将 AMASS 数据集中的任意人体动作一键重定向(Retarget)到任意机器人骨架上,只需一条命令:
python protomotions/retarget.py --robot-name=g1 --motion-file=path/to/amass.bvh
图2:G1 机器人执行精细动作(如端酒杯)
源码结构清晰,体现了高内聚低耦合的设计原则:
核心训练入口 train_agent.py(36KB)负责多 GPU 启动和数据分发,inference_agent.py(13KB)处理推理/可视化,train_slurm.py 适配 HPC 集群调度。
项目大量使用 Hydra 进行超参数管理(所有 config override 会持久化到 resolved_configs.pt),Lightning 管理多 GPU 训练,TensorDict 实现仿真状态向量化。
训练数据主要来自 AMASS(CMU、HumanEva 等 15 个 MoCap 数据集的整合),约 40 小时、1100 万帧的全身运动数据。项目还支持 SOMA-X 格式(13K motions/卡)的大规模训练。
推理阶段支持 ONNX 导出(export_bm_tracker_onnx.py),可以将训练好的策略导出为 ONNX 格式,脱离 ProtoMotions 独立运行,降低了部署门槛。
图3:真实机器人验证仿真策略的有效性
ProtoMotions 面向的是有 RL 基础的机器学习工程师和研究人员,而非普通用户。主要门槛:
硬件门槛:完整训练需要 4× NVIDIA A100 (80GB),单机推理需要 RTX 3090+。纯 CPU 模式(MuJoCo)仅供调试,训练模式必须用 GPU。
软件门槛:需要熟悉 Docker、CUDA 环境配置,以及 RL 训练的基本概念(reward shaping、PPO 超参数)。IsaacGym 和 IsaacLab 需要从 NVIDIA 官网申请 Preview 4 许可(个人/学术免费)。
数据门槛:AMASS 数据集需免费注册下载(amass.is.tue.mpg.de),G1/H1 机器人 URDF 文件约 2-5GB。
好消息是 Docker 方案(Dockerfile.newton)已经封装了 CUDA 12.4、Newton 物理引擎和所有依赖,一条命令即可构建完整环境,大幅降低了环境配置复杂度。
图4:SMPL 身体模型学习 AMASS 多样化运动技能
局限性:
行业意义:ProtoMotions 代表了具身智能(Embodied AI)领域的一个重要趋势——用 GPU 大规模并行仿真替代真实机器人训练。Figure、1X、智元等具身智能公司都在探索类似路线。该项目将这一能力开源,有望像 Stable Diffusion 对图像生成的影响一样,降低机器人运动学习的门槛,推动整个具身智能领域的发展。
从增长趋势看,人形机器人赛道持续火热(Figure 02、智元 H1、傅利叶 H1_2 等),ProtoMotions 提供的快速原型验证能力将成为研究人员和创业团队的稀缺工具,预计 star 数量将持续攀升。
图5:SOMA 格式大规模动作数据的重定向与再训练