Humanoid-GPT
首个 GPT 风格人形机器人运动 Transformer,2B 帧预训练实现零样本动作追踪泛化
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个 GPT 风格人形机器人运动 Transformer,2B 帧预训练实现零样本动作追踪泛化
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:一个 29 自由度的人形机器人 G1,正看着你做瑜伽。它不需要你喂给它任何数据,只要盯着你的动作——通过几个光学追踪点——就能实时复现出你的一招一式,从手臂弧度到脚跟着地,重建误差控制在厘米级以内。这就是 Humanoid-GPT 正在做的事:让机器人学会「看懂」人类运动,并通过强化学习的策略网络,将动作迁移到真实机器人上。
Humanoid-GPT 由哈尔滨工业大学(威海)机器人研究所团队开发,于 CVPR 2026 正式发表。它首次将 GPT 风格的因果 Transformer 架构引入人形机器人全身运动控制领域,在 2B 帧规模的运动数据集上进行预训练,覆盖了 AMASS、Mocap、In-house 等多个主流动作捕捉数据集。与传统依赖 MLP 跟踪器的方法不同,Humanoid-GPT 通过因果注意力(Causal Attention)建模时序运动序列,能够对任意未见过的动作实现零样本泛化(Zero-Shot Generalization),无需针对新任务做额外微调。
从工程视角看,Humanoid-GPT 的技术栈非常「重」但也非常「前沿」:核心训练框架基于 Google 的 Flax(JAX 原生神经网络库)+ JAX 自动微分引擎,推理阶段则通过 ONNX Runtime 跨平台部署,支持 CPU / CUDA / TensorRT 三种后端。物理仿真层使用 MuJoCo 及其 MJX(JAX 加速版)实现 GPU 并行仿真,单个 A100 GPU 理论上可以同时模拟数千个环境,大幅加速强化学习训练。
在运动追踪推理流程中,系统从 mocap 设备(PNLink / Xsens)接收三维追踪点(Keypoint)数据,经过 tracking/convert_qpos2kpt.py 和 tracking/convert_parallel.py 的并行转换后,由 tracking/policy.py 中的 ONNX 策略网络输出 29 自由度关节控制指令,通过 deploy/play_track.py 统一调度仿真或真机执行。ONNX Runtime 在 Jetson Orin 等嵌入式平台上做了精细的线程调优(单线程 + spin 模式),将控制延迟从 ~2ms 降至 ~0.4ms,满足 50Hz 实时控制要求。
项目提供了功能完整的 Gradio Web UI(scripts/app.py),用户可以在浏览器中上传动作捕捉数据文件(.npz 格式),实时预览重建效果并调节地面摩擦系数等物理参数,还支持视频输出生成。这是一个非常友好的评估和演示入口,极大降低了学术成果的使用门槛——你不需要写一行代码,只要会上传文件,就能体验机器人的动作追踪效果。
部署方面需要注意的是:项目目前没有提供 Docker 容器化方案,依赖项通过 conda + pip 安装,包括 JAX/MuJoCo-MJX 等大型科学计算库,首次安装体积较大(5GB+)。真机部署还需要额外下载第三方库包(Google Drive 托管,约 1.5GB),包括 Unitree G1 的 Python SDK 和 DDS 通信中间件 CycloneDDS,以及 GMR-galbot 在线重定向模块。总体来说,对于有强化学习和机器人基础的开发者,上手难度中等;但对于纯应用型用户,建议先从 Gradio UI 的仿真模式入手,感受完整体验后再决定是否投入真机部署。
从行业视角来看,Humanoid-GPT 代表着人形机器人领域的一个新范式转移——从「针对特定动作训练特定模型」转向「预训练大模型 + 零样本泛化」。它与 Figure、宇树科技等商业人形机器人的技术路线不谋而合,即通过大规模运动数据预训练实现通用动作理解能力。随着 2B+ 帧级别的运动数据积累,未来有望将这一能力扩展到复杂技能学习(爬楼梯、搬运、协作)上。
技术总结:
图1:Humanoid-GPT 系统概览 — 从动作捕捉到机器人全身控制的完整流程