RoboticsDiffusionTransformer
首个10亿参数双臂机器人扩散基础模型,零样本泛化至多款机械臂,ICLR 2025 录用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个10亿参数双臂机器人扩散基础模型,零样本泛化至多款机械臂,ICLR 2025 录用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象这样一个场景:你家的服务机器人需要把桌上的马克杯端起来,放进水槽里。对于人类而言,这不过是 3 秒钟的动作,但对机器人来说,这涉及视觉感知、空间推理、力量控制、实时轨迹规划等多个维度的综合决策。更棘手的是——如果机器人的手臂关节配置稍有不同,这套动作策略就可能完全失效。
这就是机器人操作(Robot Manipulation)领域的核心困境:数据稀缺、跨机器人泛化困难、动作空间复杂。传统方法要么依赖大量人工标注数据,要么只能针对单一机器人定制开发。
2024 年 10 月,清华大学 ML 课题组发布了 RDT-1B(Robotics Diffusion Transformer),这是世界上首个参数规模达到 10 亿级的机器人操作扩散基础模型,在双臂操作任务上实现了 SOTA(最先进)性能,并在零样本泛化方面展现出惊人的能力。
RDT-1B 的核心技术路径是扩散模型 + 多模态变换器的深度融合。
扩散模型负责动作生成。与传统强化学习方法直接输出确定性动作不同,扩散模型通过逐步去噪的过程,从随机噪声中"雕刻"出最优动作序列。这种渐进式生成方式天然具有更好的多模态建模能力——同一个任务,机器人可以用不同的方式完成。
多模态编码器是 RDT 的感知大脑。项目采用了两阶段编码策略:
两者输出被拼接为统一的多模态表示,输入到扩散变换器的主干网络中,生成未来 64 步的机器人动作向量(包含双臂关节位置、末端执行器姿态及抓取器开合状态)。
RDT-1B 的预训练数据规模是另一个令人印象深刻的数据点:
这种大规模、多机器人形态的联合训练,是 RDT 具备"跨机器人泛化"能力的关键所在——模型学到的不是某个特定机器人的动作模式,而是操作技能的可迁移抽象。
微调阶段,团队在 ALOHA 双臂机器人上采集了 6K+ episodes 的高精度演示数据,完成了从基础模型到专用策略的快速适配。
| 能力 | 说明 |
|---|---|
| 双臂协同操作 | 支持 ALOHA 等双机械臂系统的精细协作任务(做饭、折叠、装配等) |
| 零样本泛化 | 在未见过的新物体、新场景上可直接部署,无需额外微调 |
| 少样本快速适配 | 仅需 6K 演示数据即可完成高质量的领域适配 |
| 跨机器人兼容 | 从单臂到双臂、从关节控制到末端控制、从位置控制到速度控制均可适配 |
| 模拟到现实(Sim2Real) | 提供 ManiSkill 仿真基准测试,支持在仿真环境中验证策略后迁移到真实机器人 |
在 ManiSkill 仿真基准的 5 项任务中,RDT-1B 平均成功率达 53.6%,远超 OpenVLA(4.8%)、Octo(0%)和 Diffusion-Policy(30.2%)。在 PushCube 任务上更是实现了 100% 的成功率。
RDT-1B 本质上是学术研究框架,而非面向终端用户的开箱即用产品。其部署门槛相当高:
硬件要求(硬性):
软件配置(复杂):
RDT-170M 版本是一个更亲民的替代方案,参数规模缩减至 170M,VRAM 需求从 24GB 降至 12GB,适合消费级 RTX 4090 用户进行研究和实验。
RDT-1B 并非完美,存在以下值得关注的局限:
RDT-1B 的发布代表着机器人操作领域正在经历与自然语言处理类似的"基础模型革命"。在此之前,机器人领域的模型通常参数量在几十到几百万级别,数据量在几千到几万条。RDT-1B 将这两个数字分别提升了 100 倍和 100 倍,验证了规模化假说在机器人操作领域的可行性。
更重要的是,RDT 证明了通过联合训练不同形态的机器人数据,可以实现真正的跨实体泛化——这意味着未来的机器人开发者无需为每款新机器人从零收集数据,只需在已有的基础模型上进行少量微调即可。
RDT 相关论文已被 ICLR 2025 接收,标志着扩散模型在机器人操作领域的应用已获得顶级学术会议认可。