LIFT3D
将二维CLIP预训练模型「升维」至三维点云,构建机器人操控基础策略(CVPR 2025)
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将二维CLIP预训练模型「升维」至三维点云,构建机器人操控基础策略(CVPR 2025)
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Lift3D 项目 Logo

想象一下:你在收拾房间时,需要同时感知物体的三维形状、判断抓取角度、避开障碍物——这对我们来说是本能,但对机器人来说,这是极其复杂的感知与决策挑战。2025年CVPR录用的 Lift3D 项目,正是为了解决这一核心难题而生:它创新性地将大规模二维预训练模型(如CLIP)的知识「升维」到三维场景,让机器人拥有真正的空间感知能力。
要让机器人在真实世界中完成抓取、装配、搬运等任务,关键在于理解环境的三维结构。相比二维图像,三维点云(Point Cloud)包含了物体的空间坐标信息,是机器人感知物理世界的天然语言。然而,三维机器人领域长期面临两大困境:
第一,数据稀缺。 真实世界的三维机器人操控数据极为稀缺——收集10万条高质量抓取数据需要耗费大量人力物力。而ImageNet那样规模的大规模预训练,在三维领域几乎不存在。
第二,二维基础模型的迁移难题。 CLIP、SigLIP等二维大规模预训练模型已经展现了强大的视觉-语言理解能力,包含了丰富的语义知识,但这些知识很难直接迁移到三维点云任务——因为点云的离散性和不规则性,与规则像素网格的二维图像有本质区别。
Lift3D的核心贡献,正是系统性地解决「如何把二维基础模型升维到三维操控策略」这一前沿问题。
Lift3D提出了两阶段渐进式增强策略,在隐式和显式两个层面同时提升三维表征质量。
项目基于CLIP视觉编码器(ViT-B/32)构建核心框架。考虑到直接全参数微调会破坏预训练知识,项目采用**LoRA(Low-Rank Adaptation)**技术进行高效微调,仅更新少量参数,保留CLIP原有的丰富语义表征能力。
在第一阶段,模型通过MAE风格的自监督预训练学习三维几何感知——让编码器学会从点云中提取空间结构信息,同时不遗忘原始的语义知识。代码中的set_trainable_params函数精确控制哪些参数可训练:冻结CLIP原始参数(patch_embed、cls_token、position embedding),仅开放LoRA层、cls_token和最后一层norm的参数更新权限。这种策略既保证了预训练知识的迁移,又赋予模型三维感知能力。
第二阶段引入2D模型升维策略,建立三维点与二维位置编码之间的精确映射。具体而言,模型学习如何将点云中的每个三维点,映射到CLIP位置编码的对应位置,从而让CLIP可以直接处理点云数据,而非先将其转为图像。这种设计最大程度减少了空间几何信息的损失。
图2:Lift3D 框架原理示意

整个代码库采用标准的Python包结构,通过Hydra配置管理实现实验的可复现性。以下是关键目录的设计逻辑:
lift3d/
├── config/ # Hydra YAML 配置文件
├── models/ # 核心模型实现
│ ├── clip/ # CLIP编码器封装
│ ├── lift3d/ # Lift3D核心模型(LoRA、backbone)
│ ├── point_next/ # PointNeXt 3D编码器(对比基线)
│ ├── r3m/ # R3M 编码器(对比基线)
│ └── spa/vc1/ # SPA/VC1 编码器(对比基线)
├── envs/ # 仿真环境适配层
│ ├── metaworld_env.py # Metaworld仿真器
│ └── rlbench_env.py # RLBench仿真器
├── dataset/ # 数据集工具
├── loss/ # 损失函数(对比学习等)
├── helpers/ # PyTorch工具函数
├── scripts/ # 训练脚本入口
└── tools/ # 独立工具(数据生成、视频制作)
值得注意的是,项目将多种2D基线方法(R3M、VC1、SPA)和3D基线方法(PointNet++、PointNeXt)统一在同一框架下,方便进行公平对比。训练入口scripts/train_metaworld.py和scripts/train_rlbench.py分别对应两个仿真环境,通过Hydra的配置组合实现不同实验的快速切换。
Lift3D支持两个主流机器人仿真平台:
数据采集支持半自动方式:提供sample_obs_*系列工具对仿真环境进行采样观测,gen_data_*系列工具生成训练数据集。整个数据管线通过Zarr格式存储高效压缩的点云和图像数据。
图3:Lift3D 仿真效果演示

| 组件 | 技术选型 | 说明 |
|---|---|---|
| 深度学习框架 | PyTorch 2.4.1 + Lightning 2.4 | 主流科研框架 |
| 3D处理 | PyTorch3D + Open3D | Facebook开源3D库 |
| 配置管理 | Hydra 1.3 | Yale实验管理框架 |
| 预训练模型 | CLIP ViT-B/32 + LoRA | 核心升维基础 |
| 仿真器 | CoppeliaSim 4.1 + Metaworld + RLBench | 机器人仿真 |
| 可视化 | WandB | 实验追踪与视频记录 |
作为学术研究项目,Lift3D存在一定的上手门槛:
硬件要求高:项目需要至少8GB显存的NVIDIA GPU(CUDA 12.4+),且依赖PyTorch3D(需要从源码编译)、PointNext子模块(包含CUDA扩展),安装过程涉及约20个依赖项,其中CoppeliaSim需手动从官网下载(约400MB),整体部署耗时2-4小时。
非生产级:项目定位为科研复现框架,无Dockerfile封装,无Web界面,所有操作通过命令行Python脚本进行。虽然scripts/lift3d_example.py提供了简洁的推理演示(加载模型→输入点云→输出特征),但缺乏完整的训练-推理一体化工具链。
仿真器依赖:CoppeliaSim是商业软件的教育版(免费但闭源),且需手动注册下载,在某些机构网络环境下可能受限。
Lift3D被CVPR 2025录用的背后,反映了机器人操控领域的一个重要趋势:利用二维大规模预训练模型的能力,绕过三维数据稀缺问题。这一思路与计算机视觉领域的「语言-图像预训练→下游任务微调」范式一脉相承,有望像CLIP影响图像识别那样,深刻改变三维机器人操控的研究方式。
项目提供了完整的HuggingFace模型权重(ViT-B-32.pt + lift3d_clip_base.pth),社区可以直接下载预训练权重进行推理或微调,无需从零训练。随着后续论文的公开和代码的持续维护,Lift3D有望成为三维操控领域的标杆框架。
此外值得注意的是,PKU-HMI-Lab(北京大学人机智能实验室)在该方向持续深耕,其后续工作如HybridVLA、AC-DiT等进一步拓展了视觉-语言-动作模型和扩散策略在机器人领域的应用,构成了一个完整的研究谱系。
本文档基于项目GitHub仓库、CVPR 2025论文摘要及HuggingFace模型页面综合分析生成。