vggt
端到端从照片重建3D世界的视觉Transformer,获CVPR 2025最佳论文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
端到端从照片重建3D世界的视觉Transformer,获CVPR 2025最佳论文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你手机里存着同一个房间在不同角度拍摄的几张照片——现在,有一个人工智能模型,只用"看"这些照片,就能在几秒钟内精确推算出每张照片的相机位置、画面中每个像素的深度,以及整个空间的三维结构。这不是科幻,而是 Meta AI 与牛津大学视觉几何组(VGG)联合研发的 VGGT(Visual Geometry Grounded Transformer)正在做的事。
2025年3月,VGGT 斩获 CVPR 2025 最佳论文奖,成为当年计算机视觉领域最具影响力的研究成果之一。
计算机视觉中有一个经典问题叫"Structure from Motion"(从运动恢复结构):给定同一个场景的多张照片,推断相机位姿和三维几何。传统方法以 COLMAP 为代表,通过特征点匹配、几何验证、束调整等一系列迭代优化,需要数十分钟甚至数小时才能完成一次重建。
VGGT 的核心创新在于将这一过程端到端化:用一个拥有10亿参数的大型视觉Transformer网络,直接从图像中回归出所有几何量——相机外参、内参、深度图、点云、轨迹追踪。论文将其命名为"前馈式"(Feed-forward)方法,意思是网络"一次 forward pass"就出结果,无需迭代优化。
团队来自两个顶级机构:牛津大学 VGG 实验室(Visual Geometry Group,计算机视觉领域殿堂级团队,以经典视觉几何算法闻名)和 Meta AI Research。作者包括 Jianyuan Wang、Minghao Chen、Nikita Karaev、Andrea Vedaldi(VGG 创始人之一)、Christian Rupprecht 和 David Novotny。
2026年5月,团队进一步发布了 VGGT-Omega 版本,在相同显存下支持2-3倍更多的输入帧数,并新增了商业授权模型 VGGT-1B-Commercial。
VGGT 的模型规模达到 10亿参数(1B),从 HuggingFace 的 facebook/VGGT-1B 权重文件中加载。架构大致分为以下几个模块:
核心模型(vggt/models/vggt.py):采用标准视觉Transformer架构,处理输入图像序列,输出图像 tokens。
聚合器(vggt/models/aggregator.py):将多张图片的视觉 tokens 进行聚合,建立跨视图的对应关系,这是实现多视图几何推理的关键。
预测头(Heads):
camera_head.py:预测相机外参(旋转矩阵+平移向量)和内参(焦距+主点),输出符合 OpenCV 规范的 4×4 变换矩阵dpt_head.py:DPT(Dense Prediction Transformer)风格深度预测头,输出每像素深度值和置信度point_head.py:直接预测三维点云坐标track_head.py:跨帧轨迹追踪,输入任意2D像素坐标,输出该点在所有图像中的位置Transformer 层(vggt/layers/):包含标准注意力模块(attention.py)、SwiGLU 前馈网络(swiglu_ffn.py)、旋转位置编码 RoPE(rope.py)、Patch Embedding(patch_embed.py)等标准 ViT 组件。
训练部分(training/)提供了完整的微调代码,支持用户在自己的数据集上微调 VGGT,配置通过 Hydra 管理。
图1:Meta AI Research 官方头像(来源:GitHub)
VGGT 真正厉害之处在于跨尺度泛化:无论你输入1张图、10张图还是100张图,它都能正常工作,并随着图片数量增加持续提升精度。
单图/少图场景:上传任意几张照片,输入一个 10 亿参数模型,输出相机位姿、深度图、点云。单图情况下只能做单目深度估计,精度有限但速度极快。
多图稠密重建:当有足够多的重叠图片时,VGGT 能输出高质量的三维点云,可直接导出为 COLMAP 格式,兼容 gsplat、NeRF、3D Gaussian Splatting 等下游工具。
轨迹追踪:指定图像中任意一个像素点,VGGT 能追踪该点在其他所有图像中的对应位置,输出 3D 轨迹。这对于视频理解、运动分析等任务非常有用。
项目自带一个完整的 Gradio Web UI(demo_gradio.py),通过 pip install vggt[demo] 安装依赖后可直接启动。用户上传包含图片的文件夹,模型自动处理,结果以交互式 3D 可视化展示(依赖 viser 库)。
Gradio 界面流程:
images/ 子目录)另外还提供 demo_colmap.py(导出 COLMAP 格式)和 demo_viser.py(纯 viser 3D 可视化)两个脚本。
GPU 是必须的。VGGT 支持 bfloat16(需 Ampere 架构 RTX 30 系列及以上)或 float16(更老显卡)。16GB 显存是舒适线,8GB 显存可以通过减少输入帧数勉强运行。
安装非常简洁:
pip install vggt # 核心库
pip install vggt[demo] # 含 Gradio UI
权重从 HuggingFace 自动下载,也可手动下载 model.pt 绕过下载限速。
没有 Docker 支持是最大遗憾——10亿参数模型+PyTorch+CUDA 环境配置对新手并不友好,建议有一定深度学习环境的用户使用。
VGGT 的意义不仅是拿了最佳论文奖,而是代表了一种范式转变:从"优化求解"到"直接回归"。
传统几何视觉依赖迭代优化(Bundle Adjustment),效果好但极慢;VGGT 用大模型直接"记住"了几何规律,速度快了几个数量级。这种"又快又好"的特性,让实时三维重建从不可能变成了可能。
配合 2026 年发布的 VGGT-Omega 支持更多帧、VGGT-1B-Commercial 开放商业授权,Meta 正在将这项技术推向实际应用——AR/VR、自动驾驶、机器人导航、摄影测量……所有需要"从照片重建三维"的领域都会受到影响。
这是一篇值得深入阅读的论文,也是一个值得体验的项目。
分析基于 GitHub 仓库(13,201★)及公开论文,数据截至 2026 年 5 月。模型权重请从 HuggingFace 官方渠道获取。