VLM-3R
让视觉语言模型看见三维空间,通过20万+条3D重建指令微调实现精确空间推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让视觉语言模型看见三维空间,通过20万+条3D重建指令微调实现精确空间推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:VLM-3R 核心架构图——从单目视频到三维空间理解的统一框架
你有没有想过,为什么现有的多模态大模型(如GPT-4V、LLaVA)能精准描述一张图片中的内容——"这是一只橘色的猫正蹲在窗台上"——却无法回答"这只猫相对于窗户的位置关系?它在窗户的左侧还是右侧?猫和窗台之间有多远?"
这并非模型的"视力"问题,而是空间理解能力的缺失。传统VLM(Vision-Language Model)在2D图像理解上已非常成熟,但对3D空间的感知几乎为零。它们看到的画面是扁平的,缺少深度、距离、朝向等空间维度的信息。
这种局限性在现实场景中会造成严重问题。比如家庭服务机器人需要判断"水杯在桌子的左边"才能正确执行"把水杯递给我";自动驾驶需要理解"行人正在车辆右前方2米处"才能做出正确决策。缺乏空间理解能力的AI,就像一个只能读懂地图却无法判断东南西北的人。
VLM-3R正是为解决这一问题而生——它让视觉-语言模型真正"看见"了三维世界。
VLM-3R的全称是"Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction",即"融合指令对齐3D重建能力的视觉-语言模型"。它的核心创新在于将3D几何感知与语言指令对齐,使模型能够根据自然语言指令执行精确的空间推理。
关键技术点一:几何编码器(Geometry Encoder)
传统VLM仅依赖视觉编码器(Visual Encoder)提取图像特征,而VLM-3R额外引入了几何编码器。该编码器从单目视频帧中提取隐式3D令牌(implicit 3D tokens),这些令牌编码了帧间的空间关系和深度信息。简单类比:如果Visual Encoder负责告诉AI"你看到了什么"(物体识别),那么Geometry Encoder则告诉AI"这些物体在哪里、以及它们之间的空间关系"。
关键技术点二:Spatial-Visual-View Fusion(SVF融合)
将几何令牌与视觉令牌简单拼接并不能充分利用两者的信息价值。VLM-3R设计了SVF(Spatial-Visual-View Fusion)融合机制,通过注意力机制和投影层,将几何信息与视觉信息深度融合,生成具有3D感知能力的视觉特征。这一步是让模型真正"理解"空间的关键。
关键技术点三:200K+ 3D重建指令微调数据
让模型理解空间概念,需要大量且高质量的训练数据支撑。VLM-3R团队构建了超过20万对3D重建指令问答数据(3D reconstructive instruction QA pairs),通过指令微调(Instruction Tuning)让模型学会将空间几何信息与自然语言对齐。这是目前该领域最大规模的专用指令微调数据集之一。
关键技术点四:CUT3R几何特征提取器
VLM-3R使用了CUT3R(子模块)作为几何特征提取的后端。CUT3R是一个专用3D几何建模工具,能够从视频序列中提取高质量的深度和法向量信息。项目要求单独安装CUT3R并编译其CUDA扩展,这是部署过程中最复杂的依赖项之一。
从代码结构来看,VLM-3R基于LLaVA架构进行开发,主要包含以下模块:
| 模块 | 说明 |
|---|---|
llava/ | LLaVA核心代码,包含model/serve/train三个子包 |
thinking-in-space/ | 空间推理benchmark(VSiBench/VSTiBench)的评测代码 |
trl/ | 指令微调相关代码(TRL: Transformer Reinforcement Learning) |
vlm_3r_data_process/ | 数据处理管道(专用3D重建QA数据生成) |
CUT3R/ | 子模块,几何特征提取器(需单独编译) |
scripts/VLM_3R/ | 推理和训练脚本 |
主力模型为Journey9ni/vlm-3r-llava-qwen2-lora,这是一个基于Qwen2-7B的LoRA微调模型,基座为lmms-lab/LLaVA-NeXT-Video-7B-Qwen2。整个系统依赖PyTorch 2.1.1 + CUDA 12.1、FlashAttention 2.7、DeepSpeed等关键依赖。
推理测试(无需训练)
VLM-3R支持视频和图像两种输入模式:
测试命令示例(视频):
CUDA_VISIBLE_DEVICES=0 bash scripts/video/demo/video_demo.sh \
Journey9ni/vlm-3r-llava-qwen2-lora \
qwen_1_5 32 2 average grid True \
playground/demo/47334096.mp4 \
lmms-lab/LLaVA-NeXT-Video-7B-Qwen2
指令微调(支持自定义数据)
项目提供了完整的训练流程:基于3D重建QA数据集,通过TRL框架对LLaVA+Qwen2模型进行LoRA微调。用户可替换为自己的空间指令数据来训练定制化的空间理解模型。
评测基准
VLM-3R团队还开源了VSiBench和VSTiBench两个评测基准,分别用于评估模型在静态场景和动态视频中的空间理解能力。评测脚本位于thinking-in-space/目录。
硬件要求极高:这是部署VLM-3R最大的障碍。模型推理至少需要24GB显存(建议RTX 3090或A100),训练则需要更大显存。requirements.txt包含了bytedance(字节内部)依赖包,表明该项目可能源自工业界团队。
依赖极其复杂:从README的安装步骤来看,完整安装需要:
整个安装过程在没有文档指导的情况下可能耗时数小时,且任何一步失败都可能导致整体不可用。
无容器化支持:项目中没有Dockerfile或docker-compose.yml,完全依赖宿主机环境配置,增加了跨平台复现的难度。
模型规模受限:目前VLM-3R基于7B参数规模开发,对于复杂场景的空间理解能力可能存在上限。更大规模的模型(如34B/72B)是否会带来质的飞跃,尚未有公开实验数据。
依赖字节内部生态:requirements.txt中出现了大量byted-*前缀的依赖包,这些是字节跳动的内部或定制化包,pip官方源无法直接安装。这意味着requirements.txt本身无法直接用于环境部署,必须手动过滤这些依赖。
CUT3R的可用性问题:CUT3R子模块作为git submodule但内容为空(检测为file而非directory),需要通过git submodule update --init --recursive手动初始化。这对不熟悉git submodule的用户是一个潜在坑点。
评测基准的封闭性:VSiBench/VSTiBench虽然是开源评测基准,但其构建过程和数据分布的细节披露有限,不利于研究者复现和对比。
VLM-3R被CVPR 2026接收,本身就说明了学术界对其创新性的认可。该项目代表了VLM从2D理解向3D空间感知演进的重要趋势。
从行业视角看,VLM-3R的应用场景非常明确:具身智能(Embodied AI)、家庭服务机器人、自动驾驶感知增强、增强现实(AR)空间理解。在这些场景中,空间推理能力是刚需。
从技术趋势看,多模态模型的空间化理解是2024-2026年的热点方向。LLaVA-Next-Video、Samsung Gauss、OpenGVLab等团队都在探索类似路径。VLM-3R的独特贡献在于将3D重建的思想引入VLM指令微调,而非简单地在现有VLM上外挂一个深度估计模块——这是一种更彻底的架构级融合。
值得注意的是,该项目来自VITA-Group(Vanderbilt & UT Austin & TAMU联合研究组,由Zhangyang Wang教授领导),该团队在视觉-语言-动作(VLA)方向有深厚积累。VLM-3R很可能只是其更大VLA路线图的组成部分。
附:资源链接