Video-3D-LLM
首个将3D场景映射为视频表征的多模态大模型,刷新5项3D场景理解SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个将3D场景映射为视频表征的多模态大模型,刷新5项3D场景理解SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你让一个AI助手描述你家客厅里的沙发颜色和位置,它可能答得头头是道。但如果你追问从厨房走到沙发最短路线是什么,或沙发左边的茶几上有什么,大多数多模态大模型就会陷入沉默。这并非它们不想回答,而是2D数据喂大的模型天生缺乏3D空间感知能力。ScanNet等3D场景数据集的规模远远不及2D互联网数据,导致主流MLLM在空间推理任务上与真实需求存在巨大鸿沟。
香港中文大学LaVi-Lab团队敏锐地捕捉到了这个痛点,在CVPR 2025发表论文《Video-3D LLM》,提出用视频的视角来处理3D场景,并通过3D位置编码让视频表征与真实空间坐标对齐。他们的工作刷新了ScanRefer、Multi3DRefer、SQA3D、ScanQA、Scan2Cap等多个3D场景理解基准的SOTA。

图1:Video-3D LLM 核心架构 - 将3D场景视为动态视频序列,通过3D位置编码融合空间感知
Video-3D LLM的思路极为巧妙:与其专门为3D数据训练新模型,不如将3D场景翻译成大模型已经熟悉的视频格式。
具体而言,它基于LLaVA-NeXT多模态框架,引入三个关键设计:
1. 位置感知视频表征(Position-Aware Video Representation)
传统MLLM在处理视频时仅依赖RGB像素的时间连续性,而Video-3D LLM在视频帧中额外注入了3D位置信息(来自ScanNet等场景的相机参数)。这使得模型不只能看到画面,还能知道自己在空间中的哪里、物体之间的距离和朝向。
2. 最大覆盖采样(Maximum Coverage Sampling)
3D场景往往包含大量视频帧,全部输入计算代价极高。论文提出了自适应帧采样策略,在保证覆盖90%~95%场景体素的前提下,将帧数控制在32帧以内。实验表明,这种策略比均匀采样(uniform)能更好地保留关键空间信息。
3. 任务无关的通才框架
Video-3D LLM在ScanRefer(指代定位)、Multi3DRefer(多目标指代)、SQA3D(空间问答)、ScanQA(场景问答)和Scan2Cap(场景描述)五个任务上联合训练,无需针对每个任务单独微调,展现了良好的多任务泛化能力。
代码库基于LLaVA-NeXT构建,主力技术栈如下:
| 组件 | 技术选型 |
|---|---|
| 基础框架 | PyTorch 2.1.2 + Torchvision 0.16.2 |
| 多模态骨干 | LLaVA + Qwen2(Video3D-LLM-LLaVA-Qwen-Uniform-32) |
| 位置编码 | 3D相机参数注入(来自ScanNet) |
| 分布式训练 | DeepSpeed ZeRO-2/3 + Accelerate |
| 参数高效微调 | PEFT(LoRA等) |
| 注意力优化 | Flash Attention |
| 监控追踪 | Weights & Biases(WandB) |
| 模型权重 | HuggingFace托管 |
核心代码在 llava/ 目录下,包含 model/(视觉编码器与LLM融合层)、train/(分布式训练逻辑)、eval/(各3D基准评测脚本)、utils_3d.py(3D场景预处理)、video_utils.py(视频帧采样处理)。训练脚本位于 scripts/3d/,支持单机多卡和多机多卡配置。
安装环节:需要新建conda环境(Python 3.10),pip install -e [train] 拉取大量依赖(100+包),torch版本锁定在2.1.2,需单独安装flash-attn(需CUDA编译环境)。
数据准备:需从HuggingFace下载预处理后的Video-3D-LLM数据,还需申请下载原始ScanNet数据集。
推理评测(以Scan2Cap为例):
sh scripts/3d/eval/eval_scan2cap.sh $CKPT_NAME uniform 32
参数依次为:检查点路径、采样策略、最大帧数。GPU是必须的,训练阶段使用DeepSpeed分布式,强烈建议A100/H100等大显存卡,至少需要24GB显存。
Video-3D LLM发表于CVPR 2025,其核心贡献在于证明了3D-as-Video跨模态对齐范式的可行性。作者后续已发布新工作VG-LLM,探索将3D几何先验更直接地融入MLLM。
对于开发者而言,代码库结构清晰、文档完整,评测脚本可直接迁移。如果你正在研究3D场景理解、视觉-语言导航或具身智能,这个仓库提供了扎实的基准实现和丰富的参考代码。