Spatial Intelligence in Vision-Language Models:AI 空间推理的「百科地图」
当你打开一张室内照片,问 AI「桌子左边是什么」「花瓶比台灯高多少厘米」「从门口走到窗边需要几步」——这些对人类来说轻而易举的空间问答,却曾是视觉-语言模型(VLM)最头疼的难题。
vulab-AI/Awesome-Spatial-VLMs 正是这一研究领域的「活地图」。它由北航 VL Lab 团队维护,是论文《Spatial Intelligence in Vision-Language Models: A Comprehensive Survey》的官方配套资源库,聚合了截至 2026 年初的论文、评测基准、开源模型、数据集,并提供标准化的评测工具包与排行榜。

图1:Awesome-Spatial-VLMs 项目官网首页
背景:AI 为什么空间推理难?
人类的空间认知能力分为三层递进的认知层次:
- L1 · 空间感知:识别单个物体的三维属性——大小、方向、朝向。典型问题:「这辆车的朝向是?」
- L2 · 空间理解:推理多个物体之间的空间关系——左右、上下、前后。典型问题:「猫在桌子的哪一边?」
- L3 · 空间外推:从有限视角推断隐藏状态、预测未来布局、心理旋转。典型问题:「从另一个角度看这个物体长什么样?」
当代 VLM(如 GPT-4V、LLaVA)在前两层(感知和理解)已有不错表现,但在 L3「空间外推」上仍有明显短板。这篇综述正是系统梳理了这些挑战的成因与解决方案。
五大技术路线全覆盖
项目将领域内方法组织为五大技术家族,形成了一张完整的技术地图:
1. 无需训练的提示工程(Training-Free Prompting)
在不修改模型权重的前提下,通过提示策略激发模型的空间推理能力。代表工作包括:
- Set-of-Mark(SoM):微软研究院 2023 年工作,在图像上叠加视觉标记(框、点、线条),让 GPT-4V 精准「看见」空间位置。
- Visualization-of-Thought(VoT):微软 2024 年 NeurIPS 工作,让 LLM 在推理过程中「画出」空间关系图——将思维链从文字扩展到视觉草图,实验证明可显著提升 L3 任务表现。
- SpatialPIN(牛津大学):利用 3D 先验知识辅助视觉语言模型完成零样本空间推理。

图2:Spatial Intelligence 三层认知层次与五大技术路线概览
2. 模型中心的增强(Model-Centric Enhancements)
从模型架构层面注入空间能力,又细分为三个方向:
- 训练策略:通过 RL(强化学习)、R1-Zero 风格的长思维链训练、CoT(思维链)微调等手段,让模型学会「思考空间」。典型工作如 SpatialCoT(华为诺亚方舟实验室)、M2-Reasoning(蚂蚁金服 Inclusion AI)、Embodied-R(清华大学)。
- 架构改进:设计更好的视觉 tokenizer(如 Honeybee、KOSMOS-2)、投影器(如 Cambrian-1 的 MRC 投影器),让视觉特征携带更多空间信息。
- 编码器增强:用 3D 感知编码器替代 2D 编码器,或引入 Perception Tokens(华盛顿大学 CVPR 2025),从根本上提升空间表征质量。
3. 显式 2D 信息注入(Explicit 2D Information Injection)
在 2D 图像中显式注入空间标注,让模型「看见」位置。核心方法是区域级指令微调:
- RegionGPT(NVIDIA CVPR 2024):为区域级图像问答训练专用指令。
- VCoder(佐治亚理工 CVPR 2024):将分割掩码作为额外视觉 token 输入,让模型具备精确的空间感知能力。
- LLaVA-SG(清华大学):通过场景图(Scene Graph)将空间关系结构化地注入视觉语言对齐过程。
4. 3D 信息增强(3D Information Enhancement)
这是当前最活跃的研究方向,将 3D 几何信息引入多模态大模型:
- 3D-LLM(UCLA NeurIPS 2023):首创将 3D 场景表征注入 LLM,开启了 3D VLM 时代。
- SpatialBot(上海交大):利用 Depth Sensor 提供深度感知,显著提升空间问答准确性。
- SpatialLM(Manycore):从室内场景视频中直接推理 3D 结构化语言描述,无需 LiDAR。
- Spa3R(华中科技大学):预测空间场(Predictive Spatial Field),实现未见视角的空间外推。
5. 数据中心的空间增强(Data-Centric Spatial Enhancement)
通过合成数据或质量更高的训练语料弥补空间信息不足:
- SpatialVLM(Google DeepMind):构建包含真实深度和距离信息的合成 VQA 数据。
- Sparkle(MIT):百万级空间推理 CoT 标注数据,训练 LLM 学会「用空间思维思考」。
- SPRITE(哈工大):程序化合成大规模空间推理数据,支持模型的空间泛化。
评测体系:37+ 模型同台竞技
项目提供了一套标准化的评测工具包(Evaluation Toolkit),将现有评测基准统一化,并在 HuggingFace 发布标准化数据集:
数据集地址:https://huggingface.co/datasets/LLDDSS/Awesome_Spatial_VQA_Benchmarks
评测覆盖 54 个基准(Benchmark)和 24 个训练数据集(Training Corpus),覆盖 L1/L2/L3 三层认知任务。当前排行榜收录了 38 个 VLM 的评测结果,包括 GPT-4V、Gemini、LLaVA 系列、Qwen-VL、Cambrian-1 等主流模型。

图3:Spatial VLM 排行榜(L1/L2/L3 综合评测结果)
评测代码结构清晰(/evaluation/ 下分 2D_Information、3D_Information、Model_Centric 等子目录),研究者可参照 README 接入自己的模型参与评测。
局限与争议
任何研究都有其局限,这个项目也不例外:
- 模型覆盖存在滞后:论文发表(2024 年初)与持续更新之间有时间差,部分 2025-2026 年新工作被标记为「excluded in survey」但仍然收录在 README 中,说明维护团队在努力跟进但节奏有挑战。
- 排行榜只测推理能力,不测速度/部署:评测指标为 QA 准确率,对模型推理效率和推理延迟没有纳入对比,而这对实际应用至关重要。
- 3D VLM 仍是「贵族」:需要深度传感器或点云输入的模型在通用性上受限,大多数用户难以复现其完整能力。
行业意义
这个项目的价值远超一个「awesome list」:
- 为研究者提供地图:五大技术路线梳理清晰,新进入领域的学生可以快速建立全局认知,找到自己感兴趣的具体方向。
- 推动评测标准化:此前各论文用各自评测基准,数据不可比。这个项目推动了跨模型的统一评测,有助于识别真正有突破性的工作。
- 反映 AI 空间推理的趋势:从 2023-2024 年的「无训练提示」到 2025-2026 年的「RL + 3D 融合」,技术路线正在快速演进,该项目跟踪了这一演变。
快速上手
技术速览
| 维度 | 内容 |
|---|
| 项目类型 | 学术综述资源库(Awesome List) |
| 核心语言 | Markdown(文档)+ Python(评测工具) |
| 收录论文 | 200+ 篇(涵盖 CVPR/NeurIPS/ICML/ICLR 等顶会) |
| 收录模型 | 38+ VLM(GPT-4V、LLaVA、Cambrian-1 等) |
| 评测基准 | 54 个基准 + 24 个训练数据集 |
| 许可证 | MIT |
| 维护团队 | BUAA VL Lab(北航视觉与语言实验室) |
| 关联网站 | https://vulab-ai.com/projects/awesome-spatial-vlms/ |
本分析基于 2026-06-22 的 GitHub 仓库数据生成。