Awesome-Multimodal-Spatial-Reasoning
MLLM空间推理Awesome论文清单,5大子领域数百篇SOTA论文,配套arXiv综述
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
MLLM空间推理Awesome论文清单,5大子领域数百篇SOTA论文,配套arXiv综述
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,博士生李明(化名)盯着导师发来的反馈邮件发呆——"你的文献综述不够全面,空间推理这块最新的进展你调研清楚了吗?"
这不只是李明一个人的困境。从2023年GPT-4V、Claude 3发布至今,多模态大模型(MLLM)空间推理已经成为CV和NLP交叉领域最热门的方向之一,论文呈爆发式增长。但问题在于:这些论文分散在arXiv的各个角落,代码躺在GitHub不同的仓库里,有的方法强调3D场景理解,有的专注于机器人导航,还有的聚焦视频时序感知——没有任何一个地方能把它们串起来看。
直到2025年4月,GitHub上出现了一个名为 Awesome-Multimodal-Spatial-Reasoning 的仓库。
这个项目由个人研究者 zhengxuJosh 创建并维护,配套一篇arXiv综述论文(arXiv:2510.25760),系统梳理了多模态大模型在空间推理领域的所有主流工作。截至2026年7月,该仓库已积累 314 GitHub Stars,被16位开发者 fork,成为该领域最有影响力的Awesome类型资源之一。
Awesome-Multimodal-Spatial-Reasoning 本质上是一个学术论文精选列表,以 Markdown 文件的形式组织,类似于社区著名的 "awesome" 系列。相比传统的PDF笔记或私人博客,这个项目有两个显著特点:
第一,它有配套的学术论文背书。 仓库作者同步发表了arXiv综述《Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks》,被Hugging Face Papers平台收录,说明这不是简单的链接堆砌,而是经过系统性分析和归纳的学术综述。
第二,它覆盖了空间推理的完整技术图谱。 不同于只收录某一类工作的论文列表,这个项目将空间推理拆解为五个子领域,每个子领域对应一个 Markdown 文件,形成了一个立体化的知识结构:
| 子领域文件 | 主要内容 |
|---|---|
General_MLLM.md | 通用多模态大模型的空间推理能力评估与方法 |
3D_Vision.md | 3D视觉场景理解与空间关系推理 |
Embodied_AI.md | 具身智能:视觉-语言导航与机器人操控 |
Video_Audio_Egocentric.md | 视频、音频及第一人称视角的空间感知 |
Spatial_Benchmark.md | 空间推理评测基准与数据集 |
Reasoning_survey.md | 推理能力综述与方法论分析 |
每个论文条目都包含:标题、作者、发表会议/日期、论文链接、代码链接(如有),方便研究者直接跳转到原始资源。
要理解这个仓库收录的论文在解决什么问题,首先要理解空间推理的本质困难。
传统的语言模型在处理文本时,token之间是线性序列关系。但空间关系是非线性的——"桌子在房间的左边"、"杯子在书的右边"、"我站在窗户前面"——这些描述涉及物体之间的相对位置、朝向、三维结构等复杂几何信息,远比文本token的序列关系复杂。
更关键的是,现有的视觉语言模型(如CLIP)本身并不擅长精确的空间推理。CLIP在图像分类任务上表现出色,但当被问到"图中有多少个物体在另一个物体左边"这样的问题时,正确率往往低于50%。
仓库中的论文揭示了三条主要技术路线:
路线一:数据驱动——用海量空间数据训练VLMs
代表工作:Google的 SpatialVLM(2024)。研究团队构建了自动化的3D空间VQA数据生成框架,在1000万张真实图片上生成了20亿条空间VQA问答对,然后联合训练VLM。结果表明,这种大规模空间数据的预训练能显著提升模型的定量空间估计能力和定性空间关系判断能力。
路线二:架构创新——让视觉编码器更好地表达空间
代表工作:Dual Mechanisms of Spatial Reasoning in VLMs(2024,EMNLP)。这篇论文发现,提升视觉编码器对全局空间信息的建模能力(而非局部纹理),能直接改善MLLM在自然图像上的空间推理表现。这说明视觉编码器的设计是空间推理能力的瓶颈所在。
路线三:推理策略——Chain-of-Thought在空间任务上的扩展
代表工作:SpatialCoT(2025)。将CoT思维链引入具身任务规划,让模型在执行导航操作前先生成空间坐标对齐和推理步骤,将空间问题拆解为可执行的子步骤。Multimodal Visualization-of-Thought(MVoT) 则更进一步,生成图像化的推理轨迹,让模型在推理过程中"画图思考"——这在复杂空间问题上的效果显著优于纯语言CoT。
在所有子领域中,Embodied AI(具身智能) 是空间推理落地最直接的场景。收录的代表性工作包括:
室内导航:模型需要理解"走到客厅左边的蓝色沙发旁边"这样的指令,推理出三维空间的路径。
机器人操控:将自然语言指令转化为精确的空间动作(如"把左边的苹果拿起来放到右侧的碗里")。
第一人称视频理解:Egocentric AI 方向(以EgoNight等数据集为代表),研究日常生活场景中第一人称视角下的空间感知和动作理解。
仓库专门收录了空间推理的评测基准,这一部分对研究者最有参考价值:
这些基准的共同特点是:不仅测试"物体在哪里",还测试"物体之间如何关联"、"在不同视角下如何保持空间一致性"等深层理解能力。
这是一个开放协作的Awesome项目。与大多数一次性创建后无人维护的awesome列表不同,这个项目通过Pull Request机制接受社区贡献,持续更新最新工作。从仓库活动记录来看,作者在持续跟进arXiv新论文,保持较高的更新频率。
主要局限:
使用建议:
从更宏观的视角来看,空间推理之所以在近年来成为MLLM研究的核心议题,根本原因在于:如果AI无法理解空间,就无法真正理解和操控物理世界。
无论是家庭机器人、自动驾驶,还是AR/VR应用,都需要模型具备精确的空间感知和推理能力。这个Awesome仓库的意义,不仅在于整理了多少篇论文,更在于它勾勒出了这个方向的技术演进路线:从单纯提升视觉编码器的空间表示能力,到引入CoT推理策略,再到MVoT这种"视觉思维"的范式创新——每一步都在推动AI更接近真正的空间智能。
随着具身智能和空间计算成为AI发展的下一波浪潮,类似这样的系统性文献整理工作,将持续为整个社区提供有价值的导航价值。
项目信息