Awesome-MCoT
多模态思维链(MCoT)推理领域的首部系统性综述,涵盖图像、视频、3D、音频等多种模态下的逐步推理方法与数据集
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
多模态思维链(MCoT)推理领域的首部系统性综述,涵盖图像、视频、3D、音频等多种模态下的逐步推理方法与数据集
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:当你给人工智能看一张复杂的交通事故现场照片时,它不仅能识别出车辆、行人、道路标线,还能像经验丰富的交警一样,一步步推理出事故发生的因果链条——「车辆A闯红灯 → 与车辆B在路口相撞 → 撞击力导致B车侧翻 → 碎片飞溅至行人区域」。这种像人类一样逐步思考的能力,正是多模态思维链(Multimodal Chain-of-Thought,简称MCoT)研究的核心课题。
yaotingwangofficial/Awesome-MCoT 是这一领域的首部系统性综述,由研究团队发布于2025年初,旨在为学术界和产业界梳理多模态大语言模型(MLLM)中思维链推理的技术全貌。

图1:多模态思维链推理领域全景图 — 涵盖图像、视频、3D、音频、表格等多种模态数据的逐步推理研究,展示了该领域从2022年至今的技术演进路径。
2022年至2023年间,OpenAI GPT-4、Anthropic Claude、多模态Gemini等模型的相继问世,让大模型能看图说话从一个科幻概念变成了现实。然而,仅仅是识别还远远不够——模型常常在需要复杂推理的视觉任务中碰壁。比如,给出一道数学几何题的图片,模型可能直接给出错误答案,却说不出为什么。
传统的单步视觉问答(VQA)方式,让模型直接输出答案,忽略了人类解决问题时的关键步骤:分步思考。Chain-of-Thought(思维链)的引入,最初在纯文本领域证明了让模型说出推理过程能显著提升准确率。随后,研究者们开始探索:能否在多模态场景中也实现类似的逐步推理?
这一方向迅速成为2024-2025年AI研究最活跃的赛道之一。DeepSeek-R1、OpenAI o1/o3、Qwen2-VL等明星模型都深度依赖思维链推理能力。Awesome-MCoT 综述的诞生,正是为了给这个快速扩张的领域提供一张清晰的地图。
该综述覆盖了MCoT研究的完整技术栈,主要包括以下六大模块:
综述收集了覆盖训练和评测两个阶段的多元化数据集。用于训练的数据集包括:ScienceQA(21K科学问答)、EgoCoT(200M大规模视频推理)、LLaVA-CoT(834K多模态推理数据)等;用于评测的数据集则包括 MMMU(11.5K多学科多模态理解)、MathVista(数学视觉推理)、OSWorld(真实计算机环境智能体评测)等。

图2:MCoT基准测试覆盖的任务类型 — 从选择题到开放问答,从单图推理到视频理解,评测维度极为丰富,涵盖艺术、科学、数学、机器人操作等多种领域。
特别值得关注的是评测格式的多样性:既有传统的选择题(MC)形式,也有开放式答案评测;既包含纯视觉推理,也涉及图文混合的复杂推理场景。这种全方位评测体系的建立,为衡量模型真实能力提供了可靠标尺。
这是2024年下半年以来最激动人心的技术方向。以 DeepSeek-R1-Zero 为代表的工作证明:通过强化学习(GRPO算法),模型可以自主涌现出顿悟时刻(Aha-moment)——无需监督微调,模型自行学会了更长的、更有深度的推理链条。
该综述系统梳理了将这一范式迁移到多模态场景的工作:
这些工作的共同特点是:不再依赖大量人工标注的推理步骤数据,而是让模型在强化学习框架下自主探索最优推理策略。
综述详细梳理了MCoT的五大核心方法论:

图3:Rationale Construction(推理链构建) — 模型首先生成中间推理步骤,再基于推理得出最终答案。类似人类写下解题步骤的习惯。这是MCoT最直观的方法,也是其他方法的基础。
1. Rationale Construction(推理链构建):最直观的方法,即让模型先生成一步步的推理理由(rationale),再基于这些理由给出最终答案。
2. Structural Reasoning(结构化推理):引入图结构或树结构来组织多步骤推理过程,特别适合需要多跳(multi-hop)推理的复杂问题。

图4:Information Enhancing(信息增强) — 通过扩充视觉标记(visual tokens)或特征,提升模型在细粒度视觉任务上的推理能力,如将低分辨率图像块上采样为高分辨率处理。
3. Information Enhancing(信息增强):通过扩充视觉标记或增强视觉特征,帮助模型在细粒度视觉理解上做出更准确推理。
4. Objective Granularity(目标粒度):在视觉推理中选择合适的分析粒度——从像素级到物体级再到场景级,不同任务需要不同粒度的注意力分配。

图5:Test-Time Scaling(测试时扩展) — 借鉴o1/o3的慢思考理念,在推理阶段允许模型分配更多计算资源,生成更长的思维链,以牺牲速度换取更高准确率。
MCoT并非只针对静态图像。综述覆盖了更广泛的模态场景:
综述还梳理了MCoT在五大领域的落地应用:
作为一个综述类资源库,Awesome-MCoT 本身不包含模型代码,而是以 Markdown 文档为核心载体,组织形式高度结构化。所有内容通过 GitHub 平台托管,利用 Git 的版本控制和协作功能,支持社区持续贡献更新。
项目涉及的主要研究方法可分为几类技术范式:
该项目最具价值的地方在于其系统性的分类学(Taxonomy)。作者不是简单地罗列论文,而是建立了从模态类型 → 方法论 → 应用领域的三层分类体系,让研究者能快速定位自己关注的方向。这种分类方法本身就是对 MCoT 领域的一次知识梳理和结构化贡献。
如同任何新兴领域一样,MCoT 也面临诸多挑战:
推理真实性的问题:模型生成的推理链是否真正代表模型的思维过程,还是一种表面合规的文本填充?研究表明某些模型的思维链可能存在幻觉推理——看似合理实则因果关系错误的推理路径,这是该领域最重要的未解问题之一。
计算成本:Test-Time Scaling 让推理时间大幅增加,如何在效率和效果之间取得平衡仍是开放问题。以 o3 为例,单次复杂推理的成本高达数百美元。
评测基准的局限:现有基准能否真正反映模型在真实开放场景中的推理能力?OSWorld 等更贴近现实的评测正在逐步建立,但整体评测体系仍在快速演进中,许多现有基准存在数据泄露风险。
跨模态推理的可解释性:多模态推理过程比纯文本更难解释和验证,评估推理质量本身就是一个难题。如何判断一个更好的推理过程而非仅仅一个更好的答案仍是研究前沿。
Awesome-MCoT 的发布填补了多模态思维链领域综述的空白。它不仅服务于研究者,也为产业界提供了技术选型的参考地图。该仓库还同时提供中文翻译版本,降低了中文社区的访问门槛。
从增长曲线来看,该项目自2025年3月发布以来短短数月内获得了超过1000个GitHub Stars,增长速度在同类 Awesome 列表中处于领先水平。其arXiv论文(2503.12605)也持续获得学界关注。
从趋势上看,MCoT 研究正沿着几个方向快速演进:
多模态思维链推理代表了人工智能从感知向认知跃迁的核心路径之一。Awesome-MCoT 作为这一领域的首部系统性综述,以其全面性、时效性和实用性,成为AI研究者和开发者不可多得的参考资源。
对于 AI 爱好者,它是一扇了解大模型思考过程的窗口,展示了AI如何在视觉感知的基础上构建复杂的推理链条;对于开发者,它是把握多模态推理技术脉络、寻找研究方向和工程切入点的实用指南。随着 o1/o3、DeepSeek-R1 等推理优先模型的持续火热,MCoT 必将迎来更多突破——而 Awesome-MCoT 将持续记录这一进程,为社区提供最新的技术导航。