mm-cot
两阶段门控融合框架,让语言模型结合视觉特征生成中间推理链,提升科学问答准确率
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
两阶段门控融合框架,让语言模型结合视觉特征生成中间推理链,提升科学问答准确率
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有遇到过这样的情况:翻看一本没有插图的教科书,文字描述得再详细,总觉得少了点什么?这正是传统语言模型面临的问题——它们只能处理纯文本,面对图片、图表等视觉信息时就视而不见。亚马逊科学团队推出的Multimodal Chain-of-Thought(多模态思维链,简称MM-CoT)项目,正是为了让AI学会同时阅读文字和看懂图像。

图1:MM-CoT两阶段训练框架:阶段一生成推理依据,阶段二依据答案推断答案
2023年,一篇发表在arXiv上的论文提出了一个核心问题:人类在回答科学问题时,会自然地结合文字描述、图表信息和已有知识来综合推理——这个过程在AI中该如何建模?
论文作者团队来自亚马逊上海研究院和明尼苏达大学,他们以ScienceQA数据集(一个包含约21,000道多模态科学问题的基准数据集)为测试场景,设计了一套让语言模型也能像人类一样边看图、边推理的完整框架。核心思想是:将推理过程拆解为两个阶段——先用视觉特征生成中间推理依据(Rationale),再依据这些依据推断出最终答案。这不是简单地把图片塞进模型,而是通过一种称为门控融合(Gated Fusion)的机制,让视觉信息和文本信息在深层语义上真正对齐。
MM-CoT的技术架构建立在T5编码器-解码器框架之上,但在编码端做了关键创新:设计了一个名为JointEncoder的联合编码器,它同时接收文本token和视觉patch的特征向量,并通过一个门控层(Gate Layer)动态决定每一步推理中视觉信息的权重。这个门控机制让模型学会了什么时候该看图——比如当问题提到图中所示的电路时,视觉权重会显著升高;当纯文字推理就足够时,模型可以忽略图像信息。这种设计比直接拼接视觉特征的做法更高效,也更能捕捉跨模态的细粒度关联。
项目支持多种视觉编码器作为特征提取器,包括ViT(Vision Transformer)、CLIP、ResNet和DETR,这意味着开发者可以根据任务需求灵活切换视觉backbone。训练分两个独立阶段进行:第一阶段训练模型生成中间推理依据,第二阶段冻结或微调第一阶段模型,训练模型依据推理依据推断答案。这种解耦设计让每一阶段都能专注于单一目标,有效降低了多任务学习的干扰。
项目代码结构清晰,核心文件分工明确:model.py定义了联合编码器和门控融合机制;main.py负责第一阶段(推理依据生成)的训练入口;main_central.py负责第二阶段(答案推断)的训练;utils_prompt.py处理提示词模板的构造;utils_data.py处理ScienceQA数据集的读取;utils_evaluate.py负责模型评估;extract_features.py和extract_caption.py则是两个可选工具,用于从原始图像中提取视觉特征和生成图像描述。整个项目基于HuggingFace Transformers构建,便于在现有LLM项目中集成。
值得注意的是,项目还附带了预提取好的视觉特征文件(发布在HuggingFace Hub),包括DETR、ResNet、CLIP和ViT四种特征,以及完整的instruct caption数据。这让没有足够GPU资源的开发者可以直接下载特征文件,跳过耗时的特征提取步骤,降低了复现的门槛。
对于有深度学习研究经验的开发者来说,项目提供了完整的数据处理、训练和推理脚本,README文档清晰,代码注释充分,基本可以直接复用。但需要注意几个门槛:首先,需要自行下载ScienceQA数据集(约数GB)和预提取的视觉特征包(数GB);其次,训练阶段推荐使用多卡分布式训练(代码中硬编码了CUDA_VISIBLE_DEVICES多卡配置),单卡训练时间会大幅增加;最后,模型权重(flan-alpaca-large,约780M参数)和MM-CoT检查点需要从HuggingFace单独下载。
推理阶段相对友好——如果使用项目提供的预训练检查点,只需配置好环境、准备好数据文件(可从HuggingFace直接下载),即可运行推理脚本。对于想研究多模态推理但没有足够训练资源的研究者,推理使用比从头训练要现实得多。
MM-CoT也有一些值得关注的局限性。第一,它本质上是一个微调框架,而非可直接prompt的通用工具,用户必须在自己的数据集上微调才能部署;第二,两阶段训练流程增加了工程复杂度,且两个阶段需要分别调参,实际落地需要一定的深度学习工程经验;第三,项目没有提供推理阶段的Web UI或API接口,需要通过命令行脚本调用,集成到现有产品中需要额外开发。
此外,作为一个2023年的工作,MM-CoT之后出现了大量更强大的多模态推理模型(如LLaVA系列、多模态GPT-4等),从性能指标上已有显著超越。但MM-CoT的两阶段门控融合设计思路,在更高效的多模态融合机制研究中仍有参考价值。
MM-CoT论文在arXiv发表后,在多模态推理领域产生了显著影响。根据OpenReview上的同行评审,ScienceQA数据集和MM-CoT框架在NeurIPS 2022的论文中被多次引用。GitHub仓库已获得近4000颗星,证明了研究社区对多模态思维链推理方向的高度关注。
从技术演进角度看,MM-CoT代表的两阶段先推理后答案范式,启发了后续大量多模态推理工作,包括将类似思路迁移到VQA(视觉问答)、科学图表理解、文档理解等多个细分领域。它的门控融合机制也被后续更复杂的视觉-语言模型所借鉴。
对于今天的AI开发者和研究者而言,MM-CoT的实践意义在于:它展示了一套将多模态信息有机融合进LLM推理流程的完整范式,是理解多模态推理机制的一个优秀起点——尤其是当你关心模型是如何学会结合图片信息进行推理的,而非仅仅模型在benchmark上刷到了多少分时。