Mantis
首个多图像交织指令微调大模型,36小时训练即达5项SOTA,荣膺TMLR 2024最佳论文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个多图像交织指令微调大模型,36小时训练即达5项SOTA,荣膺TMLR 2024最佳论文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Mantis 在 5 大多图像 benchmark 上的性能雷达图,来源项目官方 README
你正在用大模型做图像对比任务——比如让 AI 比较两张 X 光片的差异,或者分析一组商品图片中哪款更受欢迎。但无论 GPT-4V 还是 Gemini,都很难准确回答"图 A 和图 B 之间有什么不同"这类需要同时理解多张图像的问题。
问题出在哪儿?现有的大多模态模型(LMM)主要靠海量网络爬取的噪声图文数据进行预训练,数据质量参差不齐,训练效率低下。TIGER-AI-Lab(滑铁卢大学 AI 实验室)的研究团队敏锐地捕捉到了这个痛点,于 2024 年推出了 Mantis,用学术级算力(仅 36 小时 / 16×A100-40G)训练出一个在多图像理解上全面超越 GPT-4V 的开源模型,并凭借扎实的研究贡献荣获 TMLR 2024 最佳论文,2025 年再度获评 TMLR Outstanding Paper。
过去几年,单图像视觉问答(VQA)已被 LLaVA、InstructBLIP 等开源模型基本解决。但多图像联合理解——让模型同时处理两张以上的图像,并理解它们之间的空间、语义、时序关系——始终是开源社区的短板。商业模型如 GPT-4V 可以做到,但闭源、贵、有隐私风险。
Mantis 的核心洞察是:与其在海量噪声网络数据上盲目预训练,不如构建一个高质量的、多图像交织的指令微调数据集,让模型在有限算力下也能习得强大的多图像技能。团队从 14 个数据子集精心构建了 Mantis-Instruct,共 72.1 万条图文交织样本,涵盖四大核心能力:
| 能力类型 | 说明 | 覆盖数据集 |
|---|---|---|
| 共指理解(Co-reference) | 理解跨图像的指代关系 | LLaVA-665k-multi、LRV-multi 等 |
| 推理(Reasoning) | 基于多图进行逻辑推导 | Multi-VQA(GPT-4 生成)、MMMU 等 |
| 对比(Comparing) | 比较图像异同 | Coinstruct、Dreamsim、NLVR2 等 |
| 时序理解(Temporal) | 理解视频帧间时间关系 | NextQA、STAR 等 |
Mantis 基于 LLaMA-3 作为语言基座,融合多种视觉编码器(SigLIP、Idefics2、Qwen2-VL 等),通过交织图文指令微调(Interleaved Image-Text Instruction Tuning)实现多图像理解。
项目代码在 mantis/models/ 目录下实现了多种视觉-语言融合架构:
mantis/models/mllava*:LLaVA 风格的视觉投影层,将 CLIP/SigLIP 视觉特征映射到 LLM 空间mantis/models/idefics2/:mantis/models/idefics2/ 下包含完整的 Idefics2 模型实现,含 modeling_idefics2.py(核心 Transformer)和 processing_idefics2.py(图像预处理)mantis/models/openflamingo/:OpenFlamingo 风格的门控交叉注意力架构mantis/models/qwen2_vl/:Qwen2-VL 架构实现(支持视频帧理解)mantis/models/siglip_video/:结合 SigLIP 视觉编码器的视频理解模块每种架构都有对应的训练脚本(mantis/train/train_*.py)和推理脚本(mantis/mllm_tools/),并支持通过 HuggingFace Transformers 直接加载。
mantis/train/ 目录是核心训练引擎:
data.py:数据加载,支持多图像交织格式的样本批处理train_utils.py:通用训练工具函数(学习率调度、梯度裁剪等)train_*.py 文件:针对不同视觉编码器(Fuyu、Idefics2、Mllava、Qwen2-VL 等)的专项训练脚本accelerate_configs/):提供 DDP / FSDP / ZeRO 多机多卡配置,从单卡到 64 卡均可覆盖mantis/benchmark/:内置 NLVR2、Q-Bench、BLINK、MVBench、Mantis-Eval 等 5 大 benchmark 的评测代码mantis/mllm_tools/:兼容 15+ 种主流多模态模型的推理工具,包括 GPT-4V、CogVLM、Emu2、Idefics2、LLaVA 等,方便做横向对比mantis/easy_openai/:封装 OpenAI 风格 API,支持调用 GPT-4V 做数据生成或评估裁判Mantis-Instruct 是这个项目的灵魂所在。项目提供完整的数据准备脚本(data/ 目录下 30+ 个子目录),每套数据集均有 prepare.py 和 prepare.sh,方便研究人员复现或扩展。
其中值得一提的是 Multi-VQA 子集——团队直接用 GPT-4 API 生成了大量多图像问答数据,无需人工标注,成本可控、质量可控。此外还专门构建了 Contrast-Caption(对比描述)和 Multi-VQA 两个新数据集来强化对比和推理能力。
数据集可通过 data/download_mantis_instruct.py 一键下载(依赖 Git LFS),完整下载约需 1 小时。
Mantis 提供了简洁的 CLI 推理界面(基于项目 mantis/ 目录),无需 Web UI,适合集成到自动化流程中。
推理示例(来自项目 README):
# 下载预训练模型(支持 HuggingFace)
# 推荐模型:TIGER-Lab/Mantis-8B-siglip-llama3
# 准备数据(已在 data/examples/ 中预置)
python mantis/eval/eval.py --model TIGER-Lab/Mantis-8B-siglip-llama3 --benchmark nlvr2
项目还提供了与 HuggingFace Spaces 的 Gradio Demo 集成(huggingface.co/spaces/TIGER-Lab/Mantis),可在浏览器中直接体验多图像对话能力,但当前项目代码本身不包含 Web UI 组件。
Mantis 在 5 大多图像 benchmark 上均达到 SOTA:
| Benchmark | 核心考察 | Mantis-Idefics2 | 最高 Baseline | 提升 |
|---|---|---|---|---|
| NLVR2 | 共指理解 | ~92% | Idefics2-8B | +13% |
| Q-Bench | 低级视觉感知 | ~75% | GPT-4V | 持平 |
| BLINK | 快速视觉推理 | ~58% | 各类开源模型 | +8% |
| MVBench | 多视频帧理解 | ~42% | VideoChat | +12% |
| Mantis-Eval | 综合多图像技能 | ~68% | - | - |
关键的是,Mantis 并未牺牲单图像性能——在 VQAv2、GQA 等单图像 benchmark 上与 CogVLM、Emu2 持平,实现了多图像与单图像能力的双赢。
Mantis 定位为研究复现代码库,非生产级部署产品:
pip install -e .)Mantis 的成功证明了数据质量 > 数据规模在多模态训练中的重要性,为开源社区提供了可复现的高质量多图像训练范式。随着 Qwen2-VL、InternVL 2.5 等新架构不断涌现,多图像理解正在从"奢侈品"走向"标配功能"。Mantis 作为 TMLR 最佳论文,为这一趋势奠定了重要的学术基准。
关键趋势信号: