awesome-vlm-architectures
收录96个VLM架构,详解视觉语言模型的演进脉络与核心技术方案
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
收录96个VLM架构,详解视觉语言模型的演进脉络与核心技术方案
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,当你给 AI 发一张产品设计图,它不仅能描述图里有什么,还能指出哪些地方需要改进、哪些尺寸不合理、哪些工艺可能存在问题——这种「看懂」图像并「说出」专业见解的能力,正是 视觉语言模型(Vision-Language Model,VLM) 的核心价值。从 2021 年 OpenAI 发布 CLIP 拉开多模态大模型的序幕,到 2023 年 LLaVA 将 GPT-4V 的能力带入开源社区,再到 2024-2025 年 Janus-Pro、Qwen2.5-VL、Llama 3.2-Vision 等模型在多模态理解与生成上持续突破,VLM 领域每隔几个月就会涌现出令人振奋的新成果。
然而,快速迭代的背后是碎片化的知识现状:研究者需要同时追踪数十个团队的论文、代码和评测结果;开发者面对 GitHub 上上百个 VLM 相关仓库,不知从何入手;学生想系统学习 VLM 架构,却找不到一份结构清晰、深入浅出的教材。正是为了解决这一信息过载问题,土耳其 AI 研究者 Gökay Fem 创建了 Awesome VLM Architectures——一个收录了 96 个 VLM 架构的超级知识库。
这个仓库以 325,000 字的 README 为核心,每篇架构条目包含:论文链接、作者团队、核心创新点解析、详细架构描述、训练方法、数据集信息,以及指向 HuggingFace 和 GitHub 的资源链接。截至 2026 年 6 月,该仓库已获得 1,265 颗 GitHub Stars,是 VLM 领域最受欢迎的 Awesome List 之一。
Awesome VLM Architectures 的 96 个模型并非随意堆砌,而是按照技术范式形成了清晰的演进脉络。深入阅读这份文档后,可以将收录模型归纳为以下 五大类别:
这一批模型奠定了 VLM 的基本范式:双塔架构(Dual-Encoder)——视觉编码器和语言编码器分别处理图像和文本,再通过对比学习对齐表示空间。
CLIP(OpenAI, 2021) 是这一范式的奠基之作。它用 4 亿图像-文本对进行对比预训练,首次证明了大规模预训练可以在 zero-shot 场景下实现强大的视觉分类和图像-文本匹配能力。CLIP 的成功催生了一系列改进版本:MetaCLIP 探索了 CLIP 训练数据的优化策略;Alpha-CLIP 引入了 alpha 通道机制,让 CLIP 能够聚焦图像中的特定区域;SigLIP 改用 sigmoid 损失替代对比损失,在保持性能的同时降低了训练复杂度。
BLIP(Salesforce, 2022) 在 CLIP 的基础上引入了图文生成能力,提出了 Bootstrapping Language-Image Pre-training 范式,通过两阶段训练(图文对比 + 图文生成)同时学习理解和生成。BLIP-2 则在此基础上增加了 Q-Former 模块,可以在冻结视觉编码器和语言模型的条件下高效对齐多模态表示,大幅降低了训练成本。
2023 年,随着 GPT-4V 的发布,VLM 进入了一个全新阶段:将强大的语言大模型(LLM)作为多模态理解的核心大脑,视觉信息通过一个连接模块(Connector/Projector)映射到语言模型的输入空间。这标志着 VLM 从「双塔对比」转向「统一生成」的技术范式转变。
LLaVA(2023) 是这一波浪潮的开创者。它用线性投影层(Linear Projection)将 CLIP 视觉特征映射到 Vicuna 语言模型的 embedding 空间,用 GPT-4 生成的视觉指令数据(SFT-158K)进行微调,首次在开源社区复现了 GPT-4V 式的多模态对话能力。LLaVA 1.5 将线性投影替换为 MLP(多层感知机),并将 CLIP 视觉编码器分辨率提升至 336×336,在 11 个学术基准上刷新了开源 VLM 的 SOTA。LLaVA 1.6(即 LLaVA-NeXT) 引入了 AnyRes 策略支持 672×672 高分辨率输入,融入了 OCR 和世界知识数据,在 32 张 A100 上仅需一天即可完成训练。
MiniGPT-4 / MiniGPT-v2 则探索了更高效的对齐策略:仅用单层线性投影连接 Q-Former 和 Vicuna,在 4 张 A100 上训练 20,000 步即可获得基本的视觉对话能力。
这一类别收录了在 VLM 架构层面做出原创性贡献的模型:
Flamingo(DeepMind, 2022) 引入了 Perceiver Resampler + 门控交叉注意力层(Gated Cross-Attention),可以在冻结语言模型的条件下通过图文交错的序列进行 few-shot 学习,开创了「上下文学习」在多模态领域的应用。OpenFlamingo 是其开源复现版本。
KOSMOS-1(Microsoft, 2023) 是首批将多模态感知(图像、文本、音频等)与语言模型统一训练的模型,引入 MAGNETO 和 XPOS 位置编码来提升 Transformer 的训练稳定性和外推能力。KOSMOS-2 在此基础上增加了 **定位(Grounding)**能力,将边界框坐标编码为离散的位置 token,实现了图像区域的精确引用。
CogVLM(智谱AI, 2023) 通过**视觉专家模块(Visual Expert)**在冻结的 LLM 权重上添加可训练的视觉参数,避免了传统方法中视觉信息被语言先验覆盖的问题。CogVLM2 在此基础上扩展了视频理解能力。
InternLM-XComposer 系列(上海人工智能实验室)是国内最具影响力的 VLM 之一:XComposer2 支持 4K HD 超高分辨率图像处理;XComposer-2.5 支持超长上下文输入输出,可处理上百页的文档和长视频。
随着 VLM 能力逐渐成熟,学术界开始关注如何在资源受限的端侧设备上部署:
MobileVLM(美团, 2023) 使用 CLIP ViT-L/14 视觉编码器配合轻量级 MobileLLaMA 语言模型,并设计了 LDP(Lightweight Downsample Projector) 用深度可分离卷积实现高效的视觉-语言特征对齐,推理速度比同精度的主流模型快 2-3 倍。
SmolVLM 将 VLM 压缩到极致,仅需约 2B 参数即可运行,适合在消费级 GPU 甚至高性能 CPU 上部署。
MiniCPM-V(面壁智能, 2024) 系列是当前端侧 VLM 的标杆:MiniCPM-Llama3-V 2.5 以不到 8B 的参数在多项基准上达到 GPT-4V 水平;MiniCPM-o-2.6 更进一步,支持视觉、语音、多模态流式交互,在手机上即可实时运行。
OmniVLM 专门针对 sub-billion(不到 10亿)参数场景优化,通过 token 压缩技术显著减少视觉 token 数量,在移动端实现了可用性极高的 VLM 推理。
这一类别收录了近两年最前沿的研究成果,代表了 VLM 领域的最新进展:
Janus-Pro(DeepSeek, 2025) 提出了「理解与生成统一」的架构设计,用独立的视觉编码器分别处理多模态理解和图像生成任务,通过数据与模型的双重Scaling实现了超越同期开源模型的性能。
Llama 3.2-Vision(Meta, 2024) 将 Meta 最新一代 Llama 3 语言能力与视觉编码器结合,是目前开源社区最强大的开源多模态模型之一。
Qwen2.5-VL(阿里云, 2025) 在 Qwen2-VL 基础上进一步扩展了视觉理解的上限,支持超长视频理解(数小时级别)、动态分辨率处理和结构化输出。
PaliGemma 2(Google, 2024) 是 PaliGemma 系列的升级版,提供 3B/10B/28B 三种参数规格,配合 224/448/896 三种分辨率选择,通过多阶段预训练实现了出色的跨任务迁移能力,在 OCR、表格识别、乐谱识别等任务上达到了 SOTA。
NVLM(OpenGVLab, 2024) 提出了将混合专家(MoE)架构与 VLM 结合的新思路,在保持推理效率的同时大幅提升了模型容量。
Apollo(Meta, 2024) 专注于视频理解,引入了「Scaling Consistency」概念,证明在小模型上验证的设计决策可以有效迁移到大模型,并在 ApolloBench 评测中将评估速度提升了 41 倍。
尽管收录的 96 个模型各有创新,深入分析后可以发现它们大多遵循一个 三层架构范式:
第一层:视觉编码器(Visual Encoder)
绝大多数 VLM 的视觉前端都基于 Vision Transformer(ViT)架构。经典选择包括 CLIP 的 ViT-L/14、BLIP-2 中使用的 EVA-CLIP、以及近年来表现更优的 SigLIP-So400m。部分创新模型尝试用 ConvNeXt(ConvLLaVA)或 InternViT 替代 ViT,以获得更好的图像压缩效率或多尺度特征提取能力。
第二层:视觉-语言连接模块(Connector/Projector)
这是 VLM 架构最核心的差异化所在。连接模块负责将视觉特征「翻译」为语言模型可以理解的 token 序列。根据复杂度从低到高,主要有以下几类:
第三层:语言大模型(Large Language Model)
当前主流 VLM 的语言后端几乎清一色采用开源 LLM:Vicuna(基于 LLaMA)、Qwen 系列、InternLM、Llama 2/3 系列、以及 Google 的 Gemma 系列。选择标准主要考虑:模型规模(7B/13B/34B/70B)、推理效率(是否支持 GGUF 量化)、以及语言能力与特定任务的匹配度。
早期 VLM(如 LLaVA)采用经典的两阶段训练范式:
随着技术发展,三阶段训练逐渐成为主流(LLaVA-NeXT、LLaVA-OneVision 等):
传统观点认为训练时应冻结视觉编码器以保留其预训练知识。但近年来的实验表明:适度解冻视觉编码器(尤其是高分辨率阶段)可以显著提升模型性能——ConvLLaVA 通过训练 ConvNeXt 视觉编码器,在 1536×1536 高分辨率下依然保持了高效的 token 压缩。
VILA² 提出了一个优雅的思路:用 VLM 本身来生成更高质量的训练数据。具体做法是:先用基础 VLM 生成图像的详细描述(re-captioning),再用增强后的数据训练更强的 VLM,形成自我提升的良性循环。
收录模型使用的数据集可以归纳为三大类:
通用图文数据:CC3M/CC12M、LAION-2B、COYO-700M、WebLI(10亿图文对,100+语言)、OBELICS(交错图文网页文档)等。这些大规模数据集是 VLM 获得基础视觉-语言对齐能力的关键。
学术评测基准:VQAv2、GQA、ScienceQA 用于通用视觉问答;DocVQA、ChartQA、TextVQA 用于 OCR 和文档理解;SEEDBench、MMbench 用于多维度综合评测;MMMU 用于多模态大学级推理题。
专项数据集:GRIT(KOSMOS-2 用于定位任务)、COST(Chinese Omnipotent Scene Understanding Dataset)用于中文场景理解,YouTubeThumbnail-VQA 用于视频缩略图理解。
Awesome VLM Architectures 最大的价值在于系统化的架构梳理。在学术论文中,作者通常只详细介绍自己提出的模型,与同类工作的对比分散在 Related Work 章节或附录中。而这份文档为每个模型都提供了相当详细的架构解析、训练方法说明和数据集信息,相当于一份持续更新的 VLM 综述论文,且比任何静态论文都更贴近最新研究进展。
对于正在设计新模型的 researchers,这份文档提供了丰富的消融实验参考:不同 Connector 方案的效果对比(Linear vs MLP vs Q-Former)、冻结 vs. 解冻视觉编码器的影响、高分辨率策略(AnyRes、切片压缩、多尺度特征)的取舍依据——这些在原论文中往往需要跨多篇论文才能拼凑完整。
开发者可以利用这份文档快速完成技术选型:如果要在移动端部署,参考 MobileVLM/MiniCPM-V 的方案;如果要做视频理解,Apollo/VideoLLaMA 提供了成熟的架构参考;如果需要处理高分辨率文档,INF-LLaVA/InternLM-XComposer2-4KHD 是首选。
此外,文档中每个条目都附带了 HuggingFace Spaces 链接和 GitHub 代码仓库链接,开发者可以快速试用或基于开源实现进行二次开发。
对于希望系统学习 VLM 的学生和研究新人,这份文档提供了一条从经典到前沿的完整学习路径:从 CLIP 的对比学习范式入门,理解双塔架构的视觉-语言对齐原理;再到 Flamingo 的上下文学习,理解如何将视觉信息融入生成式语言模型;最后到 LLaVA 系列,理解统一生成范式下 VLM 的完整训练流程。
每个模型条目中的 <details> 折叠区域提供了远超表面描述的深度内容,包括训练数据集、损失函数、优化策略等细节,对于需要深入理解某个模型的读者极具参考价值。
尽管 Awesome VLM Architectures 是一个极为优质的知识库,用户在使用时也需要注意以下几点:
信息时效性:由于 VLM 领域发展极快,部分模型的评测数据和性能排名可能已经发生变化。例如,文档中某些 2023 年被评为 SOTA 的模型,在 2025-2026 年的新模型面前已不再领先。建议读者将文档作为系统学习的索引工具,而非最新排行榜。
架构细节的深度:文档中的架构解析虽已相当详细,但毕竟是对原论文的提炼和翻译,某些技术细节(如特定层的归一化策略、注意力掩码的具体设计)需要读者回到原始论文中深入挖掘。
非完整代码资源:这是一个文档库而非代码库。模型的实际训练和推理代码需要参考各模型自己的 GitHub 仓库。文档的 Tools 列表中收录了 DualView(dualview.ai),这是一个免费的 VLM 输出对比工具,可以帮助开发者和研究者直观比较不同 VLM 对同一图像/视频的输出质量。
Awesome VLM Architectures 是 VLM 领域最具系统性和深度的Awesome List 之一。它以 96 个里程碑式模型为节点,以 325,000 字的详细解析为脉络,绘制了一幅从 CLIP 到 Llama 3.2-Vision 的完整技术演进图景。对于 AI 研究者,它是一份可检索的架构百科;对于开发者,它是快速定位合适模型和参考实现的工具手册;对于学习者,它是一条从经典到前沿的系统学习路径。
更重要的是,这份文档体现了 VLM 领域的几个核心趋势:从双塔对比到统一生成的范式转变、从通用视觉理解到高分辨率/视频/端侧的多维拓展、从单一模态到语音+视觉+文本的全模态融合。理解这些趋势,比记住任何一个具体模型的参数配置都更有长远价值。