VLM_survey
VLM领域最全面的Awesome List,汇集视觉-语言模型预训练、迁移学习与知识蒸馏的系统化文献调研
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
VLM领域最全面的Awesome List,汇集视觉-语言模型预训练、迁移学习与知识蒸馏的系统化文献调研
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:VLM Survey 项目概览图,展示了视觉-语言模型在视觉任务中的核心地位
想象一下这样的场景:你是一名 AI 研究者,刚刚接到一个新项目,需要在视觉问答(VQA)、图像检索、目标检测等多个视觉任务上快速验证方案。翻遍了 ArXiv、GitHub 和各种技术博客后,你发现 VLM(视觉-语言模型)领域已经"人多势众"——CLIP、LLaVA、BLIP-2、GIT、Flamingo……每一个都有几十篇论文支撑,每一个都有独特的预训练策略和迁移学习方法。你该怎么办?
这就是 jingyi0000/VLM_survey 诞生的背景。这不是一个可以运行的代码仓库,也不是某个模型的实现——它是一份由新加坡南洋理工大学(NTU)研究团队维护的系统化知识图谱,对 VLM 领域进行了全景式梳理。该项目同时也是发表在 CVPR 2024 和 IEEE TPAMI 上的同名学术论文的配套资源,学术权威性和工程实用价值兼备。截至目前,该项目在 GitHub 上已获得超过 3100 颗星,是 VLM 领域最受欢迎的资料型项目之一。
VLM_survey 的核心作者团队来自 南洋理工大学(Nanyang Technological University, NTU),成员包括 Jingyi Zhang、Jia Xing Huang、Sheng Jin 和 Shijian Lu。Shijian Lu 教授是该团队的学术带头人,长期从事计算机视觉与多模态学习研究。
该项目的学术价值体现在它不仅仅做文献罗列,而是从问题定义出发,系统地回答了以下几个关键问题:
这些问题串联起来,构成了一个完整的 VLM 研究知识体系。对于想快速进入该领域的硕博研究生、或需要横向对比各方案的技术负责人来说,这相当于一份"领域地图",可以大幅减少在碎片化信息中迷失的时间。
项目将 VLM 研究归纳为四大核心模块:
VLM 的能力上限很大程度上取决于训练数据的规模与质量。Survey 梳理了 VLM 预训练和评估常用的数据集,包括图像-文本对数据集(如 COCO、VG、LAION-5B)、视觉问答数据集(如 VQAv2、GQA)和图文检索数据集(如 Flickr30k)。每类数据集的特点、规模和适用场景都有清晰的说明,方便研究者和工程师根据任务需求选择合适的数据资源。
这是 Survey 最核心的章节。作者将预训练方法按架构设计分为单流模型(Single-Stream,如 ViLT)和双流模型(Two-Stream,如 CLIP),并详细分析了每种方法在预训练目标(对比学习、生成式学习、混合目标)上的差异与权衡。代表性工作包括 CLIP(OpenAI)、ALIGN(Google)、BLIP(Salesforce)、LLaVA 等,作者对每种方法的核心创新点和性能表现都有客观评述。
将通用 VLM 适配到特定任务(如医学影像分析、工业缺陷检测、遥感图像理解)是工程落地的关键一步。Survey 将迁移学习方法分为提示学习(Prompt Learning)、适配器微调(Adapter Tuning)和全参数微调三大类,并对每类的代表性方案(如 CoOp、LoRA、Tip-Adapter 等)进行了深入分析。这一章节对于需要将 VLM 落地到具体业务场景的开发者来说尤为实用。
知识蒸馏将大型 VLM 的能力迁移到轻量级模型中,是实现端侧部署的核心技术。Survey 梳理了该方向的主要技术路线,包括特征蒸馏、逻辑蒸馏和行为蒸馏,并分析了各方法的压缩效率与精度损失权衡。
VLM_survey 的技术特点可以概括为三点:系统性(覆盖预训练到迁移到蒸馏全链路)、权威性(基于 CVPR/TPAMI 顶级期刊发表的研究成果)、实用性(对每类方法给出了清晰的分类框架和对比分析)。
不过需要注意的是,作为一个 Awesome List 类型的资料汇总项目,它本身不包含可运行的代码。如果你需要的是某个 VLM 的具体实现(如 LLaVA 的推理代码),应该去找对应的官方仓库。VLM_survey 的价值在于帮你快速判断"我应该用哪个模型、参考哪篇论文、从哪里开始"。
Topics 标签:clip, computer-vision, deep-learning, knowledge-distillation, multi-modal-model, survey, transfer-learning, vision-language-model——这些标签精准刻画了项目的定位,非常适合 AI 研究者将其加入书签或 RSS 订阅。
零门槛:直接访问 GitHub 页面即可阅读全部内容,无需安装任何依赖。项目页面结构清晰,通过目录(Menu)可以快速跳转到感兴趣的章节。README 中的每个条目都附带了原始论文链接和简要说明,非常适合作为文献调研的起点。
使用建议:
VLM_survey 主要基于 2024 年以前的研究工作整理,对 2025 年以后快速涌现的大模型进展(如 GPT-4V、Gemini Vision 的商用进展)覆盖有限。此外,作为静态文档,它不会随着新论文的发表自动更新,需要项目维护者持续跟进。读者在使用时应将其视为一个时间快照,结合 ArXiv 等实时资源交叉验证。
VLM_survey 的流行本身反映了 VLM 领域的两个大趋势:
第一,VLM 已从学术研究快速渗透到工业落地阶段。CLIP 开源后,图文多模态理解在搜索、推荐、内容审核等场景的落地速度明显加快。研究者和工程师都需要一个系统化的知识框架来应对这个快速扩张的领域。
第二,知识整理类项目的价值在 AI 时代被重新定义。一个好的 Survey 不再只是文献堆砌,而是通过分类框架、对比分析和使用场景映射,帮助读者从"信息过载"中脱身。VLM_survey 做到了这一点,是值得收藏的优质资源。