Awesome-Prompt-Adapter-Learning-for-VLMs-CLIP
专注收录 CLIP/VLM 提示学习与适配器学习论文的精选列表,含 100+ 方法对比表格与开源代码链接
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
专注收录 CLIP/VLM 提示学习与适配器学习论文的精选列表,含 100+ 方法对比表格与开源代码链接
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你训练了一个强大的视觉模型——它能认识世间万物,能用自然语言描述图片。但当你把它应用到自己的专业领域(比如医疗影像诊断、卫星图像分析、工业零件质检)时,它却"水土不服"了:它不知道"肺结节"长什么样,不理解"裂缝"在遥感图中是什么纹理,更无法识别你的产品缺陷标准。
问题出在哪里?模型很强,但不够专精。传统做法是把大模型在特定领域数据上全部重新训练,但代价是:计算资源海量、容易过拟合、且会遗忘原来学到的通用知识。
那么,有没有一种方法,让大模型"低成本、高效率"地适配下游任务?
这就是 Prompt Learning(提示学习) 和 Adapter Learning(适配器学习) 兴起的大背景——也是今天要介绍的这个 Awesome List 诞生的初衷。
Awesome-Prompt-Adapter-Learning-for-VLMs-CLIP 是一个由研究者 zhengli97 维护的精选论文列表,专注收录视觉-语言多模态模型(VLM)领域的提示学习与适配器学习相关论文。该项目托管于 GitHub,当前已收录 781 Stars,主要面向计算机视觉和 AI 研究社区。
作者本人(郑力,邮箱 zhengli97@qq.com)在项目说明中明确表示,欢迎通过 issue 或邮件补充未被收录的高质量论文,尤其是发表在 CVPR、ICCV、ECCV、ICML、NeurIPS、ICLR 等顶会或 TPAMI/IJCV/TIP 等期刊上的工作。此外,该列表仅收录有开源代码的论文,体现了对可复现性的重视。
该项目目前已有社区贡献者参与维护,包括 Lingfeng Yang(Google Scholar)、Ge Wu、Yu Jiazuo、Qiji Ma 等研究者。
如果我们把预训练大模型比作一台通用发动机,那么:
这正是该项目要系统梳理的核心技术方向——如何以参数高效(Parameter-Efficient) 的方式,让通用视觉-语言模型在特定任务上发挥最大效能。
该列表按技术路线将论文分为以下主要类别:
通过学习一串可优化的"提示词"(通常是连续的向量或 tokens),引导冻结的预训练模型在新任务上表现更好,而无需更新主干网络参数。
代表方法:
在 Transformer 架构的注意力层或前馈网络中插入轻量级适配模块,仅训练这些模块而冻结主干。
代表方法:
通过知识蒸馏技术将提示学习的能力迁移或增强。
代表方法:
关注从基类(Base)到新类(Novel)的泛化性能,是该领域最核心的评估指标之一。
Benchmark 数据集包括:ImageNet-1K、Caltech101、Oxford Pets、StanfordCars、Flowers102、Food101、FGVC Aircraft、SUN397、DTD、EuroSAT、UCF101 等 11 个标准数据集。
传统全量微调一个 CLIP 模型需要更新约 1.5 亿参数,而提示学习方法通常只需要训练 0.1%~10% 的参数。以 CoOp 为例,只需学习 4~16 个可学习向量(对应文本提示词 tokens),就能在 16 个数据集上平均超越原始 CLIP 约 1.5 个百分点。
近年来以 MaPLe 为代表的双分支提示(Dual-Branch Prompting)成为主流范式:不仅在文本编码器侧插入可学习提示,还在视觉编码器侧同步插入提示,使跨模态对齐更充分。实验表明,双分支提示在大多数数据集上优于单分支提示约 2~3 个百分点。
该领域公认最难的问题是:如何让模型在训练时见过的基类上保持高准确率,同时在未见的新类上也表现良好? 这就是"调和平均"(Harmonic Mean, HM)成为主要评估指标的原因——它同时惩罚基类过拟合和新类欠拟合。
该方向自 2021 年 CLIP 发布后迅速崛起,2022-2024 年进入爆发期。仅 CoOp 一篇论文在 Google Scholar 上被引用已超过 5000 次。CVPR、ICCV、NeurIPS 等顶会每年产出 20~40 篇相关论文。
提示学习与适配器学习正在成为 边缘 AI 部署的核心技术:手机端、嵌入式设备、IoT 传感器等资源受限场景下,无法运行全量微调,参数高效方法几乎是唯一选择。
该项目作为精选列表,汇集了从 2021 年至今的主要工作,配有方法对比表格、代码链接和论文链接,对于研究者快速了解领域全貌、对比 SOTA 方法具有很高的实用价值。