Awesome-RAG-Vision
汇聚200+ 篇论文的 RAG+ 计算机视觉学术精选列表,覆盖视觉理解、生成与具身智能三大方向
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
汇聚200+ 篇论文的 RAG+ 计算机视觉学术精选列表,覆盖视觉理解、生成与具身智能三大方向
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Awesome RAG Vision 项目徽章
想象一下,你是一个医学影像 AI 研究员,面对一张复杂的 CT 片。传统的多模态大模型会凭记忆回答,但可能会因为缺乏最新医学文献而说错。而 RAG-Vision 的思路是:在推理时,先去检索库里找相关论文和案例,再结合视觉输入生成答案——就像你查完文献再写论文一样。
Awesome RAG Vision(原文名 Awesome RAG in Computer Vision)是一个由独立研究者 zhengxuJosh 维护的学术精选列表。作者观察到,在 NLP 领域 RAG(检索增强生成)已经是非常成熟的技术范式,但在计算机视觉方向,相关研究分散在各个子领域,缺乏系统梳理。于是他在 GitHub 上创建了这个项目,目标是把 RAG 与视觉交叉的前沿论文系统整理成一个「学术地图」。
项目采用 MIT 协议开源,截至分析时已获得 336 颗 GitHub Stars,收录论文数量超过 200 篇,涵盖 CVPR、ICCV、NeurIPS、AAAI 等顶会论文。
RAG(Retrieval-Augmented Generation)的核心思想是在生成答案之前,先从外部知识库中检索相关内容。当这个思想迁移到计算机视觉领域,就产生了 RAG for Vision 这一新兴方向。
视觉理解方向是收录最多的子领域。典型应用包括:基于检索的科学图表问答(RAVQA-VLM,AAAI 2025),在推理时动态检索外部知识来减少视觉问答中的幻觉(FilterRAG,arXiv 2025),以及利用检索增强开放词汇目标检测(CVPR 2024)等。这些工作的共同特点是:不依赖模型参数记忆知识,而是通过检索获取最新、最准确的信息。
视觉生成方向同样引人注目。检索增强的图像生成允许模型在生成时参考真实参考图像或领域知识,ReMoDiffuse(ICCV 2023)就是一个将检索融入扩散模型的动作生成工作。
具身智能(Embodied AI)方向收录了 RAG 与自动驾驶、机器人导航的交叉工作,包括 RAG-Driver(CVPR 2024)、Embodied-RAG 等,这些工作通过检索驾驶手册或环境知识来辅助自动驾驶决策。
项目本质上是一个精心维护的 Markdown 文档库。README.md 按主题分为三大板块:
每篇论文都标注了作者、发表 venue/日期和论文链接,部分附带了 GitHub 链接,方便研究者直接跳转阅读或复现。
适合谁用:
**使用门槛:**极低。无需安装任何代码,只需打开 GitHub 页面浏览即可。唯一要求是有一定的计算机视觉和 NLP 基础知识,能理解论文解决的问题。
作为一个精选列表而非代码项目,Awesome RAG Vision 有几个固有局限:
Awesome RAG Vision 的出现本身就是一个信号:RAG 从 NLP 领域向多模态扩展的趋势正在加速。2025 年的论文数量相比 2024 年明显增多,尤其在 ICCV 2025 和 AAAI 2025 上有多篇相关工作。从技术路线看,RAG-Vision 正从单模态(纯视觉)向多模态(视觉+语言+知识图谱)融合,从静态图像向视频和具身智能延伸。
这个项目为整个社区提供了一个高效的了解 RAG+CV 全貌的入口,对于推动该方向的学术交流和工程落地都有积极意义。