Awesome-LLMs-meet-Multimodal-Generation
LLM多模态生成领域最全论文地图,覆盖图像/视频/3D/音频四大模态共545篇
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
LLM多模态生成领域最全论文地图,覆盖图像/视频/3D/音频四大模态共545篇
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:深夜 11 点,你正苦思冥想一个关于"如何用大语言模型生成 3D 场景"的研究方向。翻遍 arXiv、刷遍 Twitter,却越看越迷茫——相关工作散落在十几个子领域,每篇论文各说各话,根本找不到一张全局地图。
Yingqing He 团队的这篇综述,就是为你画这张地图的。 他们把 LLM 多模态生成与编辑这个碎片化的领域,梳理成了一张完整的知识网络。
这篇论文发表于 ECCV 2024,收录了 545 篇参考文献,覆盖图像、视频、3D、音频四大模态,是目前该领域最系统的survey之一。
背景要追溯到两条技术线的交汇。 一条线是 GPT-4V、Gemini、LLaVA 等多模态大模型的能力跃升,让 AI 开始"看得懂"世界;另一条线是 Stable Diffusion、Sora、AudioGen 等生成模型的成熟,让 AI 开始"造得出"世界。
当这两条线合流,就产生了新的可能性:能不能让大语言模型作为"大脑",来规划和控制图像、视频、3D、音频的生成?
这个方向的突破意义在于:传统生成模型是"盲"的,靠 CLIP 文本编码器理解语义;而 LLM 作为控制器,可以引入推理链(Chain-of-Thought)、工具调用(Tool Use)和多轮交互,实现更可控、更智能的生成。
仓库按照两个维度组织论文:
维度一:模态类型
维度二:任务类型
特别值得关注的是 Multimodal LLM Safety 章节,系统梳理了多模态 AI 的安全攻击手段(如对抗样本、提示注入)和防御策略,这是大多数生成式 AI 综述容易忽略的维度。
图像生成方向:MetaMorph 通过指令微调统一视觉理解和生成;VILA-U 提出统一基础模型;X-Prompt 探索在 VLM 中实现上下文图像生成。这些工作的共同目标是打破"理解"和"生成"的壁垒。
视频生成方向:以 Diffusion Transformer 为核心架构,配合 Video Tokenizer 实现高效时空压缩。Sora 发布后,该领域加速从"短视频"向"长视频+物理仿真"演进。
3D 生成方向:LLM 扮演"3D 规划器"角色,将文本指令分解为几何指令,驱动 NeRF 或 Mesh 生成。代表作如 LLM-3D、SceneCraft 等。
音频生成方向:AudioGen、MiniGPT-music 等将 LLM 的序列建模能力迁移到音频 token,实现 text-to-sound 的高质量生成。
场景一:找研究方向 按目录导航到你感兴趣的模态,按时间线梳理最新工作,找到"SOTA 还没覆盖"的空白点。比如"LLM-based 3D 编辑"目前论文相对较少,可能存在机会。
场景二:写论文Related Work 引用仓库中的分类框架,快速建立论文的领域背景。仓库提供了 citation.json,可以直接导出 BibTeX。
场景三:追踪最新进展 仓库持续更新,可以通过 GitHub Star 变化判断哪些子领域正在快速涌现新工作。
坦率讲,这个领域的核心瓶颈依然存在:
这篇综述和配套仓库,代表了 AIGC(生成式人工智能)从"单模态工具"向"多模态智能体"演进的趋势。随着 GPT-4o、Gemini 1.5 Pro 等原生多模态模型的发布,"用 LLM 控制一切内容生成"正在从概念走向现实。
这个仓库是 AI 爱好者理解行业全貌的入口,也是开发者寻找技术切入点的地图。
本文基于 GitHub 仓库 Awesome-LLMs-meet-Multimodal-Generation(546★)和 arXiv:2405.19334 整理,仓库配套有 ECCV 2024 Tutorial 幻灯片,可配合阅读。