Diffusion-Models-Papers-Survey-Taxonomy
普林斯顿博士后整理的扩散模型论文分类索引,双轴体系覆盖算法优化与行业应用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
普林斯顿博士后整理的扩散模型论文分类索引,双轴体系覆盖算法优化与行业应用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你是一位刚入门的 AI 研究者,面对浩如烟海的扩散模型论文,不知从何下手——有的讲采样加速,有的讲似然优化,还有的专门研究如何把扩散模型装进多模态大模型里。Ling Yang 博士(普林斯顿大学博士后)创建的这个项目,就是一张专门为此设计的"知识地图",把截至 2024 年的扩散模型论文按照算法改进和应用领域两条轴线,编织成一张系统性的学科导航图。
图1:扩散模型分类体系概览——从采样加速到多模态融合,覆盖算法与应用两大赛道
2022 年 9 月,Ling Yang 联合其他研究者发表了论文《Diffusion Models: A Comprehensive Survey of Methods and Applications》,被 ACM Computing Surveys 期刊接收。这篇综述论文系统梳理了扩散模型在算法优化和应用拓展两个维度的演进路径,成为该领域的标杆性参考文献,被引用超过数千次。
作者随后将论文中的分类体系搬到了 GitHub,创建了本项目。与传统综述论文不同,这个资料库不是静态的 PDF,而是一个持续更新的 Living Document——作者在仓库中明确承诺,将随论文的更新而同步更新内容。截至 2025 年 9 月,项目仍在维护,最近一次提交为更新 README,作者为普林斯顿大学博士后 Ling Yang(GitHub @YangLing0818)。
如果把扩散模型领域比作一座大型图书馆,传统的论文列表就像是按字母顺序排列的书名清单——条目齐全,但无法告诉你哪本书和哪本书有内在联系。这个项目则更像是一套精心设计的索引卡片系统:它不是简单地列出书籍,而是按照主题(采样优化、似然最大化、多模态融合等)对论文进行分类标注,并在每个子类下列出代表性工作,帮助读者建立"领域拓扑感"。
打个更贴切的比方:它像是给扩散模型世界绘制的一张"地铁线路图"——读者不需要读完所有线路图上的站点(论文),只需要知道自己的目的地(研究问题)在哪条线上,就能快速定位要经过的关键站点。
项目采用双轴分类法,从算法改进和应用拓展两个维度对扩散模型论文进行系统梳理:
算法分类轴(Algorithm Taxonomy),聚焦扩散模型本身的性能优化:
采样加速增强:包括无需学习的 SDE/ODE 求解器(如 DDIM、DPM-Solver)、基于知识蒸馏的加速方法(如 Progressive Distillation)、截断扩散(Truncated Diffusion)等方向。其中 DPM-Solver 系列因将采样步数从 1000 步压缩到 10 步以内而备受关注,被 Stability AI 等机构广泛采用。
似然最大化增强:涵盖噪声调度优化(Noise Schedule Optimization)、逆向方差学习(Reverse Variance Learning)、精确似然计算(Exact Likelihood Computation)等技术。这些方法对于需要精确评估生成数据概率分布的场景(如异常检测、科学计算)尤为重要。
特殊结构数据处理:包括流形数据(Known Manifolds / Learned Manifolds)、离散数据(Discrete Data)、不变结构数据(Invariant Structures)等子方向,解决了扩散模型从图像扩展到图数据、文本、分子结构等非连续数据的关键问题。
扩散模型与多模态大模型融合:探讨如何将扩散模型与 GPT、Claude 等多模态大语言模型进行深度协作,代表性工作包括 Simple Combination 和 Deep Collaboration 两条技术路径。
扩散模型与人类反馈学习:收录了 DPO(Direct Preference Optimization)和 RLHF 在扩散模型中的应用,研究如何用人类偏好数据引导生成方向。
应用分类轴(Application Taxonomy),聚焦扩散模型在各垂直领域的落地:
计算机视觉:涵盖图像超分辨率(Super Resolution)、图像修复(Inpainting)、语义分割(Semantic Segmentation)、视频生成(Video Generation)、3D 物体生成(3D Generation)、异常检测(Anomaly Detection)、目标检测(Object Detection)等几乎所有主流视觉任务。
多模态学习:这是应用部分的重头戏,细分为文生图(Text-to-Image,如 Stable Diffusion、DALL-E 系列)、文生 3D(Text-to-3D,如 DreamFusion)、场景图/布局生成图像(Scene Graph/Layout to Image)、文生音频(Text-to-Audio,如 AudioGen)、文生动作(Text-to-Motion)、文生视频(Text-to-Video,如 Sora、Runway)等方向。
时间序列与波形信号:包括时间序列填补(Time-Series Imputation)、时间序列预测(Time-Series Forecasting)、波形信号处理(Waveform Signal Processing),代表扩散模型从视觉领域向通用感知扩展的趋势。
自然科学应用:涵盖分子图建模(Molecular Graph Modeling)、材料设计(Material Design)、医学影像重建(Medical Image Reconstruction)等前沿交叉方向。
项目还专门章节梳理了扩散模型与 VAE、GAN、Normalizing Flow、自回归模型(Autoregressive Models)、基于能量的模型(Energy-Based Models)等其他生成模型的联系,帮助读者理解扩散模型在整个生成式 AI 版图中的位置——既不是凭空出世,也不是孤岛,而是在与其他模型的对比和借鉴中不断演进。
作为纯 Markdown 资料库,该项目没有任何代码执行环境要求,不需要 GPU,不需要安装任何依赖。读者只需要一个浏览器或 Markdown 阅读器即可浏览全部内容。这种极简的形态反而是一种优势——它将认知门槛降到了最低,让读者把全部注意力放在理解论文之间的关系上,而不是被环境配置消磨热情。
唯一需要注意的门槛是:该资料库默认读者已经了解扩散模型的基本原理(正向扩散过程、反向去噪过程等),更适合有一定深度学习基础的研究者和开发者使用。对于完全的初学者,建议先阅读论文中的基础章节,再配合这份资料库进行进阶学习。
这个项目在定位上有明确的边界:它是一个论文索引和分类系统,而不是代码仓库。项目本身不包含任何可执行代码、模型权重或预训练模型。对于希望在本地运行扩散模型的读者,这个资料库无法直接满足需求——它告诉你"有哪些论文讲了这件事",但不提供"怎么运行这件事的代码"。
此外,由于扩散模型领域发展极快,2023-2025 年间出现了大量新架构(如 DiT、SCM、MDM、SiT 等),资料库的更新速度能否跟上技术迭代,是一个持续的挑战。截至分析时,仓库最近一次提交为 2025 年 9 月,维护状态良好,但条目是否涵盖最新 SOTA 工作仍需读者自行验证。
在生成式 AI 浪潮中,扩散模型从 2020 年的小众研究方向,一跃成为 2022-2024 年最热门的 AI 技术之一,相关论文呈指数级增长。在这样的背景下,对论文进行系统化梳理和分类,本身就是一项重要的基础设施工作。
这个项目的价值不仅在于"找到了什么论文",更在于"建立了一套理解扩散模型的认知框架"——它告诉后来者,这个领域不是一堆孤立的技术,而是一棵有根有叶的学科树。顺着这棵树往下走,可以快速建立对整个领域的全局感知,少走弯路。
对于 AI 开发者而言,这个资料库也是一份高效的情报来源:当你需要调研某个特定方向(如"扩散模型用于时间序列预测"或"扩散模型在分子设计中的应用")时,直接定位到对应分类节点,远比在 Google Scholar 上大海捞针要高效得多。