Awesome-Diffusion-Models
GitHub最全扩散模型论文索引库,2928篇顶会论文按领域分类,AI生图研究者必备导航
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
GitHub最全扩散模型论文索引库,2928篇顶会论文按领域分类,AI生图研究者必备导航
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,当你打开一个页面,发现它像一张"AI生图领域的全景地图"——从2015年Score Matching的理论萌芽,到2023年DALL-E 3、Stable Diffusion掀起全民创作热潮,2928篇顶会论文和arXiv预印本被系统整理,按应用领域层层分类。这不是教科书,而是GitHub上最全的扩散模型论文索引库。
Awesome-Diffusion-Models 由独立研究者维护(org: diff-usion),2021年9月创建,至今已累积超过1.2万颗星、1015个Fork,涵盖从基础理论(DDPM、Score-Based Models)到多模态应用(文生图、文生视频、3D分子生成、语音合成)的完整发展脉络。它与Stable Diffusion论文并列成为diffusion领域最具影响力的学习资源之一。
如果说传统的论文库是图书馆的卡片目录,那么Awesome-Diffusion-Models就是一位精通扩散模型的"论文导航员"——它按照应用领域(Vision、Audio、Natural Language、Graph、Tabular & Time Series)划分章节,每个领域下再细分任务(例如Vision下有Generation、Segmentation、Medical Imaging等),并标注论文来源(arXiv / NeurIPS / ICLR / ICML)和GitHub链接。这种多维度索引让研究者可以快速定位自己需要的论文,而不必在浩如烟海的arXiv中逐一搜索。
1. 按领域分类的论文索引
项目将扩散模型相关论文分为5大领域:
Vision(视觉):涵盖图像生成(DDPM、LDM、DiT)、图像翻译(InstructPix2Pix)、视频生成(Video Diffusion、Latent Video Diffusion)、3D重建、医学影像等核心方向。其中DiT(Scalable Diffusion Models with Transformers)将Transformer引入扩散模型,标志着该领域进入新阶段。
Audio(音频):包括语音生成(TTS)、语音增强、语音分离、音频转换等。代表工作如DiffWave(基于分数匹配的声波生成)和Grad-TTS(基于扩散的语音合成),展示了扩散模型在时序信号上的强大建模能力。
Natural Language(自然语言):探索扩散模型在文本生成领域的应用,涵盖文本到文本生成、机器翻译、代码生成等。Diffusion-LM首次将连续扩散模型引入可控文本生成,引发了大量后续研究。
Graph(图结构):分子图生成(GraphGDP、DiGress)、蛋白质结构生成(RFdiffusion、FrameDiff)、材料设计等。扩散模型在3D分子构象生成上的突破,正在加速新药发现和材料科学的进程。
Tabular & Time Series(表格与时序):时间序列预测(CSDI、TimeGrad)、缺失值填补、概率预测等方向。Score-based模型在金融、医疗等需要对不确定性建模的场景中表现出色。
2. 自动构建的静态网站
项目通过Python脚本(website/main.py)从db.json数据库自动生成HTML页面(docs/目录),实现了论文数据的可视化展示。这套生成体系基于Jinja2模板,支持按领域、按任务、按时间排序浏览,相当于一个可离线使用的本地论文数据库。
3. 精选资源导航
除了论文索引,项目还收录了入门讲座(Introductory Lectures)、综述论文(Survey Papers)、博客文章(Posts)和教程(Jupyter Notebooks),帮助不同阶段的研究者快速上手。对于刚接触扩散模型的学习者,这些资源是宝贵的系统性入口。
Awesome-Diffusion-Models本质上是一个静态内容聚合项目,其架构简洁而高效:
README.md <- 主入口,手工维护分类索引(Markdown格式)
db.json <- 结构化论文数据(Python构建脚本来源)
website/
main.py <- 使用Jinja2模板从db.json生成HTML
build.sh <- 一键构建脚本
docs/ <- 生成的静态HTML页面(可部署为GitHub Pages)
template/ <- HTML模板与样式文件
项目主要使用Python(构建脚本)和HTML/CSS(展示层),无深度学习依赖,零运行成本。维护者通过手动或脚本方式向db.json添加新论文,再触发HTML生成流程,最终push到GitHub Pages。
使用门槛:极低——无需安装任何依赖,直接在GitHub上浏览README.md即可获取完整内容。如果需要本地搜索,可以clone后使用VS Code的全文搜索或Typora等Markdown阅读器。
推荐使用场景:
作为一个人工维护的精选列表,该项目不可避免地存在一些局限:
这些局限并不影响其作为学习工具的价值,但对于需要完整覆盖的研究场景,仍需结合Papers with Code、arXiv Sanity等工具交叉验证。
扩散模型从2019年DDPM提出,到2022年Stable Diffusion爆火,再到2023年Sora展示视频生成潜力,短短几年间从学术研究走向大众应用。Awesome-Diffusion-Models作为这一浪潮的忠实记录者,其1.2万星的关注量本身就是一个信号——说明整个AI社区对扩散模型的学习需求极其旺盛。
该项目也反映了开源社区的一种重要协作模式:由少数核心维护者驱动,依靠社区提交PR持续补充内容。它不仅是一个工具,更是一个让全球研究者共同参与的知识沉淀平台。随着diffusion继续向多模态、3D生成、科学计算渗透,这类高质量资源库的价值将持续放大。
图1:Awesome-Diffusion-Models项目徽标(MIT License)