Awesome-Controllable-Diffusion
扩散模型可控生成的精选论文导航,涵盖 ControlNet、DreamBooth、InstantID
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
扩散模型可控生成的精选论文导航,涵盖 ControlNet、DreamBooth、InstantID
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你在 Midjourney 或 Stable Diffusion 中输入一句话,AI 已经能生成一幅质量不错的图片。但真正的问题才刚刚开始——如何让 AI「听你的话」?
你可能遇到过这些崩溃时刻:想让 AI 把人物放在画面左侧,结果它随意乱放;想生成一个穿着红色外套的人,结果背景也变成了红色;想要 AI 记住你上传的那张宠物照片,让它生成宠物在不同场景下的照片——结果 AI 完全不认识你的宠物是谁。这些问题的本质,是 AI 生成缺乏精准控制能力。
Awesome Controllable Diffusion 正是为了解决这个问题而生的。这是一个由开发者 atfortes 维护的精选论文列表,系统梳理了 2023 年至 2024 年扩散模型(Diffusion Model)可控生成领域的最新学术进展,涵盖 73 篇论文、30 张配图,主题横跨 ControlNet、DreamBooth、IP-Adapter、InstantID 等核心技术方向。
扩散模型(如 Stable Diffusion、DALL-E、Midjourney)近年来在 AI 图像生成领域取得了突破性进展。然而「随机性」既是优势也是痛点:用户想要的是精准控制——精确控制人物的姿态、物体的位置、图像的风格、特定人物的身份——而这正是传统文生图模型的短板。
2023 年初,ControlNet 的出现标志着一个转折点。它通过在扩散模型的 U-Net 架构中嵌入额外的条件编码器,让用户可以用 Canny 边缘图、姿态骨骼图、深度图等多种信号来引导图像生成。打个比方:传统文生图像是「用文字描述让画家作画」,ControlNet 类技术则是「给画家看一张草图,让他在草图的基础上作画」——有了结构参考,生成结果精准得多。
此后两年间,学术界沿着两条主线高速演进:一是控制手段的多样化(从边缘图到姿态、深度、分割图、风格图);二是控制精度的深化(从粗粒度到实例级别、身份级别)。Awesome Controllable Diffusion 完整记录了这条技术演进路径。
ControlNet 系列是该领域最经典的技术路线。其核心思想是:冻结扩散模型的主干网络,额外训练一个「条件编码器」来学习控制信号,让用户用边缘图、姿态图、深度图等结构化输入来引导图像生成。
2024 年的 Ctrl-X 工作更进一步,提出了结构与外观的彻底解耦:用户可以独立控制图像「长什么样」(外观)和「怎么排列」(结构),两者互不干扰。这项突破意味着,AI 生成图像的控制粒度从「能用」迈向了「精细」。
DreamBooth 解决了「让 AI 认识特定物体」的问题:给它看几张照片,它就能学会这个物体的外观,然后在任何场景中复现。比如上传你家猫咪的三张照片,DreamBooth 就能生成「我家猫在巴黎铁塔下」的画面。
但 DreamBooth 需要对整个模型做微调,成本高、速度慢。2024 年的 InstantID 工作实现了质的飞跃:无需微调,仅凭一张参考图就能在推理阶段锁定特定人脸身份,结合 IP-Adapter 的图像提示能力,实现了「零样本个性化」——这个方向在社交媒体和写真应用中有着巨大的实用价值。
传统扩散模型只认文字提示。IP-Adapter 的贡献在于:让模型同时理解图像和文字两种输入,用户可以上传一张参考图(风格图、构图参考、角色参考),再配合文字描述,实现图+文的协同控制。
这个方向的最新进展(IPAdapter-Instruct)进一步解决了歧义问题:当图像提示和文字提示出现矛盾时,系统能自动判断哪个信号优先级更高,让多模态控制更加可靠。
从 2024 年的论文可以看出,「精准布局控制」是当前最活跃的研究方向之一。Zero-Painter、Training-free Composite Scene Generation 等工作都在解决同一个问题:如何让 AI 精确理解「物体 A 在左上方、物体 B 在右下角」这样的空间指令,并准确执行。
RB-Modulation 和 FreeCustom 则代表了另一条路线——无需额外训练。这类方法通过巧妙的提示工程或注意力图操作,在不改变模型参数的前提下实现布局和身份控制,大大降低了使用门槛。
按技术方向梳理,该列表覆盖的核心领域包括:
如果你正在构建 AI 生图相关的应用,这个列表是一站式的技术调研资源:
作为论文列表项目,它不提供可运行的代码或模型权重。使用时需要注意:
Awesome Controllable Diffusion 是一个高质量的技术文献聚合项目,适合作为扩散模型可控生成方向的入门地图和持续跟踪工具。它的价值在于系统性和时效性——73 篇论文覆盖了从经典工作到 2024 年最新进展的完整光谱,让研究者和开发者能够快速把握这个快速演进领域的技术全貌。
随着 ControlNet、InstantID 等技术逐步走向成熟,可控图像生成正从学术前沿走向工程落地。掌握这些技术的基础原理,对于构建下一代 AI 图像应用至关重要——而这个列表,是目前最全面的起点之一。