sd-webui-deforum
让 Stable Diffusion 学会「动起来」的 AI 动画生成插件,通过数学关键帧控制实现 2D/3D 动态短片创作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 Stable Diffusion 学会「动起来」的 AI 动画生成插件,通过数学关键帧控制实现 2D/3D 动态短片创作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你昨晚用 AI 生成了一张赛博朋克风格的城市夜景图——霓虹灯闪烁、高楼林立、雾气弥漫。今天醒来,你突发奇想:能不能让这张图「动起来」?让雾气缓缓流动,让霓虹灯有节奏地闪烁,让镜头缓缓推进?
这就是 Deforum Stable Diffusion 存在的意义。它是 AUTOMATIC1111 Stable Diffusion WebUI 的官方扩展插件,将原本只能生成静态图像的 AI 绘图工具,变成了一套完整的动画生成引擎——用户通过参数化的时间轴控制,让 Stable Diffusion 在时间维度上「思考」,从而创作出连贯的 AI 动画短片。

图1:Deforum 在 A1111 WebUI 中的操作界面,用户可在标签页内完成所有动画参数配置。
Deforum 的创始人 kabachuha(贡献 742 次提交)于 2022 年在 Jupyter Notebook 环境中开发了最早的 Deforum 脚本,彼时 Stable Diffusion 刚刚开源不久,AI 绘图还停留在「一键出图」的阶段。kabachuha 和社区成员意识到:SD 的潜在能力远不止静态图像——它本质上是一个强大的图像生成函数,只要在时间维度上施加参数化引导,就能生成连贯的视频序列。
这一洞察催生了 Deforum 最初的数学框架:使用 关键帧(Keyframes) 和 数学函数 来控制每一帧的生成条件。当用户设置 cos(t) 作为某个参数的调度函数时,Deforum 会在每一帧根据时间 t 计算对应的参数值,并将其注入到 SD 的推理过程中。通过精心设计的参数曲线,用户可以模拟镜头运动、场景切换、风格渐变等复杂视觉效果。
此后,Deforum 被移植到 AUTOMATIC1111 的 WebUI 环境中,由核心贡献者 hithereai(累计 1528 次提交)主导维护。2023 年至今,Deforum 持续跟进 A1111 WebUI 的更新,成为 SD 动画生成领域最活跃的插件之一。截至 2026 年 6 月,该扩展在 GitHub 上拥有约 2847 颗 Stars、406 个 Fork,社区贡献者超过 50 人。
Deforum 提供了三种核心动画生成模式,适用于不同的创作需求:
2D 模式(2D Animation) 是最基础的模式。Deforum 在每一帧独立调用 SD 进行图像生成,通过逐步调整提示词权重和噪声预算,实现平滑的帧间过渡。用户可以为不同的关键帧设置不同的提示词,系统会在关键帧之间自动插值。例如,在 t=0 时设置提示词为「春天花园」,在 t=100 时切换为「冬天雪景」,Deforum 会自动生成从春到冬的渐变动画。这种模式适合概念视频、风格展示、以及需要高创意自由度的场景。
伪 2D 模式(Pseudo-2D) 引入了两帧之间的混合策略。在每一时间步,Deforum 会采样上一帧和当前帧的潜在表征(latent),通过加权求和的方式融合两者。这意味着动画不仅在内容上连贯,在视觉风格上也更加一致。该模式对提示词的控制精度要求更高,但能生成质量更稳定的输出。
3D 模式(3D Animation) 是 Deforum 最具技术深度的功能。它使用 MiDaS 深度估计模型从第一帧图像中提取深度图,然后在后续帧的生成中注入 3D 相机运动参数(旋转、平移、推拉)。这意味着用户可以真正「走进」一张 AI 生成的图像——镜头可以向前推进、环绕旋转、俯仰倾斜,而场景中的物体深度关系会被保留。官方文档指出,3D 模式在首次运行时会下载深度估计模型,峰值显存占用达 6.4 GB;若启动时加上 --lowvram 参数,显存可降至 3.8 GB。
从代码结构看,Deforum 依赖以下核心技术组件:
Stable Diffusion 推理:通过 modules.processing 与 A1111 WebUI 的 SD 推理管线深度集成,使用 StableDiffusionProcessingImg2Img 作为核心处理类。Deforum 直接复用 WebUI 已加载的 SD 模型实例(shared.sd_model),无需重新初始化模型,从而节省显存。
视频处理管线:依赖 moviepy、imageio-ffmpeg、ffmpeg 和 av 进行视频编码、帧间插值和音视频合成。torchdiffeq 用于求解常微分方程(ODE),实现某些高级参数调度函数。
数学关键帧系统:位于 animation_key_frames.py,支持用户通过 Python 数学表达式定义参数随时间的变化曲线。例如 cos(t)、sin(t*0.5) 等三角函数,或者更复杂的条件表达式 where(cos(t)>=0, cos(t), 0),后者可以根据时间条件动态切换参数值。
深度估计与控制网:depth.py 集成了 MiDaS 深度估计;deforum_controlnet.py 和 deforum_controlnet_gradio.py 支持 ControlNet 扩展,实现基于边缘、姿态、深度图等条件的可控生成。
音频驱动动画:部分版本支持从音频文件中提取频谱特征,驱动动画参数的变化,实现「音画同步」效果。
Deforum 的安装本身并不复杂——只需一条 git clone 命令将仓库克隆到 A1111 WebUI 的 extensions 目录,重启 WebUI 即可在标签页中看到 Deforum 选项。但真正的门槛在于参数理解的深度。
官方推荐的上手路径是先阅读 Deforum 参数指南(Google Doc) 和 数学关键帧函数说明,理解时间轴、噪声预算、采样步数等核心概念。官方文档中特别强调:负提示词权重不支持小于 0 的值,需要使用 --neg 参数将正负提示词分离写入 JSON 块中。
硬件需求方面,3D 模式需要 NVIDIA GPU + 8GB+ VRAM;2D 模式对显存要求相对宽松,但生成一段 30 秒的 720p 动画仍需要数小时的 GPU 计算时间。对于显存受限的用户(如 RTX 3060 8GB),可以开启 --lowvram 模式或降级到 2D 模式。
Deforum 社区也坦承了若干局限。首先,动画连贯性依赖提示词工程:不同帧之间可能出现角色面孔突变、物体凭空消失/出现等问题,这并非模型 bug,而是 SD 固有的随机性在时间维度上的累积效应。社区建议通过 ControlNet 深度图、边缘图等条件约束来缓解。
其次,版本兼容性问题突出。A1111 WebUI 更新频繁(官方文档描述「每天多次更新」),Deforum 作为插件经常出现兼容性问题。为此,官方建议用户维护两个 WebUI 安装目录:一个「稳定版」保持已知可用的旧版本,一个「实验版」用于跟踪最新更新。
第三,帧间插值需要额外工具:Deforum 默认生成每秒帧数(FPS)较低的动画(如 15-30 FPS),需要借助外部帧间插值工具(如 RIFE)才能生成丝滑的高帧率视频。
Deforum 的意义不仅在于它是一个好用的工具,更在于它代表了 AI 生成内容(AIGC)从「静态图像」向「动态叙事」演进的趋势。通过将参数化的数学控制引入 SD 的生成过程,Deforum 赋予创作者对 AI 生成内容的「时间维度」控制权——这是 AI 动画工具链从专业走向大众的关键节点。
从生态角度看,Deforum 与 ControlNet、LoRA、VAE 等 A1111 生态组件深度集成,形成了目前最完整的 SD 创作工具链。它的活跃社区(Discord 频道、持续更新的文档、Issue 反馈循环)也为其他 AI 工具的社区运营提供了参考模板。