generative-models
Stability AI 开源的扩散模型框架,支持 SV3D/SV4D 单图/视频转 4D 动态重建
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Stability AI 开源的扩散模型框架,支持 SV3D/SV4D 单图/视频转 4D 动态重建
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象一下:给定一张照片,AI 就能从任意角度生成这个人旋转的动态视频——这不是科幻,而是 Stability AI 已经在开源社区中实现的技术。Stability AI Generative Models 项目,正是这一能力背后的核心代码库。
Stability AI 是 2022 年 AI 热潮中最引人注目的公司之一,以 Stable Diffusion 文生图模型闻名全球。区别于 OpenAI 的封闭路线,Stability AI 选择将核心技术开源,推动 AI 民主化。Generative Models 仓库正是该公司将视频生成、3D 生成等前沿研究代码化的核心阵地——相当于 Stability AI 所有生成式 AI 模型的「发动机工厂」。
这个项目由 Stability AI 官方维护,汇集了从 Stable Video 3D (SV3D) 到 Stable Video 4D (SV4D) 再到 SV4D 2.0 的完整技术演进路线,是目前开源社区中视频到 4D 重建领域最有影响力的代码库之一。
项目的核心能力可以类比为「给 AI 一张照片,它能生成一个可以 360 度观看的动态物体」。具体来说:
Stable Video 4D (SV4D):输入一段短视频(建议白背景单物体),输出该物体在 8 个相机视角下连续旋转的动态视频。技术原理是先通过 SV3D 生成多视角参考图,再由 SV4D 在时序上保持一致性。这解决了传统单图 3D 重建无法生成自然运动的问题。
SV4D 2.0(2025年5月最新发布):相比初代 SV4D,2.0 版本在以下几个方面有显著提升:生成画面保真度更高、运动细节更锐利、时空一致性更好,且能更好地泛化到真实世界视频。官方还支持自回归生成——每次输出 12 帧,然后以已有输出为条件继续生成,实现更长视频的连贯输出。
Stable Video 3D (SV3D):同一技术路线的前序版本,输入单张产品图或人像,输出多视角图像,适合电商 3D 展示场景。
图1:SV3D 多视角生成效果演示
从代码结构来看,项目采用了典型的深度学习研究项目架构:
代码模块分层清晰:sgm/models 包含扩散模型和自编码器实现,sgm/modules 包含 Transformer 等核心组件,scripts/sampling/ 下有各种推理脚本,configs/ 下则存放不同模型的 YAML 配置文件。
推理流程可通过 Streamlit Web UI 启动,进入页面后上传视频或图片,设置推理步数和输出分辨率,即可获得生成结果。对于研究用途,也有命令行脚本支持更精细的参数控制。
这个项目的部署难度相对较高,主要原因是它对 GPU 有强依赖。官方建议使用 NVIDIA RTX 3090 或更高规格的 GPU(16GB+ 显存),因为即使是单次推理,也需要加载大型扩散模型权重。
好消息是,项目提供了较为清晰的安装流程:通过 pip install -e . 即可完成包安装,Streamlit Web UI 也能一键启动。相比需要手动编译 CUDA 插件的早期版本,安装体验已有明显改善。
需要注意的坑:
电商与产品展示:将产品白底照片转化为 360 度旋转视频,用于电商详情页展示。传统的 3D 建模需要专业软件和数小时工作流,而 SV4D 可以在几分钟内完成类似效果。
游戏与影视资产:快速生成角色的多角度动态参考,用于 3D 建模师的前期参考或动画制作的概念验证。
AI 研究与复现:作为视频扩散模型和 4D 重建的开源基线代码,供学术研究者在此基础上进行改进和实验。
项目并非完美。首先,输入视频质量高度依赖背景干净度——如果背景杂乱或物体有自我遮挡,生成质量会明显下降。其次,目前仅支持单物体场景,复杂场景的 4D 重建仍有局限。此外,作为 Stability AI 的商业开源项目,其模型权重采用 Stability AI 许可协议,商用前需仔细评估法律风险。
Generative Models 项目代表了开源 AI 社区在视频生成领域的最前沿。从 SV3D 到 SV4D 2.0 的快速迭代,可以清晰看到 AI 从「生成静态图片」向「生成动态 4D 内容」演进的路径。随着 Stable Video 4D 2.0 支持更长视频的自回归生成,这类技术正在逐步接近工业可用的质量门槛。
对于 AI 开发者而言,这个项目既是可以直接使用的工具,也是理解扩散模型在视频/3D 领域应用的最佳学习素材。GitHub 上 27,000+ 的 stars 印证了它在开源社区的影响力。
图2:SV4D 2.0 输入视频示例(骆驼旋转生成)