stable-diffusion-colab
通过 Colab 笔记本零配置运行 SANA-Sprint 极速文生图模型,支持 1~4 步推理生成 1024×1024 高清图片
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
通过 Colab 笔记本零配置运行 SANA-Sprint 极速文生图模型,支持 1~4 步推理生成 1024×1024 高清图片
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
大多数普通人想体验最新的文生图模型,通常面临两道坎:本地没有 GPU,服务器部署门槛又太高。想象你是一位独立游戏开发者,想快速给自己的角色生成立绘图;或者是一位内容创作者,需要大量配图但预算有限——这时候 Google Colab 的出现,就像把一台免费的高性能 GPU 服务器直接搬到了浏览器里。
woctezuma/stable-diffusion-colab 正是解决这个痛点的工具。它本质上只有一个文件——一个 .ipynb Jupyter Notebook,但背后集成了 SANA-Sprint 这款 2025 年 ICCV 接收的极速文生图模型。这个 Colab 笔记本由开发者 woctezuma 维护,提供了从模型加载到图片生成的全流程代码,普通用户只需打开链接、点击运行,无需配置任何环境。
在了解这个项目之前,有必要先认识它背后的模型——SANA-Sprint。这是由 NVIDIA、MIT、清华大学、Hugging Face 等机构联合研发的高效文生图模型,于 2025 年 3 月发布,同年 6 月被 ICCV'25 接收。
传统的 Stable Diffusion 模型生成一张 1024×1024 图片,通常需要 2050 步去噪迭代,速度慢、体验差。SANA-Sprint 的核心创新在于**连续时间一致性蒸馏(sCM)**技术,能够将推理步数从 20 步压缩到 **14 步**,同时保持甚至超越原有画质。在 H100 GPU 上,SANA-Sprint 1.6B 仅需 0.24 秒即可生成 1024×1024 图片;在消费级 RTX 4090 上也只需 0.31 秒。相比之下,FLUX-schnell(12B)虽同为 1 步推理,但需要 1.1 秒,显存占用也高得多。
关键点:1.6B 参数的 SANA-Sprint,效果接近 FLUX-schnell(12B),速度却快了 10 倍。 而 SANA-Sprint 还支持 ControlNet 扩展,可以实现实时交互式图像生成与编辑。
这个仓库只有三个文件,结构清晰到让人惊讶:
README.md — 项目说明、效果展示、引用文献stable_diffusion.ipynb — 核心 Colab 笔记本LICENSE — MIT 协议Colab 笔记本的内容也极为简洁,分三段代码块:
第一段:安装依赖
%pip install --quiet --upgrade diffusers transformers accelerate mediapy peft
使用 diffusers(Hugging Face 的扩散模型标准库)作为推理后端,配合 transformers 提供模型结构、accelerate 优化 GPU 调度、mediapy 展示图片。
第二段:加载模型
from diffusers import SanaSprintPipeline
model_id = "Efficient-Large-Model/Sana_Sprint_0.6B_1024px_diffusers"
pipe = SanaSprintPipeline.from_pretrained(model_id, torch_dtype=torch.bfloat16).to("cuda")
项目支持 0.6B 和 1.6B 两种规模,代码中默认使用 0.6B(因为 1.6B 在 Colab 免费版 T4 GPU 上显存不足)。模型来自 Hugging Face Hub 的 Efficient-Large-Model 组织,推理精度使用 bfloat16 以节省显存。
第三段:生成图片
prompt = "a photo of Pikachu fine dining with a view to the Eiffel Tower"
images = pipe(prompt=prompt, num_inference_steps=12, guidance_scale=5.0, width=1024, height=1024).images
media.show_images(images)
images[0].save("output.jpg")
用户可调整推理步数(150)、引导系数(115)、图片分辨率(256~1024)等参数。
以下是项目 README 中展示的生成样例,同样使用提示词 "a photo of an astronaut riding a horse on Mars",对比 Stable Diffusion XL 和 SANA-Sprint 的输出差异:
Stable Diffusion XL 输出(Astronaut on Mars)
SANA-Sprint 输出(Astronaut on Mars)
适合人群:
需要注意的:
尽管代码量极少(只有一个 notebook),但 woctezuma/stable-diffusion-colab 代表了一个重要的趋势:模型即笔记本。随着 Hugging Face 的 diffusers 库越来越成熟,越来越多的 AI 模型可以通过几行代码直接加载运行,降低了 AI 落地的最后一公里门槛。这个项目用最少的代码、最低的门槛,让用户能够立刻体验到 SANA-Sprint 这款 ICCV'25 论文中提到的 SOTA 效率提升。
对于独立开发者和小团队而言,这样的 Colab 笔记本是快速验证想法的利器——不需要购买 GPU、不需要配置环境,直接在浏览器里就能跑起来。而对于AI 爱好者,它也是一个绝佳的学习范本:通过阅读 notebook 的代码,可以理解 SANA-Sprint 的 pipeline 如何从 Hugging Face 加载、如何配置推理参数、如何可视化输出。
如果你有 Google 账号和浏览器,现在就可以打开这个 Colab 笔记本,5 分钟内生成你的第一张 AI 图片。
数据来源:GitHub API、Hugging Face Hub、arXiv:2503.09641(SANA-Sprint 论文)、learnopencv.com