stable-diffusion-webui
Stable Diffusion 最强网页界面,16万Star开源项目,一键安装即可在本地玩转AI绘
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Stable Diffusion 最强网页界面,16万Star开源项目,一键安装即可在本地玩转AI绘
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2023年的某个深夜,一位独立游戏开发者坐在电脑前,为了给游戏角色设计一张宣传海报,对着Midjourney反复调整提示词——第17次,终于得到了一张还算满意的图。但问题是,她不知道用什么工具保存、不知道参数记在哪里、更不知道怎么在此基础上微调。"我只是想要一张赛博朋克风格的女猎人,有机械义肢,背景是霓虹雨夜。"她后来在Reddit上这样描述自己的需求。
如果有一款工具,能让你在浏览器里点点鼠标,就完成这一切呢?
AUTOMATIC1111/stable-diffusion-webui 正是为解决这个问题而生。它将原本需要命令行操作的 Stable Diffusion 模型,变成了一个普通用户也能轻松上手的网页界面。截至目前,该项目已在 GitHub 斩获超过 16 万颗 Star,Fork 数超过 3 万,是 AI 生成图像(AIGC)领域最具影响力的开源项目之一。

图1:Stable Diffusion Web UI 主界面,txt2img 标签页默认界面
AUTOMATIC1111 是一个匿名开发者(或者开发团队)的 GitHub 账户名。项目于 2022 年 8 月正式创建,正值 Stable Diffusion 2.0 发布的当口。那时候,想用 Stable Diffusion 生成图片,开发者需要自己写 Python 脚本、配置模型路径、理解采样器参数——技术门槛劝退了绝大多数普通用户。
AUTOMATIC1111 决定做一款"傻瓜式"界面。他在 GitHub 仓库的 README 中写道:"A web interface for Stable Diffusion, implemented using Gradio library."(一个基于 Gradio 库实现的 Stable Diffusion 网页界面)。简单到不可思议的描述,背后却是极其复杂的功能实现。
2022年底,随着 AI 绘画热潮在全球爆发,SD WebUI 的用户量呈现指数级增长。用户社区非常活跃,GitHub 上的 issue 和 PR 数量居高不下,说明这个项目至今仍在持续迭代维护。
如果把 Stable Diffusion 看作一支高科技画笔,那么 AUTOMATIC1111 WebUI 就是这个画笔的操作台。
想象一下:传统绘画软件(如 Photoshop)的工具栏上,有画笔、橡皮擦、图层、滤镜等功能按钮。而在 SD WebUI 中,这些按钮变成了采样方法(Sampler)、提示词编辑器、图像修复(Inpainting)、图像扩展(Outpainting)等针对 AI 生图的专门控件。
打个更生活化的比方:如果把 Stable Diffusion 比作一台咖啡机,SD WebUI 就是咖啡机的操作面板——上面有水温、研磨度、奶泡量等旋钮,你不需要知道咖啡机内部怎么工作,只需要知道"水温调高一点会更苦"就够了。
最基础的功能是 txt2img(文生图):在提示词框中输入"一个穿西装的猫绅士",选择模型和采样器,点击生成,AI 就会画出一张图。
img2img(图生图) 则是另一项杀手级功能:你可以上传一张已有的图片,让 AI 在此基础上重新生成。比如上传一张模糊的自拍照,选择"细节增强",AI 会输出一张高清版本;或者上传一张简笔画,让 AI 补全细节变成真实照片。
Inpainting(局部重绘) 允许你"擦除"图片的某个区域,然后在空白区域重新生成内容。比如一张风景照中的天空不够好看,用画笔工具涂抹天空区域,输入提示词"绚丽晚霞",AI 就会只重绘这一部分,保留其他区域不变。
Outpainting(无限扩展) 则相反:AI 可以在现有图片的边缘向外"生长"出新内容,一张正方形图片可以变成全景宽幅图片,接缝处自然无缝。
Textual Inversion(文本反演) 技术允许用户训练自己的"概念嵌入"——比如上传 10 张自己设计的角色图,让 AI 学习这个角色的外貌特征,然后可以用文字提示词随时调用这个角色形象,而不需要上传参考图。
LoRA(Low-Rank Adaptation) 则是更强大的微调技术,可以训练出特定艺术风格(如吉卜力动画风格)、角色特征或物体外观的文件。社区里有大量免费 LoRA 模型可供下载,一个几百MB的文件就能让 AI 掌握一种全新的创作风格。
SD WebUI 内置了多款图像放大算法(RealESRGAN、SwinIR、LDSR 等),可以将低分辨率图片无损放大 2-4 倍。同时集成了 GFPGAN 和 CodeFormer 两种面部修复模型,专门处理 AI 生成人物时常见的"面部扭曲"问题。
对于研究者和高级用户,X/Y/Z Plot 功能允许一次性生成多组参数对比图——横轴是不同的采样方法,纵轴是不同的提示词变体,所有排列组合一次展示,方便找到最优参数配置。
优点:WebUI 本身安装非常友好。Windows 用户只需下载官方提供的 release 包,双击 webui-user.bat 即可自动安装依赖并启动;Linux/macOS 用户运行 webui.sh 或 webui-macos-env.sh 同样简单。安装过程全自动,不需要手动配置 Python 环境。
缺点:运行 Stable Diffusion 模型有极高的硬件门槛。一张 NVIDIA 显卡是必需品,且显存至少 6-8GB 才能流畅运行主流模型(官方称最低 4GB 可运行,但实际体验会很差)。没有 GPU 的用户只能选择云端部署方案(如 Google Colab、AWS 等)。
部署难度评分为"中等",主要卡点在于 GPU 环境配置和约 5-10GB 的模型文件下载。对于有 NVIDIA 显卡的用户,从零到生成第一张图通常在 30 分钟内可以完成。
SD WebUI 的本地运行需要持续消耗大量电力。一张 RTX 3090 在全速生图时功耗可达 300-400W,长时间运行相当于一台小型电暖器。随着 AIGC 应用大规模普及,其能源消耗和碳排放问题引发了环保人士的担忧。
与所有强大的人脸生成工具一样,SD WebUI 存在被滥用的风险。用它生成逼真的名人照片、制作虚假新闻图像甚至色情内容,在技术上是完全可行的。虽然项目维护者在代码中加入了一定的安全过滤机制,但开源属性决定了这些限制可以被绕过。
项目采用 AGPL-3.0 开源许可证,这意味着任何基于该项目修改再发布的衍生作品,也必须开源。对于商业公司而言,这意味着如果他们直接基于 SD WebUI 开发产品,就必须开源自己的代码,这也是为什么很多商业产品选择"参考学习"而非直接使用。
AUTOMATIC1111 WebUI 本质上是一个"功能聚合界面",而非底层模型优化。它的优势在于功能丰富,但也意味着每次生图都要经过 Gradio 界面层,响应速度比纯 API 调用慢。此外,由于代码结构复杂,第三方插件开发门槛较高,社区插件质量参差不齐。
AUTOMATIC1111 WebUI 的出现,标志着 AI 生成图像从"科研论文里的demo"变成了"每个人电脑里的应用"。它将原本需要 Python 编程基础才能使用的 Stable Diffusion,封装成了点击即用的网页界面,大幅降低了使用门槛。
从数据来看,项目 Star 数从 2023 年初的 5 万增长到如今的 16 万,这个增速本身就说明问题了。它不仅吸引了普通用户,也成为 AI 艺术创作者、游戏开发者、独立设计师的日常工具。
SD WebUI 的普及带动了一整个周边生态的繁荣:
AUTOMATIC1111 WebUI 证明了开源社区在 AI 领域同样可以做出顶级产品。在 Midjourney、DALL-E 等商业产品占据主流的市场环境下,它凭借完全免费、功能全面、社区活跃等优势,守住了大量对开源有执念的用户群体。
从代码层面看,SD WebUI 采用经典的 Python + Gradio 架构:
modules/ 目录下按功能拆分为 100+ 个独立模块(sd_models.py 模型加载、processing.py 生图流程、ui.py 界面渲染等)extensions/ 目录),社区可自由开发功能插件/sdapi/v1/ 系列 API,可被其他程序调用实现自动化生图代码质量评分较高:模块化程度高、注释较为完善、版本维护规范。但测试覆盖率信息不详,依赖较多外部模型文件,部署复杂度客观存在。
AUTOMATIC1111/stable-diffusion-webui 是 AI 生成图像领域最具标志性的开源项目之一。它用 Gradio 框架将 Stable Diffusion 打造成了一个功能完备的网页应用,从文生图、图生图到局部重绘、模型微调,覆盖了 AI 绘画的几乎所有主流场景。
适合人群:有 NVIDIA 显卡的 AI 艺术爱好者、独立游戏/内容创作者、想本地部署 Stable Diffusion 的开发者。
不适合:没有 GPU 的用户、商用场景下对稳定性和支持有较高要求的团队。
如果你有一张还算不错的显卡,想要探索 AI 绘画的无限可能,SD WebUI 依然是目前最值得上手的工具——功能最全、社区最活跃、文档最丰富。16 万 Star,不是白给的。