sd-webui-text2video
Auto1111 WebUI 扩展,在熟悉的界面中用文字或图片生成 AI 视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Auto1111 WebUI 扩展,在熟悉的界面中用文字或图片生成 AI 视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否曾幻想过——只要写一段文字,就能让 AI 直接生成一段动态视频,而不是一张静态图片?早在 2023 年初,这个愿望就已经成为现实。sd-webui-text2video 正是这样一款工具:它以 Stable Diffusion 生态中最著名的 Web UI——Auto1111 为宿主,将 ModelScope 和 VideoCrafter 等开源文生视频模型的强大能力,以扩展插件的形式无缝融入到熟悉的 Web 界面中,让无数 AI 图像创作者零门槛跨入视频生成领域。

图1:Auto1111 扩展界面,支持 txt2vid(文生视频)和 img2vid(图生视频)两种模式
2022 年底,Stable Diffusion 在开源社区引发图像生成革命,但当时的生态几乎完全局限于静态图片。开发者 Artem Khrapov(GitHub @kabachuha)敏锐地意识到:如果能将文生视频模型整合进 Auto1111 这个已经被数十万用户熟悉的界面,创作者们无需学习任何新工具,就能直接尝试 AI 视频生成。
2023 年 3 月,他发布了 sd-webui-text2video 的首个版本,最初仅支持 ModelScope(通义千问团队的开源视频生成模型)。同年 4 月,又加入了 VideoCrafter 支持,使扩展能够调用两种不同架构的视频生成后端。项目一经发布便迅速传播,成为 Auto1111 生态中最受欢迎的扩展之一,GitHub 星标数很快突破 1300。
2023 年 11 月,原作者宣布停止维护,随后由 Deforum-Art 团队短暂接手。2024 年起,作者本人重新接手持续维护至今。项目的坎坷经历本身也反映了开源 AI 视频生成领域的快速迭代与激烈竞争。
理解这个扩展的工作原理,需要先了解视频生成的本质挑战。与单张图片不同,视频是一系列在时间维度上连贯的帧序列。Diffusion 模型要生成视频,需要解决两个核心问题:
时序一致性:第 1 帧和第 30 帧的角色、场景、风格必须保持连贯,不能出现"人物换脸"或"场景突变"。ModelScope 和 VideoCrafter 都采用了 3D U-Net 架构,将传统的 2D 空间卷积扩展到时间维度,让模型在像素空间中同时学习空间特征和时间关联。这相当于让模型不仅理解"画面里有什么",还理解"这些画面如何随时间演变"。
计算资源控制:视频生成的计算量是单帧图片的数十倍。扩展通过多项优化控制资源消耗:Torch2/xformers 内存优化使 125 帧(8 秒)视频在 12GB 显存显卡上成为可能;低显存 VAE 模式让 6GB 显存的 256×256 视频生成得以实现;模型热切换则允许在同一 session 中切换不同视频模型。
扩展提供了远超"文生视频"的丰富能力:
1. 文生视频(txt2vid):输入自然语言提示词,生成对应视频。支持 ModelScope 和 VideoCrafter 两种模型,以及 ZeroScope v2、Potat1、Animov-0.1 等社区微调版本。其中 Potat1 是首个开源 1024×576 高分辨率视频模型,由 @camenduru 在 2197 个视频片段上训练。
2. 图生视频(img2vid):将一张静态图片作为第一帧,"延续"生成后续帧。这对于制作 GIF 动图、延长已有视频片段、将插画"动画化"尤为实用。
3. 视频转视频(vid2vid):对已有视频施加风格迁移,例如将实拍视频转换为动漫风格,或改变视频的整体色调与氛围。
4. LoRA 支持:兼容 Auto1111 的 LoRA 生态,可加载社区训练的个性化视频 LoRA,实现特定角色风格、视频运动模式等自定义效果。
5. WebAPI:提供 RESTful API 接口,允许外部程序通过 HTTP 请求触发视频生成任务,便于集成到自动化工作流中。

图2:vid2vid 模式界面,可对已有视频施加风格或内容变换
最低门槛:一张 6GB 以上显存 NVIDIA 显卡 + 已安装 Auto1111 WebUI。满足这两个条件后,通过 Auto1111 的扩展管理器(Extension → Available → Load from URL)安装本项目,然后按 README 指示下载模型权重(约 5-10GB),即可使用。
显存需求参考:256×256 分辨率、24 帧视频仅需 6GB 显存;720p 分辨率、125 帧(8 秒)需要 12GB 显存;250 帧(16 秒)全高清视频则需要 20GB 显存。
主要限制:扩展本身无独立 Web 界面,必须依附 Auto1111 运行;不支持 macOS(因为需要 CUDA);Windows/Linux 用户体验最佳。
项目代码量不大,结构清晰:
text2vid.py:主插件入口,负责与 Auto1111 框架集成,处理 UI 绑定和任务调度scripts/t2v_helpers/:核心生成逻辑,包括 ModelScope 和 VideoCrafter 的适配层scripts/samplers/:自定义采样器,支持多种视频生成采样策略scripts/api_t2v.py:WebAPI 服务端,支持外部调用javascript/t2v_progressbar.js:前端进度条增强style.css:UI 样式自定义扩展大量复用 Auto1111 自身的依赖(Gradio、PyTorch、diffusers),通过 Auto1111 的插件接口注入功能,无需打包完整推理引擎,大幅减少了安装体积。
sd-webui-text2video 的价值不仅在于工具本身,更在于它代表的生态整合思路:将前沿研究模型通过插件形式带入成熟用户界面,大幅降低了技术门槛。2023 年正值 Runway Gen-2、Pika 等商业视频生成工具崛起之际,这款开源扩展证明:通过合理优化,普通的游戏级显卡(RTX 2080 Ti)也能本地运行文生视频。
从更长的时间线看,这个项目是 Stable Diffusion 生态从"图像"向"视频"演进的早期探索。它的许多设计思路——多后端支持、热切换模型、低显存优化——在后续的 ComfyUI 视频节点、SD WebUI Forge 等项目中都得到了继承和发扬。
对于今天的开发者而言,这个项目仍具有参考价值:它展示了如何将多模态 AI 模型产品化、工程化,并融入已有生态系统。