Text2Video-Zero
零样本将Stable Diffusion转为视频生成器,无需训练支持姿态/边缘/DreamBooth
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
零样本将Stable Diffusion转为视频生成器,无需训练支持姿态/边缘/DreamBooth
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2023年3月,当你还在惊叹于Midjourney能"一句话生成图片"时,一个来自Picsart AI Research的团队悄悄在arXiv上扔出了一颗深水炸弹——他们证明,只需对Stable Diffusion做一点"推理层面的手脚",就能让它在零额外训练的前提下,生成连贯的视频。
这颗炸弹的代号叫Text2Video-Zero,它被顶会ICCV 2023录为Oral论文(全球仅约5%论文获此荣誉),至今已在GitHub上积累超过4200颗星。
图1:Text2Video-Zero支持的多种生成模式。从上至下依次为:纯文本到视频、姿态控制视频、边缘引导视频,以及Video Instruct-Pix2Pix视频编辑。
Text2Video-Zero的作者团队来自Picsart AI Research(PAIR)——这是全球最大创意平台Picsart内部的人工智能研究部门,同时联合作者还来自德克萨斯大学奥斯汀分校、佐治亚理工学院等高校。
核心作者之一Humphrey Shi教授(佐治亚理工/俄勒冈/UIUC)在计算机视觉领域深耕多年,他主导的SHI Labs在图像/视频生成领域持续产出高质量研究。团队的目标在论文首页写得非常直接:"democratize AI and empower the creativity of everyone"(民主化AI,让每个人的创意都能被点燃)。
在Text2Video-Zero之前,AI视频生成的主流范式是"海量视频数据+大量GPU算力+长时间训练"——Runway的Gen-2如此,NVIDIA的VideoLDM也是如此。这意味着普通研究者、独立创作者、甚至中小企业想基于自己的数据微调一个视频模型,门槛高到几乎不可能。
Text2Video-Zero的核心价值主张就一句话:不训练,直接用。
如果你用过Stable Diffusion生成图片,可以这样理解Text2Video-Zero:
Stable Diffusion是一个"单帧照片打印机"——你输入文字,它吐出一张图片。Text2Video-Zero做的事情,相当于给这台打印机加了一个**"帧动画插件"**,它不需要你重新买一台"视频打印机",而是让现有的单帧打印机具备了"把多帧连成动画"的推理能力。
具体来说,这个插件通过三个核心机制工作:
Text2Video-Zero绝不是一个单一功能的工具,它实际上是一套模块化的视频生成工具包:
纯文本到视频(Text-to-Video)
输入一段文字描述(如"A horse galloping on a street"),模型即可生成对应的视频序列。生成的视频在时间维度上具有连贯性,主体外观稳定。
姿态控制视频(Pose-Guided)
输入一段文字描述+一个骨架姿态序列(如一段舞蹈动作),模型生成的人物将按照给定姿态运动。姿态信息由OpenPose提取。
边缘引导视频(Edge/Canny-Guided)
输入文字+一张边缘检测图,生成符合边缘轮廓的视频。适合将静态艺术作品"动起来"。
深度控制视频(Depth-Guided)
基于MiDaS深度估计模型,输入文字+深度图,控制视频的空间结构。
Video Instruct-Pix2Pix(指令视频编辑)
对已有视频应用编辑指令,如"make it Van Gogh Starry Night style",无需额外训练即可完成风格迁移。
DreamBooth个性化
支持加载用户自己fine-tune的DreamBooth个性化模型,让生成的角色/物体具有特定身份特征。
图2:使用DreamBooth个性化模型生成特定艺术风格角色。
图3:使用DreamBooth avatar模型生成个性化角色。
命令行(Python API)
适合有编程能力的用户。通过Model类直接调用,灵活度最高,可自定义motion field strength、t0/t1参数、帧数等核心参数。
from model import Model
model = Model(device="cuda", dtype=torch.float16)
model.process_text2video("A horse galloping on a street", ...)
Gradio Web界面
项目提供了完整的Gradio界面(app_text_to_video.py等),一行命令即可启动本地Web服务,在浏览器中通过拖拽、填写表单的方式操作。对于不熟悉命令行的用户非常友好。
最低硬件门槛:
生成时长有限
虽然代码已支持任意长度视频生成,但受限于显存,生成超过几十帧的高质量视频仍需大量显存。当前版本默认生成8帧视频。
动作复杂度受限
对于需要复杂多角色交互的场景,当前版本的跨帧注意力机制仍可能出现轻微的伪影或特征漂移。
速度瓶颈
纯PyTorch实现,推理速度取决于GPU性能。一段8帧视频在A100上约需1-2分钟,在消费级GPU上可能更慢。
与官方生态的关系
2023年4月,Text2Video-Zero已被集成到Hugging Face的Diffusers官方库中,这意味着用户可以直接通过diffusers库的API调用其核心能力,无需直接使用本仓库代码——但本仓库提供了更底层、更完整的实现和更多可调参数。
Text2Video-Zero的意义不在于超越商业竞品,而在于它证明了"推理层改造"这条路走得通。
在此之后:
对于今天的AI视频创作者来说,Text2Video-Zero代表了一种低门槛入门的路径:你可以用它来理解视频扩散模型的核心工作原理,也可以在此基础上开发自己的定制应用。对于AI爱好者而言,它是目前门槛最低、代码最完整、最适合学习的开源视频生成项目之一。