Tune-A-Video
单样本视频定制:输入一段视频,让AI按文字描述生成任意主题的新视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
单样本视频定制:输入一段视频,让AI按文字描述生成任意主题的新视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Tune-A-Video 是一种"单样本视频定制"技术——你只需给出一段普通视频(如"一个人滑雪"),它就能以这个视频为模板,让AI按照你的文字描述,生成各种天马行空的新视频("蜘蛛侠在海边滑雪")。
2022年末,AI图像生成领域迎来了Stable Diffusion的爆发——用户输入一段文字,就能得到一张照片级图片。但视频生成呢?业界的主流思路是"大数据训练":收集数百万条视频文本对,训练一个专门的文生视频模型。这条路耗资巨大(需要成千上万块GPU)、门槛极高(只有大公司才玩得起),而且换一个新主题(比如让某个IP角色出现在视频中),模型依然做不到。
新加坡国立大学旗下的 Show Lab 敏锐地发现了这个问题。2023年,在计算机视觉顶会 ICCV 上,他们发表了 Tune-A-Video,提出了一个截然不同的思路:与其训练一个巨大的视频模型,不如复用已经强大的文生图扩散模型。 只需要一段视频作为"锚点",对模型做轻量微调,就能让它生成任意主题的视频。
这篇论文的第一作者吴张杰捷(Jay Zhangjie Wu)当时还是一名博士生,他的研究动机很朴素:让普通研究者也能玩转视频生成。
Tune-A-Video 的核心洞察是:图片扩散模型已经学会了"如何生成真实的画面",而视频生成最缺的恰恰是时间一致性和运动规律。 那么,能不能只微调模型中负责时间注意力的部分,而保留其强大的空间生成能力?
答案是肯定的。Tune-A-Video 在 Stable Diffusion 的 U-Net 中引入了一个 时空稀疏注意力机制(Sparse-Causal Attention),让模型能够:
attn_temp 模块,专门学习帧与帧之间的运动关系训练时,只需输入一段视频(如"一个人滑雪")及其文本描述,模型就能学会"滑雪动作应该如何流畅过渡"。推理时,团队使用了 DDIM 反演(DDIM Inversion) 技术:从输入视频反推噪声 latent,再以此为起点,结合新的文字提示(如"蜘蛛侠在海边滑雪")生成全新视频。

图1:输入一段"男子滑雪"的原始视频,即可作为模板生成多种风格的新视频。
Tune-A-Video 的设计理念是极低数据需求。整个训练过程只需要:
配置文件中可以看到具体训练参数:
trainable_modules:
- "attn1.to_q" # 空间自注意力的Query
- "attn2.to_q" # 交叉注意力的Query
- "attn_temp" # 时间注意模块(新增)
learning_rate: 3e-5
max_train_steps: 500
guidance_scale: 12.5
这意味着,即使是普通消费者级显卡(如 24GB 显存的 RTX 3090),也能在可接受的时间内完成训练。
| 功能 | 说明 |
|---|---|
| 单样本视频定制 | 一段视频 + 文字描述 → 生成无限变体 |
| 风格迁移 | 叠加 DreamBooth 个性化模型,实现特定IP的视频化(如米老鼠、钢铁侠) |
| 控制迁移 | 保留原视频的运动轨迹/姿势,换主题换风格 |
| 多主题组合 | 同一模板视频 + 不同提示词 = 批量视频素材 |
实际效果非常惊艳:输入一段兔子吃西瓜的视频,通过不同提示词,可以生成"猫咪戴墨镜在海边吃西瓜"、"小狗在桌上吃西瓜"等完全不同的视频,且运动轨迹保持一致。

图2:输入"男子滑雪"模板,生成"蜘蛛侠在海边滑雪,卡通风格"的结果。
好消息是,你不需要自己部署就能体验这个项目:

图3:兔子和猫咪在多种场景下的生成效果对比,展示了跨主题泛化能力。
如果你是开发者,想要深度定制或研究改进,建议本地部署:
前置条件:
安装步骤:
git clone https://github.com/showlab/Tune-A-Video.git
cd Tune-A-Video
pip install -r requirements.txt
# 下载 Stable Diffusion v1-4 权重到 ./checkpoints/stable-diffusion-v1-4
# 准备你自己的视频到 ./data/ 目录
accelerate launch train_tuneavideo.py --config="configs/man-skiing.yaml"
训练完成后,加载微调后的 UNet,运行推理脚本即可生成视频。
Tune-A-Video 并非完美,了解其局限性有助于更好地使用:
视频时长受限:当前架构主要处理短视频(通常 24 帧,~2秒),长视频的一致性仍是挑战。
单视角限制:模型保留了输入视频的相机视角,无法自由控制镜头运动。
计算资源门槛:尽管是"轻量化"方案,10-15GB 显存的需求对普通用户仍是一道门槛。
提示词敏感性:生成效果与文字描述的精确程度高度相关,模糊描述可能产生语义漂移。

图4:与个性化图片模型(如 Modern Disney、DreamBooth)结合,实现风格一致的视频生成。
Tune-A-Video 的意义远超技术本身。它开创了一种新的研究范式:one-shot / few-shot video generation——不需要海量数据,用极少的样本就能实现高质量的视频定制。
这一思路直接影响了后续众多研究:ZeroSmooth、Video-P2P、ControlVideo 等工作纷纷跟进,推动了视频编辑、动作迁移、主题驱动的视频生成等领域的发展。2023年CVPR的 LOVEU-TGVE 视频编辑竞赛,也将这类技术列为核心赛道之一。
截至目前,该项目在 GitHub 已有超过 4000 颗星,被 ICCV 2023 正式收录,并在 HuggingFace 上提供了完整的在线 Demo,真正做到了"让研究走进千家万户"。对于 AI 视频创作者而言,Tune-A-Video 提供了一种成本极低、效果惊艳的创作工具;对于 AI 开发者而言,它是一个优秀的视频扩散模型研究起点,代码结构清晰、模块化良好,值得深入研究其时空注意力机制的实现细节。