Stable-Video-Infinity
通过 Error Recycling 机制实现百帧级长视频生成,ICLR 2026 Oral 论文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
通过 Error Recycling 机制实现百帧级长视频生成,ICLR 2026 Oral 论文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你只需要给出一张图片和一段文字描述,AI 就能生成一段长达数十秒、甚至更长的连贯视频——画面中的人物不仅表情自然、动作流畅,还能保持镜头运动和光影变化的一致性。这不是科幻,这是 2026 年 ICLR 26 Oral 论文 Stable Video Infinity 带来的现实。
视频生成领域长期以来面临一个核心瓶颈:生成长视频时,一致性和流畅性会急剧崩塌。传统方法生成的视频超过 8-16 帧后,人物会出现"跳变"、背景会出现"漂移",根本原因在于模型缺乏对长时间序列的有效记忆和推理能力。
Stable Video Infinity(SVI)由瑞士洛桑联邦理工学院(EPFL)VITA 实验室提出,核心创新是 Error Recycling(错误回收)机制——一种革命性的推理时优化策略。简单类比:如果把视频生成比作"逐帧作画",传统方法像是蒙眼作画、每画一帧都忘记前一帧;而 SVI 则像是"有记忆的创作",模型会主动检测并纠正已生成帧中的错误,将修正后的信息反馈到下一帧的生成过程中,从而实现时间维度上的自愈与自洽。
图1:SVI 生成效果示例

官方展示的 Demo 中,同一段视频生成了 49 帧(约 16 秒),人物动作、相机运动、光影变化全程保持高度一致。更令人印象深刻的是,SVI 支持三种差异化模式:
SVI 的底层架构基于 Video Diffusion Transformer(Video DiT),这是 2024 年以来视频生成领域最重要的架构演进方向。相比传统的 U-Net 结构,DiT 在Scaling(扩展)特性上表现更优——模型参数量越大、生成质量提升越显著。
SVI 在 DiT 基础上引入了两项关键改进:
1. 因果式注意力机制(Causal Attention)
传统 DiT 的注意力是双向的——每一帧都会"看到"未来帧的信息,这在训练时没问题,但推理时生成第 N 帧时第 N+1 帧还不存在,导致训练与推理的不一致。SVI 采用因果注意力掩码,确保第 N 帧只"看到"第 1 到 N 帧的信息,从根本上消除训练-推理偏差。
2. Error Recycling(错误回收)
这是 SVI 最有创新性的设计。当模型生成第 N 帧时,会将第 N-1 帧的潜空间特征与当前帧的潜空间特征进行对比,计算"误差图"(Error Map)。这个误差图被注入到第 N+1 帧的生成过程中,让模型主动"知道"上一帧哪里出错了,从而在下一帧生成时有针对性地修复。
图2:Error Recycling 机制示意图

从架构图可以看出:每个生成步骤中,模型会进行多次迭代(denoising steps),并在每次迭代后检查当前帧与前一帧的一致性。当检测到显著差异时,误差信号会被编码并传递给后续步骤,形成一个"自纠正"的闭环。
SVI 的训练分为两个阶段:
第一阶段:短视频学习
模型首先在 16-32 帧的短视频片段上训练,学习基础的动作生成和画面质量。这个阶段的目标是让模型掌握基本的时空建模能力。
第二阶段:长视频扩展
在短片段训练完成后,通过帧插值和流式生成技术,将模型扩展到 100+ 帧的长视频。关键在于,第二阶段并不是从头训练,而是在第一阶段模型的基础上进行"延伸",避免了灾难性遗忘。
SVI 的模型权重托管在 HuggingFace 和 ModelScope 上,包含以下核心组件:
stabilityai/stable-diffusion-3-medium 的 DiT 版本,参数量约 1.5B项目采用 Python + Gradio 的技术栈,核心代码组织如下:
Stable-Video-Infinity/
├── gradio_demo.py # WebUI 入口(Gradio)
├── diffsynth/ # 核心推理引擎(ModelManager, SVIVideoPipeline)
├── scripts/ # 训练脚本(train_svi.py, train_svi_dance.py)
├── data/ # 测试数据(toy_test/)
├── assets/ # 演示素材
└── requirements.txt # 依赖清单
核心推理流程封装在 diffsynth.SVIVideoPipeline 中,通过 ModelManager 统一管理多个模型(DiT + VAE + LoRA),遵循标准的 diffusers 库设计范式。对有经验的扩散模型开发者来说,代码阅读门槛相对可控。
SVI 的依赖栈非常深,具体包括:
值得注意的是,项目还引入了 Modelscope(阿里云魔搭)作为模型来源之一,对于国内用户比较友好。
SVI 没有提供 Dockerfile,需要手动搭建环境。对于有 GPU 训练经验的开发者,这不算特别困难;但对于新手,至少需要准备:
通过 gradio_demo.py 可以直接启动 Web 界面:
python gradio_demo.py --model_mode film
启动后会自动从 HuggingFace/Modelscope 下载权重,首次运行可能需要 10-30 分钟(取决于网络速度)。WebUI 提供了三种模式的切换滑块,上传图片、输入提示词即可开始生成。
项目还提供了完整的 ComfyUI 工作流文件(comfyui_workflow_svi_1.0/),对于已经使用 ComfyUI 的创作者,可以无缝接入现有工作流。
| 项目 | 最长帧数 | 主要创新 | 显存需求 |
|---|---|---|---|
| SVI (ours) | 100+ | Error Recycling + 因果注意力 | 24GB+ |
| Sora (OpenAI) | 60s+ | Transformer scaling | 未公开 |
| Lumiere (Google) | 16 | 扩散模型视频生成 | 未公开 |
| DynamiCrafter | 32 | 图像驱动 | 16GB |
从公开数据看,SVI 在长视频一致性和开源可复现性上具有明显优势。但 Sora 等闭源系统在生成时长和整体质量上仍领先。
Stable Video Infinity 入选 ICLR 2026 Oral(top 5% 论文),这本身就是对研究质量的认可。更重要的是,它是完全开源的——代码、权重、训练细节全部公开,这意味着:
从行业趋势看,视频生成正从"Demo 时代"走向"可用时代"。SVI 的 Error Recycling 机制提供了一个新的工程化思路:与其一味追求更大的模型,不如在推理层面引入自纠正机制。这对于资源受限的部署场景尤其有价值。
图3:YouTube 视频生成效果对比

项目信息:MIT 许可证 · EPFL VITA 实验室 · GitHub 2,478 ★ · 218 Forks · ICLR 2026 Oral
官方主页:https://stable-video-infinity.github.io/homepage/