FastVideo
统一推理+后训练加速框架,让主流开源视频生成模型提速8-50倍,支持实时流式生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
统一推理+后训练加速框架,让主流开源视频生成模型提速8-50倍,支持实时流式生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2026年3月,一个来自加州大学圣地亚哥分校(UCSD)Hao AI Lab 的 demo 震惊了 AI 社区——在单张 H100 GPU 上,5 秒生成一段 5 秒 1080p 视频,总耗时不到 5 秒。这不是渲染农场,不是超级计算机集群,只是一张消费级显卡配合一个开源框架。这背后的技术支撑,正是 FastVideo。
视频生成模型的进化速度有目共睹:从 Sora 到 Stable Video Diffusion,从 CogVideoX 到 Wan-Video,开源模型的能力在过去两年里突飞猛进。然而,速度始终是一道门槛。生成一段高质量视频,短则几十秒,长则数分钟,科研人员做消融实验要等,开发者在产品里集成要等,普通用户体验"AI 生成视频"时更要等。FastVideo 正是为解决这个痛点而生——它不是又一个视频生成模型,而是一个通用的推理加速和后训练框架,让几乎所有主流开源视频生成模型都能在它的加持下提速数倍乃至数十倍。
视频生成本质上是去噪扩散过程(Denoising Diffusion):模型从一张纯噪声图像开始,通过数十甚至上百步迭代,逐渐"还原"出目标视频的每一帧。每一步都是一次完整的神经网络前向传播,涉及大量计算。
以当前主流的 DiT(Diffusion Transformer)架构为例,一个标准的 HunyuanVideo 模型在单张 A100 上生成 5 秒 480p 视频需要约 120 秒。如果想要 1080p 高清,或者更长的时长,时间成本会线性甚至超线性增长。
这背后有三重瓶颈:
第一,计算密集度高。 视频的时空维度远高于图像——一个 30fps、5 秒的视频有 150 帧,每帧都是一张独立的图像,加上时序注意力机制,计算量是图像生成的数十倍。
第二,注意力机制冗余。 标准 Transformer 的自注意力是 O(n²) 复杂度,视频的 token 数量(空间 Patch × 时间帧)远大于文本,导致注意力计算成为显存和时间的双重杀手。
第三,缺乏系统级优化。 很多开源模型原生只做了推理可用,没有做显存优化、算子融合、分布式并行等工程优化。
FastVideo 的核心创新,正是从后训练(Post-training)到推理(Inference)的全链路逐一击破。
传统视频生成的注意力是"全连接"的:每一帧的每一个 Patch 都要和视频中所有其他帧的所有 Patch 交互。但神经科学告诉我们,人类的视觉注意力是有选择性的——看一段舞蹈时,你不会同时关注背景中每一片树叶的每一片叶子。
VSA 的核心思想类似:视频中的相邻帧之间存在大量空间冗余,相邻 Patch 之间也存在视觉冗余。通过学习"哪些注意力头应该关注哪里",VSA 可以在不损失生成质量的前提下,将注意力计算量压缩到原来的几分之一甚至几十分之一。
FastVideo 团队在 2025 年 6 月发表的 VSA 论文中展示了惊人结果:在标准 benchmark 上,VSA 注意力模式相比全注意力,在平均性能下降不到 1% 的情况下,实现了 8 倍以上的推理加速。
光有稀疏注意力还不够——模型还需要重新训练才能学会使用稀疏模式。FastVideo 的稀疏蒸馏框架,让团队能够同时进行注意力模式学习和去噪步数蒸馏两步走:教师模型使用全注意力,学生模型使用稀疏注意力,通过 DMD(Distribution Matching Distillation)方法让两者输出分布对齐。
最终产物是 FastWan 系列模型:在精度几乎不降的情况下,将去噪步数从 50 步压缩到 1 步,生成速度提升 50 倍以上。
除了后训练加速,FastVideo 在推理阶段也做了大量工程优化:
FastVideo 还带来了一个令人兴奋的产品——Dreamverse,一个支持实时视频流式生成的 Web 界面。你可以在生成过程中实时"遥控"视频走向,比如输入"让角色转个身",视频就会在下一帧反映这个指令。团队甚至做了一个在线 Demo,在 H100 单卡上就能体验。
Dreamverse 支持多种部署方式:本地 GPU、Docker、Modal(无服务器)、SSH 远程 B200 服务器,覆盖从个人开发者到企业的全场景。
FastVideo 不是封闭的"另一个视频生成模型",而是一个模型无关的加速平台。目前已支持的模型包括:
| 模型 | 加速效果 | 备注 |
|---|---|---|
| Wan2.1 I2V | FastWan2.1(1步生成) | VSA + 蒸馏 |
| HunyuanVideo | FastHunyuan(8倍加速) | 官方 benchmark |
| Mochi | FastMochi(8倍加速) | 社区验证 |
| Cosmos 系列 | FastCosmos | 支持 T2W/I2W/V2W |
| CogVideoX | FastCogVideoX | 支持图像/视频条件生成 |
从 DiT 到 Mamba,从扩散到自回归,FastVideo 的架构设计是模块化的:新增一个模型只需实现对应的 pipeline 接口,无需改动底层优化。
FastVideo 的整体架构分为三层:
核心层(fastvideo/):pipelines/ 实现统一推理接口,models/ 定义 DiT/VAE 等模型,attention/ 管理多后端注意力,distributed/ 处理序列并行和 FSDP2 训练并行。
加速层(fastvideo-kernel/):定制的 CUDA C++ 内核,通过 ThunderKittens DSL 编写,实现算子级融合。CMake 构建系统直接编译成 Python 可调用的扩展。
应用层(apps/dreamverse/):基于 Gradio/Flask 的 Web UI,FastAPI + Uvicorn 的后端服务,通过 WebSocket 实现流式视频推流。
项目采用 uv + pyproject.toml 作为包管理方案(作者明确推荐 uv 而非 conda),Python 3.10+ 支持,完整类型标注(mypy),测试覆盖率良好(pytest + GPU marker)。
方式一:uv pip(推荐,最快)
uv venv --python 3.12 --seed
source .venv/bin/activate
uv pip install fastvideo
方式二:源码安装(开发/魔改用)
git clone https://github.com/hao-ai-lab/FastVideo.git
cd FastVideo
uv venv --python 3.12 --seed
source .venv/bin/activate
uv pip install -e ".[dev]"
方式三:Docker(环境隔离,跨平台)
git clone https://github.com/hao-ai-lab/FastVideo.git
cd FastVideo/apps/dreamverse
bash docker/docker_build.sh
硬件需求方面,推理至少需要 24GB 显存(H100/A100/4090 均可),训练则推荐多卡并行(支持 FSDP2)。
FastVideo 目前的局限值得坦诚交代:
硬件依赖高:虽然支持多档 GPU,但 24GB 显存的下限意味着大多数消费级显卡(如 RTX 4060 Ti 16GB)仍然吃力,H100/A100 对普通开发者来说成本高昂。
CUDA 独占:ROCm 支持在建设中(已有 rocm7_1.Dockerfile),但 CUDA 仍是原生支持,AMD 卡用户需要等待或使用 Docker 方案。
安装复杂度:fastvideo-kernel 需要编译 CUDA C++ 内核,submodule 依赖多,首次安装耗时较长。相比 pip install fastvideo 的理想情况,完整从源码安装需要约 30 分钟。
模型版权:FastVideo 是加速框架,生成效果仍取决于底层模型。HunyuanVideo、Wan2.1 等模型的商用许可各不相同,使用前需自行确认。
FastVideo 的出现,标志着视频生成领域从"模型竞赛"进入"效率竞赛"的新阶段。当模型的生成质量已经不是最大瓶颈时,推理效率和部署便利性就成了新的差异化竞争力。
从数据上看,FastVideo 在 GitHub 上已有 3669 个 star,139 个 open issues,活跃的 Slack 社区和每周开发会议,说明这不是一个"发布即结束"的项目。GIGAZINE、日本技术媒体均有报道,Reddit 和 Twitter 上的讨论热度持续。
更重要的是,FastVideo 的模块化设计让它有潜力成为视频生成领域的 vLLM——就像 vLLM 让 LLM 推理从"贵且慢"变成"便宜且快",FastVideo 正在视频生成领域做同样的事。一个真正可用的、实时的视频生成时代,或许比我们想象的更近。