TurboDiffusion
清华团队开源视频扩散模型加速框架,单卡 RTX 5090 实现 100~200 倍推理加速
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
清华团队开源视频扩散模型加速框架,单卡 RTX 5090 实现 100~200 倍推理加速
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI 视频生成正从'玩具级演示'迈向'专业内容生产',但横亘在两者之间的,是一道看不见的性能鸿沟——生成一段 5 秒的高清视频,传统方式需要数十分钟,而商业场景要求的却是秒级响应。清华大学团队正是带着这个问题出发,在 2025 年 12 月发布了 TurboDiffusion,一个专为视频扩散模型设计的推理加速框架,在单张 RTX 5090 上实现了惊人的 100~200 倍加速,同时几乎不损失画质。
TurboDiffusion 来自清华大学 M-Lab 实验室,该实验室在 AI 基础设施领域深耕多年,曾产出 SageAttention、SLA 等多个被广泛使用的注意力加速库。这次的 TurboDiffusion 是他们将已有加速技术系统整合、并针对视频扩散场景做专项优化的结晶。论文题为 TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times,于 2025 年 12 月在 arXiv 发表。
核心作者团队包括张锦涛、郑凯文、江凯、王浩旭等,合作者中还包括 UC Berkeley 的 Ion Stoica 教授和 Joseph Gonzalez,以及清华大学的陈建飞、朱军等知名学者。
TurboDiffusion 的加速并非单一技术的功劳,而是三管齐下的系统工程:注意力加速、时间步蒸馏和算子级 CUDA 优化。
注意力层是瓶颈中的瓶颈。视频扩散模型每帧都要计算自注意力,序列长度随帧数和分辨率呈二次增长——一个 77 帧、480p 的视频,注意力矩阵已经是数十万级别的运算量。TurboDiffusion 使用两项技术解决这一瓶颈:
可以把扩散模型想象成一个组装视频的工厂。传统工厂的工人(注意力层)需要看图纸(Query)去对比零件库(Key-Value)里的每一个零件,即使 90% 的零件根本不需要。TurboDiffusion 做了三件事:
TurboDiffusion 引入了 rectified Consistency Model(rCM) 进行时间步蒸馏。传统扩散模型需要 50~200 步去噪才能生成高质量视频,而 rCM 将步数压缩到 1~4 步,质量损失控制在 5% 以内。这相当于从'逐帧手绘'变成'直接喷涂',效率提升一个数量级。
rCM 的核心思想是训练一个一致性函数 f(x_t, t) -> x_{t-1},使得相邻时间步的输出保持一致。这样只需要一个(或少数几个)时间步就能从噪声直接映射到干净视频。TurboDiffusion 的实现在 NVlabs rCM 基础上,针对视频 VAE 的特殊性做了定制优化。
项目包含完整的 CUDA C++ 扩展(位于 turbodiffusion/ops/),包括:
quant/quant.cu):FP16->INT8/FP8 的矩阵乘法,采用 cutlass 库优化。norm/):融合 kernel,减少中间显存分配。gemm/):针对稀疏注意力的特殊 GEMM 实现。这些算子通过 torch.utils.cpp_extension.CUDAExtension 在安装时自动编译,需要 CUDA 12.x 和支持 sm_80+ 架构的 GPU。
turbo_diffusion_ops 是 PyTorch 的 CUDA C++ 扩展包,提供统一的 PyTorch 接口。推理通过 turbodiffusion/inference/wan2.1_t2v_infer.py 脚本驱动,支持 Wan2.1-T2V-1.3B、Wan2.1-T2V-14B 等主流模型,以及 Wan2.2-I2V(图生视频)模式。
TurboDiffusion 的官方评测结果令人印象深刻:
| 模型 | 分辨率 | 原始耗时 | TurboDiffusion | 加速比 |
|---|---|---|---|---|
| Wan2.1-T2V-14B | 720P | 4767 秒 | 24 秒 | ~199x |
| Wan2.1-T2V-1.3B | 480P | ~500 秒 | 4 秒 | ~125x |
| Wan2.2-I2V-A14B | 720P | ~3000 秒 | 20 秒 | ~150x |
换句话说,以前需要近 1.5 小时 才能生成的 5 秒视频,现在 不到半分钟 就能完成,且在单张 RTX 5090 上完成。这意味着视频生成正式从'算力集中云服务'走向'个人开发者可及'的边缘推理场景。

图1:TurboDiffusion 官方 Logo
好消息:TurboDiffusion 代码完全开源(Apache 2.0),pip 可一键安装(pip install .),有完整的 TUI 服务模式(turbodiffusion-serve)。
门槛较高:
目前没有 Docker/Compose 支持,也没有 Web UI(只有 TUI),对普通用户不太友好。但对于有 GPU 服务器的研究团队来说,部署路径清晰,脚本参数明确。
# 安装
git clone https://github.com/thu-ml/TurboDiffusion
cd TurboDiffusion && pip install .
# 推理(需先下载模型权重)
bash scripts/inference_wan2.1_t2v.sh
# 或直接调用
python turbodiffusion/inference/wan2.1_t2v_infer.py \\
--model Wan2.1-1.3B \\
--dit_path checkpoints/TurboWan2.1-T2V-1.3B-480P-quant.pth \\
--num_steps 4 \\
--prompt "A stylish woman walks down a Tokyo street..." \\
--resolution 480p
TurboDiffusion 并非完美:
这些问题反映了视频加速领域的一个核心矛盾:极致的速度提升往往建立在特定的模型架构和场景上,通用性受限是当前技术的共同挑战。
TurboDiffusion 的发布具有重要的行业信号意义:
视频生成的'边缘推理'时代已至。过去需要 H100 集群才能完成的推理任务,现在单卡消费级 GPU 即可胜任。这将极大降低视频 AI 的应用门槛——独立开发者、小工作室、甚至高端个人用户,都可以在本地运行质量接近商用级的视频生成。
注意力优化仍是关键战场。TurboDiffusion 的核心加速仍然来自注意力层的优化(SageAttention + SLA),这与 2023 年以来的 FlashAttention 浪潮一脉相承,也预示着未来还有巨大的优化空间(稀疏注意力、线性注意力、动态路由等)。
开源与闭源的竞争加剧。随着 Wan、CogVideoX、Lumiere 等开源视频模型配合 TurboDiffusion 加速,视频生成领域的开源生态正在快速追赶闭源商业服务(如 Runway、Pika、Sora)。这场竞争最终受益的是开发者和终端用户。