Wan2.1
阿里开源的大规模视频生成模型,1.3B参数仅需8GB显存即可在RTX 4090上生成高质量AI视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里开源的大规模视频生成模型,1.3B参数仅需8GB显存即可在RTX 4090上生成高质量AI视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Wan2.1 项目 Logo
2025年,如果你想用 AI 生成一段 5 秒的高质量视频,大概率绕不开两个门槛:显存和算力。彼时的 SOTA 模型——无论是 Runway 的 Gen-3 还是 OpenAI 的 Sora——都需要专业级 GPU 集群,单次推理成本从几美元到几十美元不等。普通开发者、研究者和创作者只能在云端排队等待 API 调用,或者干脆放弃。
阿里云万创团队(Wan Team)决定打破这个局面。2025年3月,他们开源了 Wan2.1——一个覆盖文本生成视频(T2V)、图生视频(I2V)、视频编辑(VACE)、文生图(T2I)乃至视频转音频(V2A)的全链路视频生成模型。更关键的是,1.3B 参数的 T2V 模型仅需 8.19GB 显存,在一张 RTX 4090 上约 4 分钟即可生成 5 秒 480P 视频。这一数字直接刷新了开源视频生成模型"消费级 GPU 友好度"的天花板。
GitHub 数据显示,Wan2.1 开源仅数月便积累 16,643 颗 stars,成为 2025 年增长最快的开源 AIGC 项目之一,GitHub Trending 多次霸榜。
理解 Wan2.1 的技术内核,关键在于两件事:DiT 主干网络和 Wan-VAE 视频编码器。
Wan2.1 的生成主干采用了 Diffusion Transformer(DiT) 架构,而非传统的 U-Net 结构。DiT 由纽约大学 & Stability AI 在 2022 年提出,其核心思想是将 Transformer 引入扩散模型,以解决 U-Net 在规模化时遇到的训练不稳定和表征瓶颈问题。

图2:Wan2.1 视频 DiT 架构示意图
(1)多尺度扩散模型框架
项目采用 wan/modules/model.py 中的 DiTModel 类实现完整的扩散 pipeline,支持条件生成(conditioning)。模型接受随机噪声和条件嵌入(文本、图像、动作向量等),通过逐步去噪生成目标视频帧序列。这种条件扩散机制使得同一套模型参数可以服务于多种任务——T2V、I2V、FLF2V(首尾帧到视频)等,只需更换输入条件即可。
(2)3D Patches + 时空注意力
视频数据被切分为 3D Patches(空间x时间),类似 ViT 在图像上的处理方式。这种表示方式让模型能够并行处理所有帧的 token,同时通过时空注意力机制建模帧间的光流和遮挡关系。wan/distributed/xdit_context_parallel.py 中实现了 ZeRO-3 + 序列并行的分布式训练策略,支持在多 GPU 上高效训练超大规模 DiT 模型。
(3)Flow Matching 采样器
项目使用 wan/utils/fm_solvers.py 中的 Flow Matching 采样器替代传统的 DDPM 采样。Flow Matching 的核心优势在于:无需逐步加噪/去噪的马尔可夫链约束,只需一个常微分方程(ODE)从噪声直接积分到数据分布,大幅减少推理步数。fm_solvers_unipc.py 实现了 UniPC 求解器,在保持生成质量的同时进一步加速收敛。
(4)多规模参数配置
代码库通过 wan/configs/wan_t2v_1_3B.py 和 wan/configs/wan_t2v_14B.py 提供了两种参数规模的配置:
| 规格 | 参数量 | 显存需求 | 适用场景 |
|---|---|---|---|
| 1.3B | 13亿 | 8.19 GB | 消费级 GPU、RTX 4090 |
| 14B | 140亿 | 24 GB+ | 高端 GPU、A100 |
开发者可以通过 --ckpt_dir 参数指定不同的模型权重目录,实现"小模型快速实验 + 大模型精调生成"的工作流。
视频生成模型中,VAE(Variational Autoencoder,变分自编码器)负责将视频压缩到低维潜空间,以及从潜空间重建视频。VAE 的效率直接决定训练和推理的显存占用。

图3:Wan-VAE 在不同分辨率/时长视频上的编码解码效果对比
Wan2.1 自研的 Wan-VAE(wan/modules/vae.py)是项目的另一核心技术亮点。官方测试显示,Wan-VAE 可对任意长度的 1080P 视频进行高质量编码和解码,同时保留时序信息,这对长视频生成任务至关重要。相比此前开源社区常用的 3D VAE(如 MagicAnimate、AnimateDiff 等使用的方案),Wan-VAE 在压缩比和重建质量上均有显著提升。
文本理解和多模态对齐是视频生成质量的关键。Wan2.1 采用三编码器融合策略:
wan/modules/t5.py):负责长文本理解和复杂语义建模,支持中英文双语输入wan/modules/clip.py):图像-文本对齐,支撑 I2V 任务的图像理解wan/modules/xlm_roberta.py):跨语言理解,增强模型的多语言生成能力wan/utils/prompt_extend.py 还集成了 DashScope(阿里云)和 Qwen 两种 prompt 扩展器,可将用户的简短描述自动补全为更详细的生成提示词,进一步提升生成效果。

图4:Wan2.1 文本生成视频(T2V)效果示例
项目提供了统一的 generate.py 入口,支持所有任务类型。以 T2V 为例,基本用法如下:
python generate.py \
--task t2v-1.3B \
--prompt "Two anthropomorphic cats in boxing gear fight on a stage" \
--ckpt_dir /path/to/Wan2.1_t2v_1.3B \
--sample_steps 50 \
--output ./output.mp4
generate.py 中硬编码了各任务的示例 prompt(EXAMPLE_PROMPT 字典),包括 T2V、I2V、FLF2V(首尾帧到视频)、VACE(视频条件编辑)等。采样步数(sample_steps)默认为 T2V 50 步、I2V 40 步,可通过 --sample_shift 参数调整扩散 schedule 的偏移量来平衡质量和速度。
对于不想折腾命令行的用户,Wan2.1 在 gradio/ 目录下提供了多个 Gradio 前端脚本:
| 脚本 | 任务 | 模型规模 |
|---|---|---|
| t2v_1.3B_singleGPU.py | 文生视频 | 1.3B(单卡) |
| t2v_14B_singleGPU.py | 文生视频 | 14B(单卡) |
| i2v_14B_singleGPU.py | 图生视频 | 14B |
| t2i_14B_singleGPU.py | 文生图 | 14B |
| vace.py | 视频编辑/条件生成 | VACE |
| fl2v_14B_singleGPU.py | 首尾帧生成视频 | 14B |
每个脚本均支持单 GPU 推理,通过 --num_gpus 1 参数指定。启动方式如:
python gradio/t2v_1.3B_singleGPU.py
启动后会在本地启动 Gradio 服务器(默认端口 7860),通过浏览器即可交互式生成视频。
| 任务 | 模型 | 输入 | 输出 | 显存需求 |
|---|---|---|---|---|
| T2V(文生视频) | 1.3B/14B | 文本 prompt | 视频 | 8.19GB / 24GB |
| I2V(图生视频) | 14B | 图片 + 文本 | 视频 | 24GB+ |
| FLF2V(首尾帧生成) | 14B | 首帧 + 尾帧 + 文本 | 视频 | 24GB+ |
| T2I(文生图) | 14B | 文本 prompt | 图片 | 24GB+ |
| VACE(视频编辑) | 1.3B/14B | 参考图 + 视频 + 文本 | 编辑后视频 | 8.19GB / 24GB |
Python 版本要求 >=3.10,核心依赖:
pip install torch>=2.4.0 torchvision>=0.19.0
pip install diffusers>=0.31.0 transformers>=4.49.0 accelerate
pip install flash_attn # CUDA 编译版,需与 torch 版本匹配
pip install gradio>=5.0.0 opencv-python dashscope
⚠️ Flash Attention 安装是最大的坑。flash_attn 包需要预编译的 CUDA 核函数,与 torch 版本、CUDA 版本强绑定。建议从 PyTorch 官网安装对应 CUDA 版本的 torch,再从 flash_attn 官方 GitHub 的 Release 页面下载与之一致的 wheel 文件。
权重需从 HuggingFace(推荐)或 ModelScope 下载,文件体积较大(1.3B 约 3GB,14B 约 30GB),必须使用 Git LFS:
# HuggingFace
git lfs install
git clone https://huggingface.co/Wan-AI/Wan2.1-T2V-1.3B
# ModelScope
git lfs install
git clone https://modelscope.cn/Wan-AI/Wan2.1-T2V-1.3B
14B 模型 24GB 显存要求对很多开发者来说仍然偏高。项目支持量化推理(需自行修改推理代码接入 bitsandbytes 或 AWQ),或者直接使用 1.3B 模型——这个规格对 RTX 3060(12GB)也完全友好,是目前门槛最低的高质量开源视频生成方案之一。
⚠️ 项目未提供 Dockerfile 或 docker-compose.yml,所有依赖需在宿主机手动安装。对于需要环境隔离或集群部署的团队,建议参考 DeepSpeed 的 docker 文件自行打包。
| 维度 | 评价 |
|---|---|
| 代码结构 | 模块化良好,wan/ 下分 configs、modules、utils、distributed 四个子模块,职责清晰 |
| 文档质量 | README 详细,有 INSTALL.md,Gradio 有独立示例脚本,文档覆盖较全 |
| 测试覆盖 | 有 tests/ 目录,但测试用例数量有限 |
| 类型注解 | pyproject.toml 中配置了 mypy strict 模式,代码中有基础类型注解 |
| 代码风格 | 有 .style.yapf 配置,强制 Black + isort,代码风格统一 |
| License | Apache-2.0,商业友好 |
综合评分:80/100。代码结构清晰、文档完善,但测试覆盖偏弱(这在视频生成领域很常见,测试成本高),Flash Attention 的环境依赖也给上手带来了一定摩擦。

图5:Wan2.1 在 VBench 评测中与主流闭源/开源方案的对比
Wan2.1 的开源对行业有三重意义:
1. 消费级 GPU 上的 SOTA 质量。在 VBench 等公开 benchmark 上,Wan2.1 1.3B 模型的质量已经可以与部分闭源商业方案掰手腕,而 14B 模型在多个维度刷新了开源视频生成的最佳成绩。这打破了"开源 = 低质量"的刻板印象。
2. 多模态统一框架。一个模型覆盖 T2V、I2V、视频编辑、文生图、视频转音频 5 种任务,且底层共享 DiT + Wan-VAE 架构,为多模态 AI 研究提供了良好的实验基座。
3. 中文生态的重要贡献。阿里云 Wan 团队对中文 prompt 的深度优化(集成 DashScope + Qwen),使得 Wan2.1 在中文视频生成任务上体验显著优于同期其他开源方案,对国内 AIGC 开发者生态有直接拉动作用。
已知的局限:
值得关注的进展:
2025 年 5 月,团队发布了 VACE(Video Articulation and Composition Engine)——一种统一视频编辑和生成的架构。通过将视频视为动作向量的组合,VACE 可以在保持主体身份一致性的同时完成风格迁移、运动迁移、角色动画等多种编辑任务。该技术已集成到 Wan2.1 中。
Wan2.1 是目前开源社区最值得关注的大规模视频生成模型之一。它在消费级 GPU 上实现了前所未有的视频生成质量,同时以 Apache-2.0 许可证完全开源。DiT + Wan-VAE 的技术架构、多模态编码器融合、三编码器协同策略,共同支撑起这个多功能、高质量的视频生成系统。
对于 AI 爱好者,Gradio Web UI 让任何人都能在 RTX 4090 上体验 AI 视频创作;对于开发者,模块化的代码结构提供了从推理到微调的完整研究基座。唯一的门槛在于 Flash Attention 的环境配置和数十 GB 的模型权重下载——一旦搞定,迎来的就是 SOTA 级别的视频生成体验。