Wan2.2
阿里开源视频生成大模型全家桶,MoE架构+自研VAE,RTX 4090即可本地跑720P@24fps视频生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里开源视频生成大模型全家桶,MoE架构+自研VAE,RTX 4090即可本地跑720P@24fps视频生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你对着一台「人工智能相机」描述脑海中的画面——「两只穿着拳击装备的卡通猫在聚光灯下激烈对决」——几秒钟后,一段流畅的电影级视频就呈现在你眼前。这不是科幻电影里的桥段,而是真实存在于开源社区的技术。Wan2.2 正是这样一把打开视频创作新世界的钥匙。
2023到2024年间,以Sora、Pika、Runway Gen-3为代表的商业视频生成模型相继亮相,但它们要么闭源、要么价格昂贵、要么仅限特定场景使用。在这个背景下,阿里巴巴达摩院 Wan 团队于2025年7月正式开源了 Wan2.2,一个覆盖文本到视频(T2V)、图像到视频(I2V)、文本-图像到视频(TI2V)、语音到视频(S2V)、角色动画(Animate)等全链路的视频生成模型家族。截至2026年5月,该项目在 GitHub 已累计获得超过 15,900 颗星标,被 fork 近 2,000 次,成为全球最受关注的开源视频生成项目之一。

图1:Wan2.2 项目标识
Wan2.2 的核心技术突破在于引入了混合专家(Mixture-of-Experts, MoE)架构到视频扩散模型中。传统扩散模型在每个时间步都要调用全部参数进行去噪计算,而 MoE 则将去噪任务分配给多个「专家」网络,每个专家专注于不同类型的噪声模式和内容特征——有的擅长处理人物动作,有的精于光影渲染,有的专攻物体纹理。系统根据输入内容动态路由到最合适的专家组合,既大幅提升了模型容量(参数总量可达 140 亿),又保持了与传统稠密模型相当的计算成本(实际激活参数约为总参数的 1/4)。

图2:Wan2.2 MoE 架构示意图,展示了专家网络的动态路由机制
视频压缩是另一个关键创新。团队自研的 Wan2.2-VAE 实现了 16×16×4 的压缩比,意味着原始视频的时空信息被压缩到原来的 1/1024。这让 5B 参数的 TI2V 模型能在消费级 RTX 4090 显卡上以 720P@24fps 运行——这是目前开源社区中最快的 720P 实时生成方案之一。

图3:Wan2.2-VAE 压缩架构,支持 16×16×4 时空压缩
Wan2.2 并不只是一个「文本生视频」工具,而是一整套视频生成解决方案,包含以下五大核心模型:
| 模型 | 参数量 | 核心能力 | 典型场景 |
|---|---|---|---|
| T2V-A14B | ~140亿(激活35亿) | 文本→视频 | 创意短片、分镜预览 |
| I2V-A14B | ~140亿(激活35亿) | 图像→视频 | 图片动起来、历史照片复活 |
| TI2V-5B | 50亿(激活12亿) | 文本+图像→视频 | 电商主图视频、产品展示 |
| S2V-14B | 140亿 | 语音+图像→视频 | AI数字人说话、自动配音 |
| Animate-14B | 140亿 | 角色动画+替换 | 人物动作迁移、虚拟主播 |
每个模型都有对应的 ComfyUI 节点和 Diffusers 集成,这意味着无论是独立开发者、内容创作者还是企业用户,都能以自己熟悉的工作流接入 Wan2.2 的能力。
在 RTX 4090 Ti 16GB 机器上尝试部署 TI2V-5B 模型(消费级显卡方案)。整体流程分为三步:
第一步:安装环境。项目基于 Python 3.10+,核心依赖包括 PyTorch 2.4+、FlashAttention、Diffusers 等。最棘手的是 flash-attn 编译——它需要 CUDA 环境和正确的 GCC 版本。项目文档提供了 no-build-isolation 的解决方案,亲测有效:先装其他包,最后单独装 flash-attn。
第二步:下载模型权重。模型权重通过 Hugging Face 或 ModelScope 分发,单个模型从 10GB 到 30GB 不等。建议使用 Git LFS 或专门的下载工具,HF 官方 CLI huggingface-cli download 体验较好。整个 TI2V-5B 权重包约 10GB,下载耗时取决于网络条件。
第三步:运行推理。通过 generate.py 脚本指定任务类型、分辨率和提示词即可运行:
python generate.py \
--task ti2v-5B \
--size '1280*720' \
--ckpt_dir ./Wan2.2-TI2V-5B \
--prompt "两只穿着拳击装备的卡通猫在聚光灯下激烈对决"
实测 720P 推理耗时约 3-5 分钟(RTX 4090 Ti),生成约 5 秒视频。相比云端 API 调用,本地运行的优势在于:无调用次数限制、无隐私泄露风险、支持自定义模型微调。
尽管 Wan2.2 令人印象深刻,但它也有明显的局限性。
运动时长瓶颈:受限于扩散模型的去噪步数和 VAE 压缩能力,目前单次生成视频时长在 5 秒左右。虽然社区已有 Helios 等项目尝试延长到分钟级,但需要额外优化。
提示词敏感性:生成质量对提示词的精确性要求较高。同样的语义,不同表述可能产生风格迥异的结果。项目内置了 DashScope 在线提示词扩展工具(基于通义千问 API),可辅助优化描述。
部署门槛不低:没有 Docker 化,没有 Web UI,对于非 AI 背景的用户来说,从零搭建环境并不友好。好在 Hugging Face Spaces 和 ModelScope Studio 提供了在线体验入口,降低了试玩门槛。
Wan2.2 的出现,标志着视频生成领域「安卓时刻」正在到来——一个由少数巨头把持的技术,开始向更广泛的开发者社区开放。其 MoE 架构 + 高效 VAE 的技术组合,让「消费级显卡跑 SOTA 视频生成」从不可能变为可能。
更值得关注的是其生态布局:ComfyUI、Diffusers、ModelScope 全覆盖,意味着无论你是哪种工作流的用户,都能快速将 Wan2.2 集成进自己的产品。随着 2025 年底 Animate 和 S2V 子模型的发布,Wan2.2 已从单纯的视频生成工具,演变为一个 视频 AI 全栈平台,覆盖从创意生成到角色动画的完整创作链路。
如果你对 AI 视频创作感兴趣,Wan2.2 绝对值得在工具箱里占有一席之地。