Waver
字节跳动开源的统一视频生成基座模型,支持文生视频、图生视频、文生图像三大任务,1080P分辨率,运动质量领先
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
字节跳动开源的统一视频生成基座模型,支持文生视频、图生视频、文生图像三大任务,1080P分辨率,运动质量领先
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Waver 项目 Logo
想象一个创作者只需要输入一句话——"一只猫在雨中奔跑",就能在几秒钟内生成一段高清、流畅、富有动态质感的视频。这就是 Waver 1.0 试图实现的目标。作为字节跳动(ByteDance)旗下 FoundationVision 团队的开源力作,Waver 是一个统一了文生视频(T2V)、图生视频(I2V)和文生图像(T2I)的多模态视频生成基座模型。
视频生成曾是扩散模型(Diffusion Model)的天下。2024年至2025年间,OpenAI Sora、快手可灵(Kling)、Runway Gen-3 等产品先后登场,但大多闭源或部署门槛极高。开源社区虽有 Stable Video Diffusion 等尝试,但始终面临分辨率低(多为512p)、动作幅度小、时长短(2-4秒)、多任务不支持等瓶颈。
Waver 1.0 的出现直接回应了这些痛点。其在 Artificial Analysis 的 T2V 和 I2V 双榜单中同时进入前三名,并在自主构建的 Hermes Motion Testset(96条高难度动作提示词)上全面超越包括部分商业模型在内的所有开源竞品。团队仅公开了 8MB 的推理框架(不含权重),便已在 GitHub 斩获近千 Star,其技术报告在 arXiv 引用量也在持续攀升。
Waver 的技术栈建立在三个核心组件之上,理解它们是评估该模型工程价值的关键。
(1)Wan-VAE 视频压缩编码器
团队采用 Wan-AI 开源的 Wan-VAE 对视频进行时空压缩,将原始视频映射到低维潜空间表示。相比传统 8x8x4 的时空压缩比,Wan-VAE 在压缩效率与重建质量之间取得了更优平衡,直接决定了模型能在消费级显存(40GB)内完成 1080p 生成。
(2)双流 + 单流融合的 DiT 架构
模型主体是 Rectified Flow Transformer(M=16 个双流块 + N=40 个单流块),参数规模达 12B。文本编码器融合了 Flan-T5-XXL(11B)和 Qwen2.5-32B-Instruct 两个大模型的特征,通过 Dual Stream 阶段对齐视频与文本表征,再经 Single Stream 阶段完成联合生成。这种架构设计使得 T2V 和 I2V 任务可以共享同一套权重,仅通过输入通道数区分(视频token 16通道,首帧图像token 16通道,任务掩码 4通道)。
(3)级联 Refiner 实现 1080p 超分
为突破基础模型生成分辨率上限,Waver 训练了独立的 Refiner 模块。推理时先由主模型生成 480p 或 720p 低分辨率视频,再由 Refiner 上采样至 1080p。相比直接生成 1080p,级联策略将推理步骤减半,720p→1080p 提速约 40%,480p→1080p 提速约 60%。

图2:训练噪声调度策略(sigma shift 技术)
训练策略上,团队遵循"低分辨率打基础、高分辨率精修"的渐进式路线:先用 192p 视频训练动作建模能力,再逐步升分辨率至 480p、720p。这一策略解决了视频生成中"动作丰富度"与"分辨率"的经典矛盾——低分辨率下模型更容易学到大幅度运动模式。
在推理阶段,Waver 引入了 APG(Adaptive Group Normalization)方法的变体来替代传统 CFG(Classifier-Free Guidance)。APG 将 CFG 更新项分解为平行分量和正交分量,通过压制平行分量来抑制过饱和,同时避免色彩偏移。团队还发现对 latent 从 [C, H, W] 而非 [C, T, H, W] 维度做归一化能进一步减少伪影。推荐超参:归一化阈值 27,guidance scale 8。
此外,通过"提示词标签"(Prompt Tagging)策略,Waver 实现了同一语义内容的多风格迁移——同一段文字描述,经过风格标签前缀的改写,可以生成写实、Ghibli 动画、3D 动画、迪士尼风格、绘本风格等五种完全不同的视觉呈现。

图3:级联 Refiner 结构(Window Attention + 降采样策略)
必须明确的一个重要现实是:Waver 项目仅开源了推理框架代码,模型权重(约 14B+ 参数)托管在 HuggingFace,需要用户自行注册账号、申请权限并通过 Git LFS 下载。这意味着:
对于想要体验的开发者,最可行的路径是通过 Discord 机器人在线体验,或者参考技术报告自行搭建推理管线。字节跳动可能在其内部平台(如 volcengine)提供了更完整的部署方案,但未在开源仓库中体现。
尽管 Waver 在多项基准上表现优异,但仍存在以下局限:
权重未开源:这从根本上限制了学术复现和社区微调。类似"GPT-2 公开但 GPT-3 不公开"的尴尬,Waver 实际上是一款"半开源"产品。
长视频能力有限:当前版本支持 2-10 秒视频生成,更长序列的一致性和运动连贯性仍是挑战。
计算资源门槛高:单卡 40GB VRAM 是最低配置,实际生产级部署通常需要多卡并行。
提示词敏感性:在复杂时空推理(如"A 物体穿过 B 物体的内部")场景下,模型仍有明显不足。
Waver 的发布标志着视频生成领域从"单点突破"走向"系统集成"——不再是某个模块的优秀,而是从架构设计、训练策略、推理优化到美学控制的全链路成熟。它验证了以下趋势:
随着后续版本迭代(如 Waver 1.5)和社区的微调贡献,这一模型的生态价值有望进一步释放。
项目基本信息
| 项目 | FoundationVision/Waver |
|---|---|
| 开发组织 | 字节跳动 FoundationVision 团队 |
| GitHub Stars | 941(截至分析时) |
| 语言 | Python(框架代码) |
| 许可协议 | 未明确(代码仓库无 LICENSE 文件) |
| 主要依赖 | PyTorch 2.0+, CUDA 11.8+, Wan-VAE, Flan-T5-XXL, Qwen2.5-32B |
| 权重托管 | HuggingFace(需单独下载) |
| 相关论文 | arXiv:2508.15761 |