LongCat-Video
136亿参数DiT视频生成模型 | 分钟级长视频生成 | Block Sparse Attention高效推理 | 多奖励RLHF训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
136亿参数DiT视频生成模型 | 分钟级长视频生成 | Block Sparse Attention高效推理 | 多奖励RLHF训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
LongCat-Video 是美团长猫团队(Meituan LongCat Team)于2025年10月开源的视频生成基础模型,拥有136亿参数,在文本到视频(Text-to-Video, T2V)、图像到视频(Image-to-Video, I2V)和视频续写(Video Continuation)三大任务上均展现出与当前顶尖商业和开源方案相媲美的性能。该项目采用先进的 Diffusion Transformer(DiT)架构,通过时空对齐的3D旋转位置编码(RoPE)、Block Sparse Attention 等创新技术,实现了分钟级高质量 720p/30fps 视频的流畅生成,同时支持多 GPU 并行推理加速。2026年5月,项目进一步开源了 LongCat-Video-Avatar-1.5,将视频生成能力拓展至音频驱动的数字人视频生成领域,支持单人和多人的语音驱动动画合成。
LongCat-Video 的核心是 LongCatVideoTransformer3DModel,一个基于 3D 时空建模的 Diffusion Transformer。主要架构参数:hidden_size=4096,depth=48层,num_heads=32,patch_size=(1,2,2),mlp_ratio=4,adaln_tembed_dim=512。每个 Transformer 块(LongCatSingleStreamBlock)包含:自适应层归一化调制(adaLN_modulation)、自注意力层(Attention)、交叉注意力层(MultiHeadCrossAttention)和 SwiGLU 前馈网络。支持 FlashAttention-2/3、xformers 和 Block Sparse Attention 四种注意力实现。
项目中实现了专门的 3D RoPE(rope_3d.py),将头维度分为时间维度 dim_t、高度维度 dim_h、宽度维度 dim_w 三部分,通过 broadcat 操作融合三个方向的频率向量。在上下文并行模式下,RoPE 编码支持 2D 空间切分后的分布式计算。
Block Sparse Attention 是本项目推理效率的核心创新,使用 Triton 编写高性能 GPU kernel。核心实现特点:支持 Top-K、CDF 和 CDF+TopK 混合三种稀疏块选择策略;均值池化压缩(mean_pooling_compression);Triton kernel 优化(包含前向和反向传播);TMA 硬件加速支持;LSE 精确追踪用于反向传播。
项目实现了 2D 上下文并行策略,将计算分布在数据并行(DP)和上下文并行(CP)两个维度。支持空间 H/W 维度的灵活 2D 网格划分,自定义 autograd 函数处理梯度反向传播,梯度按 cp_size 缩放保证无偏性。
采用 AutoencoderKLWan 作为视频 VAE,时空压缩比为:时间维度压缩4倍,空间维度压缩8倍。结合 Block Sparse Attention,使得高分辨率长视频的生成在计算上成为可能。
使用 FlowMatchEulerDiscreteScheduler,基于一阶欧拉离散化实现流匹配采样。支持蒸馏采样(distillation),将步数降至8步(Avatar-1.5),大幅缩短推理时间。
LongCat-Video-Avatar 扩展支持音频驱动的数字人动画合成。v1.0 使用 Wav2Vec2 作为音频编码器;v1.5 升级为 Whisper-Large-v3 音频编码器,配合音频 CFG 实现更精确的口型同步;同时引入 INT8 量化和蒸馏采样。
T2V评测:文本对齐3.76,视觉质量3.25,运动质量3.74,总体质量3.38。 I2V评测:图像对齐4.04,文本对齐3.49,视觉质量3.27,运动质量3.59,总体质量3.17。 在13.6B稠密参数下接近或达到顶尖开源和商业方案水平。