HunyuanVideo-1.5
腾讯混元开源的8.3B参数视频生成模型,RTX 4090本地运行720P高清视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
腾讯混元开源的8.3B参数视频生成模型,RTX 4090本地运行720P高清视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年末,当你想要用文字描述一段画面、让AI帮你生成一段短视频时,往往要面对这样的困境:要么依赖闭源API付费调用,要么用开源模型却只能在专业工作站上跑——消费级显卡根本带不动。这类痛点贯穿了整个视频生成领域的2023-2024年。腾讯混元团队(Hunyuan)在2025年11月开源的 HunyuanVideo-1.5,正是为解决这个矛盾而来:只用 8.3B参数 的轻量架构,在消费级GPU(RTX 4090)上就能生成高质量720p视频,将视频生成的门槛从专业实验室拉到了普通开发者的桌面。

图1:HunyuanVideo-1.5 在多项 T2V 评测基准上的综合评分对比
视频生成长期面临一个"不可能三角":质量高、推理快、硬件需求低——三者往往只能取其二。以 OpenAI Sora、Runway Gen-3 为代表的闭源模型质量出众,但调用成本高昂;开源社区的 earlier models(如 ModelScope Text2Video)虽然免费,但生成效果和速度都难以令人满意。HunyuanVideo-1.5 试图同时破解这三个维度。
腾讯混元团队此前已有 HunyuanVideo(闭源版本)在业界积累了大量口碑,1.5版本的开源则是将这一能力下放给社区的关键一步。项目于2025年11月20日公开推理代码,12月5日追加训练代码和LoRA微调脚本,迅速吸引了全球开发者的关注。
从技术演进路径看,视频生成模型经历了 GAN时代 → 自回归模型(如 CogVideo)→ Diffusion Transformer(DiT)时代。HunyuanVideo-1.5 处于 DiT 时代的前沿,通过 SSTA(选择性滑动分块注意力)机制和超分网络(VSR)两项创新,在保持参数精简的同时实现了专业级输出质量。
用户只需提供一段英文或中文描述,generate.py 脚本即可驱动整个推理管线。以 480P 分辨率为例,官方在 RTX 4090 上的端到端生成时间约 75秒(使用 step-distilled 模型,仅需8步采样),而 720P 高分辨率模式也在 3-5 分钟内完成。生成的视频默认 24fps,时长约5秒(可通过参数扩展)。
支持中英文双语提示词是该项目相对于其他国际开源竞品的一大优势。团队引入了 Glyph-SDXL-v2(基于 google/byT5 的多语言字体感知编码器),能够精准理解中文语义和排版细节——这对国内用户的实际使用场景至关重要。
只需上传一张图片作为首帧,结合文字描述,即可让静态图像"动起来"。I2V 模式在人物动作连贯性和物体运动自然度上表现尤为突出,评测分数在多项指标上超越同类开源方案。

图2:I2V 任务在 VBench 评测框架上的质量评分
核心采用 Diffusion Transformer(扩散变换器)架构,而非传统的 U-Net。DiT 的核心思想是用 Transformer 替代 UNet 中的卷积结构处理噪声图块,使模型能够更好地捕捉视频中长程的时空依赖关系。
具体实现上,项目将视频压缩为时空图块(spatiotemporal patches),通过多层 Transformer 块进行去噪预测。模型规模为 8.3B 参数——相比竞品如 CogVideoX(17B+)轻了近一半,但通过更好的训练策略和架构设计实现了相近甚至更好的效果。
SSTA(Selective and Sliding Tile Attention,选择性滑动分块注意力)是团队的核心创新。在生成长视频时,标准全注意力机制的计算量随帧数呈平方级增长,而 SSTA 通过以下两个策略有效剪枝:
官方数据显示,相比 FlashAttention-3 基线,SSTA 在 10秒 720p 视频合成任务上实现 1.87倍端到端加速,同时保持质量基本不变。
生成基础分辨率(480P)后,通过一个专用的 few-step 超分网络将视频上采样至 720P。该网络专注于细节锐化和畸变校正,而非重新生成内容,因此计算代价远低于端到端生成高分辨率视频。720P-sr-step-distilled 模型进一步将超分步数从 20步压缩至 4步,效率大幅提升。
视频被压缩至原始空间的 1/16(空间)和 1/4(时间),极大降低了 DiT 主干的计算负担,同时 VAE 重构质量足以支持最终输出可用。
项目支持三种注意力加速库(可按需切换),并支持 fp8 GEMM 推理:
此外还支持 DeepCache、TeaCache、TaylorCache 等推理缓存加速方案,叠加使用可进一步缩短生成时间。
项目开源的 train.py 提供了完整的训练管线,支持:
create_dummy_dataloader() 函数作为占位符,用户需替换为自己的数据加载器,数据格式要求为:pixel_values(-1~1范围的视频/图像张量)、text(提示词)、data_type("video" 或 "image")。
HunyuanVideo-1.5 的社区生态是其重要优势之一:
虽然相比动辄几十B参数的大模型已有大幅改善,但 14GB VRAM(启用offloading)/ 24GB(最优速度)的需求,仍然将大量普通用户拒之门外。对于没有独显或仅有入门级显卡的用户,门槛依然较高。
开源的是推理代码和部分模型权重(480P/720P T2V/I2V 主模型),稀疏注意力模型、蒸馏模型和超分模型的权重尚未公开。这限制了部分高级能力的本地复现。
项目采用 Tencent Hunyuan Community License Agreement(非标准开源协议),对商业使用有额外限制,企业用户需仔细评估合规性。
当前版本主要针对5秒短视频设计,生成长视频(>30秒)在质量一致性和时序连贯性上仍有挑战。
对于复杂提示词中包含多个主体/动作的精确控制,目前的解决方案相对有限,在组合生成场景下偶发主体特征混淆。
HunyuanVideo-1.5 的开源标志着视频生成领域的一个重要转折点:从"大模型=高质量"向"精架构=高质量"的范式转变。它证明在 DiT 架构已经成熟的前提下,模型效率的提升可以通过架构创新(而非简单堆参数)来实现。
从开源社区角度看,该项目提供了难得的中英双语支持、完整的训练和微调链路,以及活跃的第三方生态集成。对 AI 研究者而言,这是目前最接近工业级效果的开源视频生成基准之一;对 AI 爱好者而言,RTX 4090 即可本地运行的可能性让"AI拍片"从云端API走向了个人电脑。
未来,随着稀疏注意力模型和 SR 模型的权重逐步开源,以及 OmniWeaving 等衍生项目的发展,HunyuanVideo 生态有望成为开源视频生成领域的事实标准。