FramePack
上下文压缩固定长度,仅6GB显存即可运行13B视频扩散模型,支持本地生成长视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
上下文压缩固定长度,仅6GB显存即可运行13B视频扩散模型,支持本地生成长视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年4月,一位名叫 lllyasviel 的开发者上传了一个名为 FramePack 的项目到 GitHub。不到一个月,这个项目狂揽上万 stars,成为 AI 视频生成领域最受关注的开源项目之一。它解决了一个让所有视频生成玩家头疼的问题:如何用有限的显卡资源,生成长视频?
想象一下:你要用 AI 生成一段 60 秒的 30fps 视频——这意味着 1800 帧。传统方案下,模型需要同时处理全部历史帧,显存占用随视频长度线性增长。13B 参数的模型,稍不注意就会让你的 6GB 显卡直接爆显存。而 FramePack 说:"没关系,我把上下文压缩到固定长度,不管你的视频多长,显存占用基本不变。"
这个看似简单的设计思路,打开了长视频生成的大门。
视频扩散模型(Video Diffusion Model)是当前 AI 视频生成的主流技术路线。与图像扩散类似,它通过逐步去噪的方式从噪声中恢复出视频帧。但视频有一个独特的挑战:时间维度。
当你给模型一张起始图片,让它生成后续视频时,模型需要"记住"之前生成的所有帧,以保证视频的连贯性(专业术语叫"时间一致性")。传统方案会将所有历史帧全部编码后输入模型——这意味着显存占用与视频长度成正比。生成一个 5 分钟的 AI 短片,可能需要 80GB 显存,这显然超出了大多数普通用户的硬件能力。
FramePack 的核心创新正是针对这一痛点。
FramePack 采用了全新的下一帧(段)预测架构,灵感来自图像扩散模型的设计哲学:视频扩散,但用起来要像图像扩散一样简单。
传统方案将所有历史帧编码后平铺在 GPU 内存中。FramePack 则将这些帧打包(pack)到一个固定长度的向量空间中。无论输入多少帧,输出始终是固定长度的上下文表示。这意味着:
AI 视频生成还有一个常见问题:漂移(drifting)——视频生成到后半段,人物的脸型、场景的光照逐渐走样,最终面目全非。FramePack 的论文专门讨论了漂移的成因,并提出了一种**规划式防漂移(Planned Anti-Drifting)**策略,在生成过程中主动干预,防止质量退化。
FramePack 基于 HunyuanVideo(腾讯混元视频) 架构开发,这是腾讯开源的一个大规模视频扩散模型。项目采用 Python + PyTorch 技术栈,核心依赖包括:
| 组件 | 技术选型 |
|---|---|
| 深度学习框架 | PyTorch(支持 fp16/bf16) |
| 扩散模型库 | Diffusers 0.33.1 |
| 文本编码器 | Llama + CLIP 双编码器 |
| 视频 VAE | AutoencoderKLHunyuanVideo |
| 前端界面 | Gradio 5.23.0 |
| 注意力优化 | PyTorch Attention / xFormers / Flash-Attn / Sage-Attn |
代码结构方面,项目在 diffusers_helper/ 目录下实现了完整的推理管线:
hunyuan.py:核心的潜空间编码/解码工具memory.py:显存动态管理(动态卸载/加载模型层)pipelines/k_diffusion.py:参考了 k-diffusion 的采样策略models/hunyuan_video_packed.py:定制的 Transformer 3D 模型封装特别值得一提的是 memory.py 中的动态显存管理方案:当显存不足时,模型会以层为单位动态卸载部分权重到内存,待需要时再加载回来。这是一种工程上的巧思,让低显存 GPU 也能运行大模型。
FramePack 为不同用户提供了两种入门路径:
Windows 用户:下载官方提供的一键安装包(CUDA 12.6 + PyTorch 2.6,约 1.7GB),解压后运行 run.bat 即可。模型文件(约 30GB+)会在首次启动时自动从 HuggingFace 下载。官方还贴心地提供了 update.bat 用于版本更新。
Linux / 服务器用户:手动安装依赖:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126
pip install -r requirements.txt
python demo_gradio.py
项目自带 Gradio 网页界面,操作逻辑非常直观:
由于是逐帧预测,你可以在生成过程中实时看到画面逐步延伸,不需要等整个视频生成完毕。这种所见即所得的体验,大大降低了调试成本。
在 RTX 4090 桌面上,未经优化的生成速度约为 2.5 秒/帧,开启 TeaCache 加速后可达 1.5 秒/帧。换算下来,一段 5 秒的短视频(约 150 帧)需要 6-10 分钟。笔记本显卡(RTX 3070 Ti / 3060 Laptop)会慢 4-8 倍,但仍然可以接受。
| 特性 | FramePack | Stable Diffusion Video | CogVideoX |
|---|---|---|---|
| 最低显存 | 6GB | 12GB | 18GB |
| 长视频支持 | 优秀 | 一般 | 良好 |
| 开源程度 | 完全开源 | 完全开源 | 完全开源 |
| Web UI | 有 | 需自行搭建 | 需自行搭建 |
FramePack 的出现标志着 AI 视频生成工具在易用性上的一次重要突破。过去,用户想要本地运行视频生成模型,往往需要专业的 ML 知识、海量的硬件投入,以及反复调试的痛苦。FramePack 通过三项工程优化大幅降低了门槛:
从更宏观的视角看,FramePack 代表的趋势是扩散模型从"实验室演示"走向"桌面应用"。随着类似项目的发展,AI 视频生成正在从"少数人的玩具"变成"每个创作者的常规工具"。
截至 2026 年 5 月,FramePack 已在 GitHub 收获超过 16,900 个 stars,衍生出 FramePack-F1(2025年5月)和 FramePack-P1(2025年6月)等后续版本,后者在防漂移和历史离散化方面做了进一步优化。
适合使用 FramePack 的场景:
不太适合的场景:
上手建议: 如果你有一块 6GB 以上显存的 NVIDIA 显卡,直接下载 Windows 一键包是最高效的方式。Linux 用户建议先阅读 GitHub Issues 中关于常见问题的讨论,避坑效果显著。