Open-Sora-Plan
开源视频生成里程碑:北大+兔展团队复现Sora,85亿参数SUV模型支持文生视频/图生视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源视频生成里程碑:北大+兔展团队复现Sora,85亿参数SUV模型支持文生视频/图生视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年初,OpenAI扔出一颗"王炸"——Sora,一个能用一句话生成一分钟高清视频的AI模型,瞬间引爆全球科技圈。那时候,技术圈流传着一种说法:"Sora的代码是闭源的,参数是保密的,API是限流的——它是少数人手里的魔法,普通开发者只能远远围观。"
但北大-兔展AIGC联合实验室的一群人,偏不信这个邪。
2024年初,PKU-YuanGroup(北京大学元赐团队)联合兔展智能、华为、鹏城实验室,宣布启动Open-Sora Plan——一个完全开源的Sora复现项目。他们的目标很简单:让每个开发者、每个研究者、每个对AI视频生成感兴趣的普通人,都能参与到这场技术变革中来,而不只是站在门外干瞪眼。
不到两年时间,这个项目在GitHub上狂拦超过12000颗星,成为视频生成开源领域最受关注的标杆项目之一。
Open-Sora Plan的核心技术基于扩散模型(Diffusion Model)。简单类比一下:扩散模型就像让一位画家先在画布上随意泼墨(加噪),然后再一步步把这些墨点擦除并重新画成目标图像(去噪)。只不过在视频生成场景中,这位"画家"要同时处理时间轴上的多帧画面,确保视频在空间和时间维度都保持连贯性。
传统的DiT(Diffusion Transformer)架构需要处理所有帧之间的注意力关系,计算量随帧数平方增长。Open-Sora Plan v1.5.0引入了**SUV(Sparse U-shaped Video DiT)**稀疏注意力机制——借鉴CV领域的U-Net思想,将稀疏注意力引入Transformer,构建U型稀疏结构。这意味着模型可以在保持性能的同时,大幅降低计算成本,让长视频生成成为可能。
视频数据体量庞大,直接在像素层面处理扩散模型对算力要求极高。Open-Sora Plan采用了**WFVAE(Wavelet-based Frame-level VAE)**视觉编码器,将视频压缩到低维潜空间。v1.5.0版本将压缩率提升至8×8×8(时空各压缩8倍),相比社区广泛使用的4×8×8 VAE,潜空间尺寸减半,注意力序列长度大幅缩短,编码时间和显存占用显著降低,同时重建质量(Wavelet-FVD指标)更优。
项目基于PyTorch 2.1.0构建,依赖Diffusers 0.30.2提供扩散模型基础能力,使用xformers 0.0.22优化Transformer注意力计算,通过Accelerate实现分布式训练支持,推理侧集成Gradio提供交互式Web界面。v1.5.0全面转向华为昇腾NPU生态,训练和推理均运行在Ascend 910系列加速器上,并使用MindSpeed-MM框架支持并行训练策略。
一个视频生成模型能生成什么样的内容,很大程度上取决于它"看"过多少视频。
Open-Sora Plan v1.5.0训练数据集包含:
基于这一数据集,团队训练出85亿参数的SUV模型。相比同期的开源视频生成模型(如HunyuanVideo),Open-Sora Plan在8B规模下达到了与之相当的综合性能,但完全开源了训练代码和权重。
训练过程中的一个技术亮点是**自适应梯度裁剪(Adaptive Grad Clipping)**策略:传统方法使用固定阈值(如1.0),但在大规模训练后期,梯度范数往往远低于阈值,导致训练效率下降。Open-Sora Plan引入基于EMA(指数移动平均)的动态阈值机制,根据训练进度自动调整裁剪阈值,既保证了训练稳定性,又提升了收敛效率。
项目采用模块化设计,主要目录结构如下:
必须诚实地说:Open-Sora Plan的部署难度相当高,不适合普通用户。
主要原因有三:
硬件门槛极高:训练需要华为昇腾910B或NVIDIA A100级别GPU,单卡显存需求40GB以上,推理也至少需要20GB显存。绝大多数开发者根本没有这类硬件。根目录没有提供Dockerfile,虽然存在.github/workflows/docker_build.yml构建配置,但需要手动配置完整的容器环境。
软件依赖复杂:除了PyTorch、CUDA/CANN外,还需要安装Ascend CANN Toolkit、MindSpeed-MM框架,以及一系列视频处理库(decord、av、moviepy等)。依赖版本锁定较紧(PyTorch 2.1.0、xformers 0.0.22等),环境配置极易出现版本冲突。
权重获取门槛:官方权重通过HuggingFace或内部渠道分发,下载需要特殊网络条件。Gradio推理界面代码完整,但如果缺少模型权重,界面只能看不能用。
不过,如果你有科研条件(高校实验室、企业研究院)或者能够配置昇腾NPU环境,这个项目是目前开源视频生成领域最值得深入研究的代码库之一。
虽然训练环境门槛极高,但Open-Sora Plan提供了Gradio Web UI作为面向普通用户的交互入口。推理侧代码质量很高:
但使用前提仍然是拥有模型权重。目前部分权重托管在HuggingFace和魔乐社区(Modelers),但下载速度不稳定。
Open-Sora Plan的意义远超项目本身。
在它之前,视频生成领域基本被几家大厂垄断——OpenAI的Sora、Runway的Gen-3、Pika Labs……开发者想要参与,只能调用API、付钱,或者远远观望。Open-Sora Plan用实际行动证明:中国团队完全有能力做出世界级的开源视频生成项目。
北大-兔展AIGC联合实验室的这次尝试,不仅仅是技术层面的突破,更代表了一种"开源精神"——技术不应该只掌握在少数巨头手里,每个愿意学习、愿意贡献的人,都应该有机会参与塑造AI的未来。
从v1.0到v1.5,团队持续开源了所有训练代码、模型权重、技术报告,甚至包括数据处理流程。这种透明度,在AI领域尤其是视频生成领域,是非常难得的。
当然,挑战依然存在:完全基于昇腾NPU的路线限制了它的受众范围(国内开发者为主),长视频生成能力与Sora仍有差距,生成视频的一致性和物理合理性也还有提升空间。
但正如项目README中所写:"We hope the open source community contribute to this project."——这不仅仅是一句客套话,而是北大团队真正在践行的开源承诺。
如果你对AI视频生成感兴趣,无论是研究者、开发者还是爱好者,Open-Sora Plan都是2024-2025年最值得关注和学习的开源项目之一。
项目主页:https://github.com/PKU-YuanGroup/Open-Sora-Plan
最新版本:v1.5.0(2025年6月)
星标数:12000+(截至分析日期)