Helios
单卡H100上19.5 FPS实时生成长视频的14B扩散模型,无需传统加速即可达到分钟级高质量生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
单卡H100上19.5 FPS实时生成长视频的14B扩散模型,无需传统加速即可达到分钟级高质量生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的经历——用 AI 生成一段 10 秒的视频,然后眼睁睁看着进度条跑了半小时?对于专业创作者来说,视频生成一直是"算力换时间"的苦力活:模型越大、效果越好,但等待时间也越长。曾经,生成一段质量过得去的视频,少则几分钟,多则数小时。
Helios 打破了这个僵局。这是一个可以在 单卡 H100 GPU 上以 19.5 FPS 实时生成长达分钟级高质量视频 的扩散模型——注意,这里说的是"实时",不是"加速",更不是"缩短到还能接受"。19.5 FPS 意味着你可以在生成的同时就看到视频播放,这在 AI 视频生成领域几乎是前所未有的。
Helios 由北京大学 YuanGroup 团队开发并开源(Apache-2.0 许可证)。2026 年 3 月正式发布论文(arXiv:2603.04379)并公开训练代码、推理脚本和模型权重,GitHub 迅速积累了超过 1800 颗星。
项目团队选择了与当时主流视频生成方案完全不同的技术路线:既不用传统的防漂移策略(如 self-forcing、error-banks、keyframe sampling),也不用常规的推理加速手段(如 KV-cache、causal masking、稀疏注意力、TinyVAE、量化压缩)。这种"不走寻常路"的思路,最终换来了端到端推理性能的突破。
生活类比:就像别人都在研究如何让跑车跑得更快,Helios 团队选择重新发明了一条不需要减速的赛道。
Helios 的核心是一个基于扩散(Diffusion)架构的视频生成模型,参数规模达到 14B(140 亿)级别。项目组发布了三个版本:
在代码层面,Helios 有几个值得关注的自研模块:
HeliosPipeline(helios/pipelines/pipeline_helios.py):核心推理管道,集成了自定义调度器(HeliosSc)和 VAE(基于 Wan 2.1),支持文本到视频(T2V)、图像到视频(I2V)、视频到视频(V2V)三种生成模式。
自定义调度器(helios/scheduler/scheduling_helios.py):区别于标准 DDPM/DDIM,是 Helios 实现高速推理的关键之一。
HeliosDMDScheduler:支持 DMD(Diffusion Model Distillation)流水线,与 Hugging Face Diffusers 生态深度集成。
CUDA 自定义算子(helios/modules/helios_kernels):用 Triton 等框架编写的高效 GPU 内核,显著提升训练和推理吞吐量。
项目代码还提供了与主流推理框架的集成:
文本到视频(T2V):输入一句描述(如"A dynamic time-lapse video showing the rapidly moving scenery from the window of a speeding train"),直接生成长达分钟级的连贯视频。
图像到视频(I2V):上传一张图片作为起始帧,模型在此基础上延续生成视频。注意由于训练基于 T2V,I2V 和 V2V 效果可能略逊于 T2V,可通过调节 is_skip_first_chunk 参数改善。
视频到视频(V2V):对已有视频进行风格或内容迁移。
此外,Helios 还支持:
本地部署门槛较高,主要原因是:
不过,GitHub 社区已经有人发布了消费级显卡(4K 生成)的部署教程(YouTube 非官方教程),说明经过调优后,Helios 在消费级硬件上也有可玩性。
最便捷的体验方式是通过 Hugging Face Gradio 在线演示:https://huggingface.co/spaces/BestWishYsh/Helios-14B-RealTime,零安装即可体验模型效果。
Helios 的出现将 AI 视频生成的实时性门槛大幅提升,其技术路线(绕过传统加速手段、另辟蹊径的架构优化)对后续研究者有重要参考价值。北大 YuanGroup 团队持续更新(2026 年 3 月密集发布多个版本),并积极推进与 Diffusers、SGLang、vLLM 等主流生态的集成,显示出良好的开源维护状态。
对于** AI 爱好者**:Helios 展示了当前视频生成技术的最前沿,Gradio 在线体验值得一试;对于** AI 开发者**:Helios 的自定义调度器、CUDA 内核和 Group Offloading 实现是极好的研究素材,代码模块化程度高,适合深入研究扩散模型推理优化。