kandinsky-5
开源多模态扩散模型,支持文生视频/图生视频/文生图/图生图四大能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源多模态扩散模型,支持文生视频/图生视频/文生图/图生图四大能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你可能见过 AI 生成静态图片——输入一句"一只戴着礼帽的猫",几秒钟后一张油画风格的猫咪图就出现了。但如果说,你只需要一句话或一张草图,AI 就能生成一段 5 秒、10 秒的连贯视频呢?Kandinsky 5.0 正是这样一个多模态扩散模型家族,它将文本转视频(T2V)、图片转视频(I2V)、文本转图片(T2I)、图片转图片(I2I)四大能力融为一体,全部开源在 GitHub 上。

图1:Kandinsky 5.0 项目 Logo
Kandinsky(康定斯基)的名字来自著名俄裔抽象艺术先驱瓦西里·康定斯基——项目团队以此命名,暗示其目标同样是打破"具象"的边界,创造"抽象"但有意义的视觉内容。该项目由 kandinskylab 团队开发,是 Kandinsky 系列模型的第 5 个主要版本,定位对标 Runway Gen-3、Pika、Sora 等商业视频生成方案,但选择完全开源。
从 GitHub 仓库数据看:Kandinsky 5.0 目前约 776 颗星,主要语言为 Python,获得了 MIT 许可证, topics 标签包括 diffusion、distillation、kandinsky、text-to-video、video-generation,技术路线聚焦在扩散模型(Diffusion)和模型蒸馏(Distillation)两个方向。
Kandinsky 5.0 的技术栈建立在成熟的扩散模型范式之上,但在组件设计上做了多项创新:
项目核心神经网络位于 kandinsky/models/dit.py,采用了 Diffusion Transformer 架构。不同于传统 U-Net 扩散模型,DiT 使用 Transformer 替换卷积 backbone,在生成质量和可扩展性上更具优势。从 generation_utils.py 可以看到,项目实现了稀疏注意力(Sparse Attention)机制——通过 sta_nabla 函数计算稀疏注意力掩码,支持 "Nabla" 类型的注意力计算,大幅降低长序列视频帧的计算成本。
Kandinsky 5.0 的视觉编码器/解码器使用了两套不同的 VAE:
这个设计在 download_models.py 中有明确体现——根据模型类型选择性下载对应 VAE。这种"术业有专攻"的设计让视频和图片生成各自达到最优质量。
从下载脚本可以看到,项目提供了经过 16 步蒸馏的快速版本(distilled16steps),将原本可能需要数十步迭代的采样过程压缩到 16 步,在质量损失可接受的前提下大幅提升推理速度。SFT(有监督微调)版本则提供了更精细的质量控制。
generation_utils.py 中的 adaptive_mean_std_normalization 函数是项目的独到之处——它不简单地对第一帧做全局归一化,而是参考后续帧的统计分布,自适应调整第一帧的均值和标准差,从而保证视频首尾帧在风格和色调上的一致性。这一技巧对生成连贯的视频至关重要。
代码库中包含 test_lora.py,且 i2v_pipeline.py 引用了 peft 库(LoRA/Adapter 微调框架),支持用户通过 LoRA 对模型进行风格定制微调,拓展应用场景。
| 管线 | 输入 | 输出 | 适用场景 |
|---|---|---|---|
| T2V (Text-to-Video) | 文本描述 | 5-10秒视频 | 创意视频创作、快速原型 |
| I2V (Image-to-Video) | 图片 + 文本 | 5-10秒视频 | 静态图片动画化、产品展示 |
| T2I (Text-to-Image) | 文本描述 | 静态图片 | 概念图生成、素材创作 |
| I2I (Image-to-Image) | 图片 + 文本 | 另一张图片 | 风格迁移、图片编辑 |
每种管线都提供 Lite 和 Pro 两档模型:
项目提供了开箱即用的 ComfyUI 集成,包含 comfyui/nodes_kandinsky.py 节点文件和 4 个 JSON workflow 配置文件:
kandinsky5_lite_T2I.json — 图片生成工作流kandinsky5_lite_T2V.json — 视频生成工作流kandinsky5_lite_I2V.json — 图生视频工作流kandinsky5_lite_I2I.json — 图生图工作流用户只需在 ComfyUI 中加载对应 JSON 文件,配置好 HuggingFace Token,即可通过图形界面拖拽节点调用 Kandinsky 5.0 生成内容,无需编写代码。

图2:ComfyUI 中 Kandinsky 5.0 工作流界面
优点:
download_models.py 一键下载,无需手动寻找资源kandinsky/ 包模块化,kandinsky/models/ 下各组件职责分明挑战:
部署难度评估:中等。对于有深度学习环境的开发者,通过 pip + download_models.py 可在 1-2 小时内完成部署;对于普通用户,建议通过 ComfyUI 图形界面使用。
Kandinsky 5.0 的出现代表着视频生成领域的一个趋势:从"只有大厂能做"到"人人可复现"。在 Kandinsky 5.0 之前,开源社区在图片生成上已有 Stable Diffusion 等成熟方案,但在视频生成上,主流方案(Sora、Runway、Pika)均为闭源商业产品。Kandinsky 5.0 的开源填补了这一空白,让学术研究者和独立开发者也能接触和实验视频生成技术。
同时,其双 VAE 架构和蒸馏策略也为研究者提供了很好的参考——如何针对不同模态设计专用编码器、如何平衡推理速度与生成质量,这些工程经验在代码中是可复用的。
Kandinsky 5.0 是一套功能完整、架构清晰的多模态视频/图片扩散模型开源工具包。它在技术选型上融合了 DiT、双 VAE、蒸馏加速等前沿方案,并通过 ComfyUI 插件和 HuggingFace 模型托管降低了使用门槛。对于想探索视频生成 AI 的爱好者和开发者,这是一个值得关注的开源起点。