VideoTuna
统一 9 大开源视频生成模型(Hunyuan/Wan/CogVideoX 等)的推理+微调工具包
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
统一 9 大开源视频生成模型(Hunyuan/Wan/CogVideoX 等)的推理+微调工具包
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你是一个短视频创作者,想要训练一个专属于自己的 AI 导演——能生成特定风格的人物、场景或动作。但面对 HuggingFace 上 dozens of 视频生成模型,每个模型有不同的代码架构、数据格式和训练脚本,学习成本极高。VideoTuna 正是为了解决这个问题而诞生的:它将当前主流的开源视频生成模型统一到一个框架下,提供从推理到微调的全套工具链。
图1:VideoTuna 统一支持 T2V(文生视频)、I2V(图生视频)、T2I(文生图)等多种任务
2023-2024 年,开源视频生成领域迎来了爆发式增长。腾讯混元(HunyuanVideo)、阿里万相(WanVideo)、智谱 CogVideoX、Step-Video 等模型相继开源,涵盖了从 2B 到 30B 参数的不同规模。但这也带来了碎片化问题:每个模型有自己独特的推理入口、微调脚本和配置文件,研究者和创作者需要在多个仓库之间反复横跳。
VideoTuna 由香港科技大学团队开发(主要作者:Yingqing He、Yazhou Xing),核心贡献是首次将主流开源视频生成模型统一到同一个代码框架中,支持推理(Inference)和微调(Fine-tuning)两大核心功能。项目在 GitHub 上获得了 548 颗星,被标记为 text-to-video、video-generation、fine-tuning-diffusion 等高价值话题。
VideoTuna 目前支持 9 个主流视频生成模型,覆盖 T2V(文生视频)和 I2V(图生视频)两大任务。以推理显存和速度为例:
| 模型 | 任务 | 分辨率 | 推理时间 | 显存 |
|---|---|---|---|---|
| Mochi | T2V | 480×848 | 2分钟 | 26GB |
| CogVideoX-2b | T2V | 480×720 | 2分钟 | 3GB |
| WanVideo | T2V | 720×1280 | 32分钟 | 70GB |
| HunyuanVideo | T2V | 720×1280 | 32分钟 | 60GB |
| Step-Video | T2V | 544×992 | 8分钟 | 61GB |
| CogVideoX-5b-I2V | I2V | 480×720 | 5分钟 | 5GB |
即便是入门级模型 CogVideoX-2b,也只需 3GB 显存即可运行,适合普通研究者在消费级 GPU 上体验。而高端模型 WanVideo 和 HunyuanVideo 则能生成 720P 超长视频(81-129 帧)。
VideoTuna 支持 LoRA 高效微调和全量微调两种模式。对于大多数用户,LoRA 微调是首选——它只需调整少量参数(通常占总参数的 1-5%),大幅降低显存需求:
训练通过 Poetry 统一管理依赖,一条 poetry run train-xxx 命令即可启动。同时支持 VBench 自动化评测,可在训练后自动评估生成质量。
README 中提到了 Human Preference Alignment(人类偏好对齐),通过 RLHF 技术让视频生成更符合人类审美。不过该功能在 README 中被注释掉了,代码仓库 configs/train/004_rlhf_vc2/ 中有相关配置,说明仍在积极开发中。
VideoTuna 支持 V2V(Video-to-Video)后处理增强,通过 modelscope 套件对生成视频进行超分辨率、去噪等处理。
从数据准备 → 预训练 → 微调 → 评测 → 后处理,VideoTuna 提供了完整流程。数据集格式支持 jsonl/csv,每条记录包含视频路径和描述文本。
VideoTuna 的架构核心是配置驱动——不同模型有不同的 YAML 配置文件,统一放在 configs/ 目录下:
configs/
├── 000_videocrafter/ # VideoCrafter1
├── 001_videocrafter2/ # VideoCrafter2
├── 002_dynamicrafter/ # DynamiCrafter
├── 003_opensora/ # Open-Sora
├── 004_cogvideox/ # CogVideoX (原始)
├── 005_cogvideox1.5/ # CogVideoX 1.5
├── 006_flux/ # Flux 图像
├── 007_hunyuanvideo/ # 腾讯混元
├── 008_wanvideo/ # 阿里万相
└── 009_stepvideo/ # Step-Video
底层技术栈非常「重磅」:
代码质量方面,项目使用 Poetry 管理依赖(Python 3.10+),内置 pre-commit hooks(black/isort/mypy/ruff),并通过 .pre-commit-config.yaml 确保提交代码风格统一。
VideoTuna 在部署上呈现出明显的两面性:
好的方面:提供 docker-compose.yml 和完整的 Dockerfile,MacOS 用户(Apple Silicon)可以通过 Docker 一键构建运行环境,无需手动处理 arm64 兼容性问题。Linux 用户可以通过 Poetry 快速安装依赖。
困难的方面:
总体而言,有 Docker + 高端 GPU + 稳定网络的用户,部署相对顺畅;普通用户需要耐心解决环境和模型下载问题。
如果你想快速体验,推荐从 CogVideoX-2b 开始:
poetry install
poetry run inference-cogvideo-t2v-diffusers
只需 3GB 显存,2 分钟出结果。
如果想微调自己的风格,选 CogVideoX LoRA 或 WanVideo LoRA,显存需求相对较低。
亮点:
局限:
VideoTuna 代表着开源 AI 视频生成领域从「单点突破」走向「平台化整合」的趋势。随着混元、万相、Step-Video 等大模型的陆续开源,如何降低这些模型的使用门槛成为关键问题。VideoTuna 通过统一框架、统一接口的方式,让研究者可以便捷地对比不同模型的效果差异,让创作者可以在一个环境中使用多个模型。
同时,项目对 LoRA 微调的完善支持,也推动了 AI 视频个性化定制的普及——用户不再需要完整的模型训练流程,只需准备几十张图片,就能训练出专属风格的视频生成 LoRA。
图2:VideoTuna 开源贡献者