Uni-ViGU
Fr0zenCrane/Uni-ViGU加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在 AI 视频领域,长期存在一条泾渭分明的技术分界线:理解(Caption、分类、问答)和生成(Text-to-Video)。传统多模态大模型(MLLM)通常以「理解为核心」,再尝试扩展生成能力——结果要么生成质量平庸,要么计算开销爆炸。2026 年,来自学术界的研究者提出了一个大胆的反问:为什么不从视频生成器出发,让它也能「看懂」世界?
这就是 Uni-ViGU 出现的背景。
Uni-ViGU 全称 Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator,由秦罗政、宫佳、乔倩等研究者提出,2026 年 4 月在 arXiv 发表(arXiv:2604.08121),代码同步开源于 GitHub,模型权重托管于 HuggingFace。
该项目提出了一个核心创新:以视频生成器为基座,统一视频生成与视频理解两大任务。这是对传统「理解优先」路线的一次范式反转——不再让理解模型勉强支持生成,而是让生成模型学会理解。
从社区表现来看,项目目前获得 34 Stars、1 Fork、1 个 Open Issue,主要贡献者约 10 人,话题标签涵盖 any-to-any、computer-vision、deep-learning、llm、multimodal、vision-language-pretraining,定位为前沿学术研究项目而非工业级产品。
视频生成和文本生成的数据类型天然不同:视频帧是连续值(像素),文本是离散值(Token)。传统方法往往需要两套不同的扩散过程,或者干脆忽略这种差异。
Uni-ViGU 提出了统一 Flow Matching 方法,在单一过程中同时完成:
两种路径共享去噪时间步 t,让视频和文本在生成过程中自然对齐,而不是分阶段串行处理。
研究团队引入了基于 MoE(Mixture of Experts)的模态驱动框架。在 Transformer block 中,视频生成保持原有扩散先验不变,额外叠加轻量级专家层来处理文本生成任务。这种设计确保了生成模型的核心能力不被破坏,同时获得理解能力。
Uni-ViGU 设计了两阶段双向训练机制:
阶段一:知识召回(Knowledge Recall)——让模型重建输入提示词(Prompt),通过这个「回忆」过程,模型学会文本与视频之间的对应关系。
阶段二:能力精调(Capability Refinement)——在详细描述(Caption)数据上进行微调,建立区分性的共享表征,让模型不仅能生成视频,还能精准「读懂」视频内容。
Uni-ViGU 的推理脚本 inference_unified_wan.py 支持三种模式:
| 模式 | 说明 | 典型输入 |
|---|---|---|
| T2V(Text-to-Video) | 文本生成视频 | 自然语言 Prompt → MP4 视频 |
| T2VT(Text-to-Video-Text) | 联合生成视频+文本 | Prompt → 视频 + 视频描述 |
| V2T(Video-to-Text) | 视频理解(视频 Caption) | 视频帧 → 文本描述 |
每种模式都支持 CFG(Classifier-Free Guidance)引导以提升Prompt遵循度,并可通过 --save_video --video_format mp4 导出最终视频文件。
从官方 Demo 页面(fr0zencrane.github.io/uni-vigu-page/)可以看到,实际生成分辨率为 832×480,步数默认 100 步,输出帧率 16fps,支持拖拽预览去噪轨迹。
好消息是代码完全开源,安装流程在 README 中有清晰说明。
坏消息是这是典型的研究级项目,上手门槛较高:
facebookresearch/flow_matching(不是 pip 直接装),再装 transformers==4.57.6、sentencepiece、einops、accelerate、diffusers 等至少 8 个包整体来看,Uni-ViGU 适合有科研背景、了解扩散模型原理的开发者;普通 AI 爱好者在没有高性能 GPU 的情况下很难本地复现。
Uni-ViGU 最有价值的贡献不在于某个具体指标,而在于范式探索本身。它证明了「以生成为基座」这条路走得通——通过 Flow Matching 统一连续/离散数据、通过 MoE 保持生成先验、通过双向训练弥补理解短板,这套组合拳为未来更强大的多模态模型提供了新思路。
从趋势看,生成优先(Generation-First)路线正在成为多模态 AI 的新方向。Uni-ViGU 的出现让开源社区多了一个可深入研究、对抗闭源商业模型的参照物。
如果你对多模态 AI 的架构演进感兴趣,或者想复现一篇 2026 年的顶会级别论文,Uni-ViGU 值得花时间研究。