CogVideo
国产开源文生视频大模型,DiT架构,支持5B/2B参数规模,本地Gradio可部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
国产开源文生视频大模型,DiT架构,支持5B/2B参数规模,本地Gradio可部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:CogVideo 项目 GitHub 头像
2023年,一个来自清华大学的研究团队在国际顶级机器学习会议 ICLR 上发表了一篇论文,提出了一个在当时引起不小轰动的想法:让大语言模型也学会讲故事——用文本直接生成连贯的视频。这个项目,就是 CogVideo。不到两年后的2024年,同一团队推出了升级版本 CogVideoX,将视频生成的质量和效率推到了新的高度。截至目前,该项目在 GitHub 上已获得超过 12,000 颗星,成为开源视频生成领域最受关注的项目之一。
要理解 CogVideo 的价值,需要先了解视频生成的技术难点。与图像生成不同,视频生成面临三个核心挑战:
1. 时间连贯性:视频不是静态图片的堆叠,每一帧之间必须有逻辑上的连贯性——人物的移动、光影的变化、物体的运动轨迹,都必须符合物理规律和场景逻辑。早期的方法用 GAN(生成对抗网络)做视频生成,容易出现画面扭曲、物体变形等恐怖谷效应。
2. 内容保真度:生成6帧视频容易,生成 48帧甚至更长的高质量连贯视频则难得多。随着帧数增加,误差会不断累积放大,导致视频越往后越放飞自我。
3. 计算资源门槛:视频数据的维度远高于图像,一张 512x512 的图片有 262,144 个像素,而一段同样分辨率、6秒 30fps 的视频就有超过 900万 个像素需要处理。训练这样一个模型,需要庞大的 GPU 算力支撑。
CogVideo 采用了基于 Transformer 的扩散模型(Diffusion Transformer)架构,这与 OpenAI Sora、Runway Gen-3 等闭源方案的思路一脉相承,但开源社区直到 CogVideo 才真正拥有了可用的实现方案。
具体来说,CogVideoX 的技术栈包含以下核心组件:
CogVideoX-5B / CogVideoX-2B 模型:提供两个规模的预训练权重,CogVideoX-5B 参数量更大、生成质量更高,CogVideoX-2B 适合消费级 GPU 运行。
HuggingFace Diffusers 集成:通过 diffusers 库提供标准化推理接口,支持 pipeline 一行代码加载模型并生成视频,降低了使用门槛。
3D-Causal VAE 视频编码器:将视频压缩到潜空间(latent space)中处理,大幅降低计算开销,同时保留时间维度的连贯性。
文本编码器:使用大规模语言模型(如 GPT 系列)对文本提示进行编码,理解语义后指导视频生成过程。
Gradio Web UI:提供交互式网页界面,用户输入文字描述即可生成视频,无需编程基础。
安装 CogVideoX 并不困难,但对硬件有较高要求。官方推荐使用 NVIDIA A100 或更高规格的 GPU,显存至少 16GB(推荐 24GB 以上)。如果你有一块 RTX 3090 或 RTX 4090,也可以运行较小规模的 CogVideoX-2B 模型。
核心安装步骤:
# 依赖安装
pip install diffusers>=0.35.2 transformers>=4.57.1 torch>=2.8.0
pip install gradio>=5.49.1 imageio-ffmpeg moviepy
# 启动 Gradio Web Demo
python inference/gradio_web_demo.py
推理时需要从 HuggingFace 手动下载模型权重(约 9GB),需要提前在 HuggingFace 注册账号并签署模型协议。运行后,Gradio 会在本地启动一个 Web 服务,用户在浏览器中输入描述性文本,模型即可生成对应视频。
对于想要微调(Fine-tune)模型的用户,项目提供了完整的训练框架,支持 DeepSpeed 分布式训练和 LoRA 低秩适配器技术,可以在自定义数据集上调整模型行为。训练配置通过 YAML 文件管理,支持多机多卡 DDP 训练。
从代码结构来看,CogVideoX 的架构设计体现了几个值得关注的工程决策:
模块化模型加载:使用 HuggingFace from_pretrained 接口加载预训练权重,推理代码高度抽象化。这种做法与 Stable Diffusion 社区的实践一致,用户可以方便地替换不同的 VAE、Text Encoder 或 LoRA 权重。
Gradio 增强型推理:Web Demo 中集成了 GPT 模型用于 Prompt 增强(Prompt Enhancement)——用户输入简短描述后,系统自动调用 GPT 将其扩展为更详细、更具描述性的视频生成提示词,显著提升生成效果。这体现了大模型协作(LLM + Video Gen)的新趋势。
量化推理支持:项目中包含 cli_demo_quantization.py,支持 INT8/INT4 量化推理,可在低显存环境下运行 5B 参数模型,降低了部署门槛。
优势方面:
开源生态完善:完整的推理代码、微调脚本、工具链均有提供,代码质量较高(Python 3.10+ 适配,ruff 代码规范,pre-commit 检查)。
多版本覆盖:同时支持文本生成视频(T2V)和图像生成视频(I2V),覆盖主流使用场景。
社区活跃:由清华大学 THUDM 团队维护,持续更新,有大量中文文档支持(README_zh.md、README_ja.md)。
局限方面:
部署门槛高:没有提供 Docker 支持,也没有 docker-compose 文件,用户需要手动配置 CUDA 环境、下载模型权重,对新手不友好。
生成时长有限:受限于 VAE 压缩比和计算资源,单次生成的视频长度通常在 6 秒左右,长视频需要分段生成后拼接。
内容安全:作为一个强大的生成式 AI 工具,存在被滥用于深度伪造(Deepfake)的潜在风险。项目代码本身不含过滤机制,需要使用者自行把控。
推理速度:在消费级 GPU 上生成一段 6 秒视频仍需数分钟,与 Sora 等专有方案相比效率差距明显。
CogVideo 的出现填补了开源视频生成领域的空白。在它之前,Runway、Pika、OpenAI 等厂商的视频生成能力均为闭源,学术研究者和独立开发者难以参与。清华团队的这项工作让任何有 GPU 资源的人都能本地部署视频生成模型,极大推动了社区的创新。
从 GitHub Stars 增长曲线来看,CogVideo 在 2024 年经历了爆发式增长,成为当年最受关注的开源 AI 项目之一。这反映出视频生成能力正从大厂专属向人人可用快速迁移的大趋势。
未来,随着算力成本持续下降、模型压缩技术不断成熟,视频生成的本地化部署将变得更加普及。CogVideoX 的架构为这一趋势提供了一个高质量的开源起点,其设计思路和工程实践也为后续研究者提供了重要参考。