LTX-Video
全球首个 DiT 架构开源视频生成模型,支持文本/图像生成视频、多控制模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
全球首个 DiT 架构开源视频生成模型,支持文本/图像生成视频、多控制模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,只要给 AI 一段文字描述,它就能生成一段惟妙惟肖的视频?以前这种需求往往需要昂贵的云计算资源和复杂的部署流程,普通开发者只能望而却步。Lightricks 开源的 LTX-Video 项目,正在彻底改变这一现状——它把工业级的视频生成能力,以开源代码库的形式交到了每一个开发者手中,让本地生成高质量 AI 视频不再是梦。
Lightricks 是一家总部位于以色列的视觉创意科技公司,旗下拥有 Facetune、Photoleap 等多款爆款移动应用,在图像和视频处理领域积累了深厚的技术底蕴。2025年1月,他们正式发布了 LTX-Video,这是全球首个基于 DiT(Diffusion Transformer) 架构的视频生成模型。DiT 架构最早由伯克利等机构在图像领域验证,而 LTX-Video 将其成功拓展到时序维度,实现了在单一模型中统一文本生成视频、图像生成视频、视频扩展等多项核心能力。
项目的技术团队来自业界顶尖研究背景,论文《LTX-Video: Latent Transformer for Video Generation》详细阐述了架构设计。与传统的 U-Net 加扩散模型不同,LTX-Video 采用了 Rectified Flow(整流流) 调度器和 Transformer 3D 主干网络,配合因果三维变分自编码器(Causal Video Autoencoder)对视频进行时空压缩,能够在极低的计算成本下生成高质量视频内容。
LTX-Video 的技术栈可以分为三个核心层次来理解,每一层都有明确的工程目标:
第一层:因果视频自编码器(Causal Video Autoencoder)。 这是整个管线的压缩引擎。它将原始视频压缩到低维潜空间,大幅降低后续 Transformer 的计算负担。代码位于 ltx_video/models/autoencoders/causal_video_autoencoder.py,负责时空维度的联合压缩,兼顾时间一致性和空间细节。
第二层:DiT Transformer(Transformer3DModel)。 主干网络,负责在潜空间中进行文本和视频的联合生成。ltx_video/models/transformers/transformer3d.py 实现了 3D 空间(时空维度)上的 Transformer 注意力机制,支持文本编码器(T5)和可选的图像条件输入。这是模型参数量的主要来源——13B 参数版本(LTXV-13B)需要 24GB 以上显存。
第三层:Rectified Flow 调度器 + 管线编排(LTXVideoPipeline)。 ltx_video/schedulers/rf.py 实现了整流流调度器,而 ltx_video/pipelines/pipeline_ltx_video.py 则是整个推理管线的粘合剂,整合 VAE、Transformer、Text Encoder,并提供单尺度(LTXVideoPipeline)和多尺度(LTXMultiScalePipeline)两种推理模式,后者支持多步超分和视频延长。推理入口 inference.py 提供了命令行工具,通过 HfArgumentParser 解析 InferenceConfig,支持自定义分辨率、帧数、CFG 强度、步数等参数。
LTX-Video 不仅仅是一个"文字生视频"的工具,它的野心是覆盖视频生成的全链路能力:
文本生成视频(T2V):输入自然语言描述,生成对应视频片段。支持多种长宽比和分辨率,13B 蒸馏模型(distilled)可在 H100 GPU 上用 8 步推理在 10 秒内生成 HD 视频。
图像生成视频(I2V):以一张图片作为起始帧,让 AI 延续运动效果。这对于产品展示、动态 logo、运动插画等场景非常实用。
视频扩展(Video Extension):支持前向和后向延长,可以在已有视频的两端继续生成内容,适合做视频补帧或延长叙事。
视频转视频(V2V):对现有视频进行风格或内容的二次创作,保持主体一致性同时改变场景氛围。
多关键帧控制:支持多个关键帧约束,精准控制视频的起止状态和中间过程。
控制模型(IC-LoRA):2025年7月发布的 Depth、Pose、Canny 三种控制模型,允许用户通过结构图、姿态图、边缘图来控制视频生成的几何形态。
2025年10月,团队宣布了下一代产品 LTX-2,进一步支持音视频同步生成和原生 4K@50fps 输出,并已集成进 ComfyUI 核心。
图1:图像生成视频示例(输入静态图片,AI 延续运动轨迹)
图2:人物动作生成示例(保留角色特征同时实现自然运动)
图3:场景动画生成(静态风景图片的动态化处理效果)
图4:物体运动生成(精细的物理运动轨迹模拟)
图5:创意场景合成(抽象艺术风格的动态化)
图6:多物体交互场景(复杂场景下的一致性保持)
说实话,LTX-Video 的本地部署对普通用户并不友好——无 Dockerfile,无一键脚本,完全需要手动配置 Python 环境、下载数十 GB 的模型权重、安装 PyTorch 及 CUDA 环境。
不过项目的依赖管理相对规范,pyproject.toml 清晰列出了所有依赖:PyTorch >= 2.1.0、Diffusers >= 0.28.2、Transformers >= 4.47.2、HuggingFace Hub 等主流库。有 Python >= 3.10 基础的开发者,配合 pip install 可以在 30 分钟内完成环境搭建(不含模型下载时间)。
硬件门槛是最大的挑战:13B 参数模型(LTXV-13B)至少需要 24GB 显存(推荐 H100/A100),2B 蒸馏模型最低 8GB 显存可用。对于没有高端 GPU 的开发者,官方提供的 LTX Studio 在线 Demo 是更实际的选择——直接浏览器访问,无需任何本地配置。
此外,项目已深度集成到两个主流生态系统:Diffusers(HuggingFace 的官方扩散模型库)和 ComfyUI(通过 ComfyUI-LTXVideo 节点),已有工作流 JSON 文件可以直接导入使用。对于已在使用 ComfyUI 的 AI 创作者,这是最平滑的接入路径。
LTX-Video 的优势在于其架构的简洁性和扩展性——DiT 架构天然支持 Scaling,蒸馏版本(distilled)在速度上已经接近实时,非常适合需要快速迭代的工作流。但它也有明显的局限:
LTX-Video 的出现标志着视频生成领域正式进入 DiT 时代。相比传统的 GAN 和早期扩散模型,DiT 架构具有更好的 Scaling 特性——参数量增加带来的收益更加线性可预测。Lightricks 率先将这一架构开源,为整个社区提供了一个高质量的基座模型。
从趋势来看,2025年下半年视频生成领域的竞争焦点正在从"能不能生成"转向"生成得多快、多长、多可控"。LTX-2 的蒸馏策略(8步推理生成 HD 视频)证明了 DiT 架构在推理效率上的巨大潜力,这一方向将成为 2026 年各家的主战场。
对于开发者而言,LTX-Video 代码库结构清晰,模块化程度高,是学习现代视频生成系统设计理念的绝佳参考。对于创作者,官方在线 Demo 和 ComfyUI 集成已经足够支撑大部分创作需求,无需深入代码层面。
| 场景 | 推荐方案 | 难度 |
|---|---|---|
| 零配置体验 | LTX Studio 在线 Demo | ★☆☆☆☆ |
| ComfyUI 用户 | ComfyUI-LTXVideo 节点 | ★★☆☆☆ |
| Diffusers 用户 | pip install ltx-video + HF pipeline | ★★★☆☆ |
| 本地 CLI | git clone + pip install + 模型下载 | ★★★★☆ |
| 深度定制 | 源码研究 + 训练(需 LTX-Video-Trainer) | ★★★★★ |