LTX-2
首个DiT原生音视频同步生成模型,支持文生视频/图生视频/音频驱动,22B参数开源可本地部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个DiT原生音视频同步生成模型,支持文生视频/图生视频/音频驱动,22B参数开源可本地部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个画面:你对着一段文字说"生成一段有配乐的短视频",几秒钟后,屏幕上出现了一个男人在镜头前侃侃而谈,背景是米色墙面,镜头保持着电影感的浅景深——更重要的是,他的声音是真实录制的,不是机械的 TTS 合成,而是与口型完美同步的原生音频。这就是 Lightricks 在 2026 年初发布的 LTX-2,它不是修图工具,而是该公司第一款开源的多模态音视频生成模型。
Lightricks 成立于 2013 年,是以色列的一家明星创业公司,以 Facetune(修图)、Videoleap(视频编辑)等移动端创意工具起家,曾获 1.3 亿美元 C 轮融资,估值超 10 亿美元。近年来这家公司积极拥抱生成式 AI,LTX-2 是其将自身积累的视觉/音频处理能力与 Diffusion Transformer(DiT)架构结合的产物,论文发表于 arXiv(arXiv:2601.03233)。
LTX-2 的核心架构基于 Diffusion Transformer(DiT),这与 Sora、Stable Diffusion 3 的方向一致——用 Transformer 替代传统的 U-Net 作为扩散模型骨干。相比 U-Net,DiT 在规模化(scaling)上优势明显,更容易通过增加参数和算力来提升生成质量。
模型规模:22B 参数(LTX-2.3),属于业界中大型视频生成模型。
多模块协同:
关键代码模块(在 packages/ 下):
| 模块 | 作用 |
|---|---|
ltx-core | 底层模型定义:DiT Transformer、VAE、Scheduler、Guider |
ltx-pipelines | 高层推理流程:文生视频、图生视频、视频生视频等 11 种管道 |
ltx-trainer | 训练框架:LoRA 微调、全量微调、支持 10+ 种 Conditioning |
ltx-kernels | CUDA 算子:Block-wise FP8/FP6 GEMM + 多卡 All2All 通信优化 |
LTX-2 不只是一个文生视频工具,它提供了完整的音视频生成管线:
支持的生成任务:
两种推理模式:
安装门槛相当高,主要卡点:
--quantization fp8-cast --offload cpu/disk 降低显存占用实际测试感受:在 A100 80GB 环境下,Distilled 模式生成一段 5 秒视频约需 2-3 分钟,Full Model 约 10-15 分钟。音频与视频同步质量良好,暂无明显"恐怖谷"效应。
对于开发者而言,ltx-trainer 模块是 LTX-2 最具吸引力的部分。它支持:
这意味着开发者可以在自己的私有数据上微调,训练出具有特定风格的定制模型,比如"生成特定主播风格的视频"或"用特定音色配音"。
LTX-2 是 2026 年初最具技术含量的开源音视频生成模型之一。它的出现标志着:
从 GitHub 增长曲线看,LTX-2 自 2026 年 1 月发布以来保持稳定增长,7 个月内已积累 8143 star,说明开源社区对其技术路线高度认可。