Tora
阿里CVPR 2025视频生成模型,通过轨迹提取器+运动融合器实现扩散视频的精确轨迹控制
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里CVPR 2025视频生成模型,通过轨迹提取器+运动融合器实现扩散视频的精确轨迹控制
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象你正在制作一部动画短片,你需要角色从画面左侧走向右侧,同时保持面部表情和光照一致——这是电影工业的标准需求,但在 AI 视频生成领域,长期以来是一个难以攻克的难题。早期的扩散视频模型虽然能生成高质量画面,但对运动轨迹的控制能力极为有限,生成结果往往像是"随机舞蹈"。阿里巴巴研究团队推出的 Tora(Trajectory-oriented Diffusion Transformer)正是为解决这一痛点而生。
2024 年 7 月,Tora 的论文和项目主页首次亮相;2025 年 6 月,Tora 被计算机视觉顶级会议 CVPR 2025 正式录用,引发学界和工业界的广泛关注。目前该系列已迭代至 Tora3(ACM MM 2026),将控制能力扩展到轨迹引导的音视频联合生成。
Tora 的技术核心是轨迹提取器(Trajectory Extractor, TE)、**时空扩散Transformer(Spatial-Temporal DiT)和运动引导融合器(Motion-guidance Fuser, MGF)**的协同工作。
TE 模块将用户绘制的任意轨迹曲线编码为层级化的时空运动块(spacetime motion patches)。这个过程依赖一个 3D 视频压缩网络,将连续轨迹离散化为可被 Transformer 处理的 token 序列。TE 的设计允许接受任意起点、终点和中间控制点的轨迹,灵活度极高。
MGF 模块则是连接 TE 与 DiT 的桥梁。它将 TE 输出的运动块注入 DiT 的各层块中,通过交叉注意力机制让生成网络在每个去噪步骤中"感知"目标运动轨迹。这种注入式设计保证了运动信息在整个生成过程中的一致性,避免了运动在帧间断裂的问题。
时空 DiT 本身基于阿里巴巴此前参与的 CogVideoX 架构,采用文本、视觉和轨迹三重条件联合引导。模型原生支持文生视频(T2V)和图生视频(I2V)两种模式,架构本身具有良好的可扩展性。
Tora 代码仓库包含两条独立的技术路径,这种"双轨制"体现了工程上的深思熟虑:
SAT 版本(sat/ 目录)基于团队自研的 SwissArmyTransformer 框架,与 CogVideo 原生实现对齐,支持完整的训练和推理流程。依赖包括 PyTorch Lightning(分布式训练)、DeepSpeed(显存优化)和 Gradio(Web UI)。推理显存需求约 30 GiB(NVIDIA A100),训练则需要约 60 GiB。
Diffusers 版本(diffusers-version/ 目录)是阿里巴巴顺应开源社区主流偏好的工程选择。它完全基于 Hugging Face Diffusers 库重构,API 设计遵循 Diffusers 生态规范,对习惯于 Stable Diffusion 工作流的开发者极为友好。配合 accelerate、SageAttention(注意力加速)和模型编译优化,推理速度提升了约 52%,显存需求更降至约 5 GiB,这使得 Tora 在消费级 GPU(如 RTX 3090)上具备了可用的可能性。
对于非技术用户,Tora 提供了开箱即用的 Gradio Web UI,在 sat/app.py 中实现:
cd sat && python app.py --load ckpts/tora/t2v
启动后在浏览器中填写文本提示词和轨迹文件,即可生成符合运动轨迹的视频。轨迹文件的绘制基于 256×256 画布,用户可以用简单的文本格式指定路径点。
对于开发者,Diffusers 版本的典型调用:
from diffusers import ToraPipeline
pipe = ToraPipeline.from_pretrained("Alibaba-Research-Intelligence-Computing/Tora_T2V_diffusers")
video = pipe(prompt="A squirrel gathering nuts", trajectory_path="trajs/pause.txt").frames[0]
项目还特别推荐使用 GPT-4 优化文本提示词——研究团队在论文中明确指出,简单提示词会同时降低视觉质量和运动控制效果。
Tora 的训练分为两个阶段,与 CogVideo 的课程学习思路一脉相承:
两阶段策略是视频扩散模型的标准范式,Stage 2 的引入对于降低推理成本至关重要。代码仓库中提供了完整的训练脚本和配置(train_video.py、train_dense.yaml、train_sparse.yaml),数据集格式参考 CogVideo 规范。
Tora 的影响力已溢出纯学术范畴。GitHub 用户 @kijai 为 Tora 贡献了 ComfyUI 插件(ComfyUI-CogVideoXWrapper),这意味着用户可以在 ComfyUI 的图形化工作流中无缝使用 Tora 进行视频生成。ModelScope 和 HuggingFace 上均有社区托管的在线 Demo,学术研究者可以在不配置本地环境的情况下体验模型能力。
阿里巴巴研究团队在 Tora 基础上持续迭代:Tora2(ACM MM 2025)增强了多实体外观和运动定制能力;Tora3(ACM MM 2026)进一步将控制扩展到音频维度——用物体轨迹同时引导视频画面和声音生成,提升物理一致性、视听同步和整体生成质量。
Tora 并非没有局限。首先,完整版 Tora 模型权重因商业计划暂未开源,当前开源版本基于 CogVideoX-5B 架构。其次,30 GiB 的推理显存需求(SAT 版本)对大多数个人研究者而言仍是较高门槛,尽管 Diffusers 版本已大幅优化。最后,轨迹控制本身要求用户具备一定的控制点设计能力。此外,README 中明确要求遵守 CogVideoX License,部分模型权重下载需要单独授权,使用时需注意合规。
Tora 的价值在于它首次将轨迹控制能力以工程化的方式引入 Diffusion Transformer 架构。不同于此前基于 ControlNet 的插件式控制方案,Tora 从架构层面将运动轨迹作为一等公民融入生成过程,路径规划更加优雅。从 CVPR 2025 到 ACM MM 2026 的快速迭代节奏来看,这条技术路线获得了顶会的持续认可。
对于关注 AI 视频生成进展的爱好者和开发者而言,Tora 是一个值得深入研究的标杆项目——它既展示了如何将扩散模型的可控生成能力推向新高度,也为视频生成从"玩具 Demo"走向"创作工具"提供了工程实践参考。