Sana
NVIDIA+MIT联合开发的高效高分辨率图像/视频生成模型,Linear DiT架构实现极速推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NVIDIA+MIT联合开发的高效高分辨率图像/视频生成模型,Linear DiT架构实现极速推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是一位创意设计师,需要为一款新品生成一组 4K 分辨率的产品海报图。传统的 Stable Diffusion 模型在你的 RTX 3090 显卡上跑了整整 3 分钟才生成一张图——对于需要快速迭代的工作流来说,这个等待时间几乎等于创意死亡。
这就是 NVIDIA 麻省理工联合实验室在 2025 年初推出 SANA 时想要解决的核心问题:如何在保持图像质量的前提下,把高分辨率图像生成的速度和资源消耗降下来? SANA 给出的答案是用线性扩散变换器(Linear DiT)替代传统的二次方注意力机制,用更聪明的架构换更低的算力需求。

图1:SANA 在 1024×1024 分辨率下的生成效果展示
自 2020 年 DDPM 论文发布以来,扩散模型(Diffusion Model)在图像生成领域一路碾压 GAN 和 VAE,Stable Diffusion、DALL-E 3、FLUX 等模型相继问世。然而,主流扩散模型依赖的二次方注意力机制(Quadratic Attention)——即每个像素都要和所有其他像素计算关联性——在高分辨率图像上造成了灾难性的算力膨胀:4096×4096 分辨率下的注意力计算量是 512×512 的整整 64 倍。
SANA 团队(主要来自 MIT 吕茶俊教授课题组和 NVIDIA)从 2024 年开始系统性地解决这个问题。他们的核心洞察是:扩散模型的去噪过程并不需要完整的全局注意力,而只需要捕捉局部特征和条件引导信号。因此,用**线性注意力(Linear Attention)**替代二次方注意力,能在不显著牺牲生成质量的前提下,把计算复杂度从 O(N²) 降到 O(N)。
如果把图像生成比作摄影:传统扩散模型就像一个摄影师,每次拍照都要把取景框内的每一个像素和所有其他像素进行对比参照,工作量随分辨率平方增长。而 SANA 更像一个经验丰富的摄影师——他凭借对光影、构图、色彩的专业直觉,不需要逐像素对比,就能快速捕捉到关键特征,生成高质量图像。线性注意力就是让模型学会了这种"专业直觉"。
SANA 的核心创新在于将 Linear DiT(线性扩散变换器)引入高分辨率图像合成。其架构包含以下关键组件:
SANA 不只是一个图像生成模型,而是一个持续演进的生成式 AI 工具箱:
| 模型 | 发布时间 | 核心能力 | 适用场景 |
|---|---|---|---|
| SANA-Image | 2025/01 | 1600M/1600M-X/800M 参数,Linear DiT,4-bit 量化版支持单卡 RTX 3090 | 高质量图像生成 |
| SANA-Sprint | 2025/03 | 单步/少步生成,H100 上 0.1s/张图,RTX 4090 上 0.3s/张图 | 实时应用 |
| SANA-1.5 | 2025/05 | 推理时缩放(Inference Scaling),仅需 4 张参考图微调 | 个性化生成 |
| SANA-Video | 2025/10 | 5 秒视频生成,支持 Text-to-Video 和 TextImage-to-Video,ICLR 2026 Oral | 视频内容创作 |
| SANA-WM | 2026/05 | 2.6B 世界模型,720p、1 分钟视频生成,支持 6-DoF 相机控制 | 具身 AI、仿真 |
| LongSANA | 2025/12 | 27FPS 实时分钟级视频生成 | 实时交互 |
| Sol-RL | 2026/04 | RL 后训练框架,支持 NVFP4 量化训练和 BF16 训练 | 模型强化学习 |
2026 年 2 月,SANA 正式接入 SGLang 高性能推理框架,提供 OpenAI 兼容 API,开发者无需修改代码即可将 SANA 集成到现有应用:
# 通过 SGLang 调用 SANA
from sglang import gen
response = gen("A cyberpunk city at night with neon lights", model="sana")

图2:SANA 全系列模型功能对比,覆盖从图像到视频、从实时到高质量的全场景
SANA 提供了开箱即用的 Gradio 界面。对于拥有高性能 GPU 的用户,通过 Dockerfile 可以一键启动完整的 Web UI:
# 使用 Docker 快速部署
docker build -t sana .
docker run --gpus all -p 7860:7860 sana
Dockerfile 基于 NVIDIA PyTorch 24.06 镜像,内置 CUDA 12.8 环境,免去了手动配置 conda 环境的繁琐步骤。对于没有 Docker 的用户,项目也提供了 environment_setup.sh 脚本,可自动创建 Python 3.11 conda 环境并安装所有依赖。
注意:部署需要至少 20GB 显存的标准版本,或 12GB 显存的 4-bit 量化版本。推荐使用 A100/H100 等数据中心级 GPU,RTX 3090/4090 为最低配置要求。磁盘空间需要 50GB 以上(模型权重 + 中间产物)。
对于生产环境,SANA 支持通过 SGLang 部署为 OpenAI 兼容的推理服务,适合需要多用户并发访问的企业场景。这一部署方式对运维能力要求更高,但能更好地利用 GPU 资源。
项目采用标准 Python 包结构,pip install -e . 即可完成本地安装。所有训练和推理脚本均已模块化,开发者可以在 scripts/ 和 inference_video_scripts/ 目录下找到各类场景的使用示例。
SANA 的代码库以 Python 为核心,深度依赖 PyTorch 生态:
代码组织清晰,核心 DiT 架构在 sana/ 目录,扩散相关逻辑在 diffusion/,推理 pipeline 在 app/,训练脚本在 train_scripts/。
值得注意的是,SANA 虽然在效率上表现出色,但与 FLUX.1、Stable Diffusion 3 等竞品相比,在图像-文本对齐(prompt following)方面仍有一定差距。Linear Attention 的简化假设在某些复杂构图场景下可能导致细节丢失。此外,项目大量依赖 MIT 内部数据集训练的 DC-AE 编码器,外部复现时可能面临权重可用性问题。
SANA 的出现代表了一个重要趋势:从"越大越好"到"足够好但要快"的范式转变。随着图像生成从实验走向生产环境,推理效率不再只是工程优化问题,而是直接决定应用场景能否成立。SANA 的 Linear DiT 架构、以及后续的 Sol-RL(RL 后训练 + NVFP4 量化),正在为边缘部署和实时应用铺路。
从学术影响力来看,SANA 已连续入选 ICLR 2025 Oral、ICML 2025、ICCV 2025 Highlight 和 ICLR 2026 Oral,是近年来扩散模型领域被顶会接收最多的项目之一。其代码维护活跃度极高,截至 2026 年 5 月仍有频繁更新(最后推送 2026-05-28),展现出 NVIDIA 和 MIT 团队持续投入的决心。