VAR
首个让 GPT 风格自回归模型超越扩散模型的视觉生成框架,荣获 NeurIPS 2024 Best
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个让 GPT 风格自回归模型超越扩散模型的视觉生成框架,荣获 NeurIPS 2024 Best
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
当 OpenAI 用 Sora 证明扩散模型在视频生成领域的强大时,一个来自字节跳动 FoundationVision 团队的工作却在另一个赛道上打破了人们的认知——2024 年,一篇名为《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》的论文,不仅拿下了 NeurIPS 2024 的 Best Paper 奖,更让自回归模型(GPT 背后的技术路线)首次在图像生成任务上全面超越了扩散模型。这个工作的代码实现,就是 VAR。
传统的自回归图像生成模型,比如 GPT-2 在图像领域的尝试,通常遵循一种叫「next-token prediction」的方式——像读二维码一样,按固定顺序逐个预测每个像素(或每个 token)。这种方式在自然语言处理中非常成功,但在图像上却遇到了瓶颈:256×256 的图像有 65536 个像素,按序列预测一遍的计算量极其庞大,而且生成的图像往往存在连贯性差、细节模糊的问题。
VAR 的核心创新在于提出了「next-scale prediction」(下一代尺度预测)机制。顾名思义,模型不再逐像素生成,而是从粗到细、逐层提升分辨率:先生成 1×1 的极简缩略图,然后逐步扩展到 2×2、3×3、4×4……最终达到 16×16 或更高。每一层的输出都是前一层的「放大增强版」,就像艺术家先画草稿、再填细节的创作过程。这一改变让计算复杂度从 O(N²) 降到了 O(N),同时也天然支持并行生成,大幅提升了效率。
VAR 的整体架构分为两个核心模块。首先是 VQ-VAE(Vector Quantized Variational Autoencoder),负责将图像压缩成离散的 token 序列。VAR 使用的 VQ-VAE 将 256×256 的图像压缩为 16×16 的 token 网格,词汇表大小为 4096。这意味着生成一张图像,模型只需要处理 256 个 token(16×16),而不是 65536 个像素,大幅降低了计算负担。
第二个模块是 GPT 风格的 Transformer 主干网络。模型接收 VQ-VAE 提取的 token 序列以及分类标签(class embedding),通过多层自注意力机制和 Adaptive Layer Normalization(AdaLN)进行条件生成。这里还有一个关键设计:classifier-free guidance(CFG) 技术,通过在有条件和无条件生成之间进行插值,大幅提升了生成质量。
代码结构非常清晰。models/var.py 实现了核心的 VAR 模型类,包含自回归生成逻辑、位置编码和 CFG 采样;models/vqvae.py 实现了 VQ-VAE 模块;models/quant.py 处理 token 量化逻辑;train.py 则是完整的分布式训练入口,支持 DDP 多卡训练。
VAR 最令人振奋的发现之一,是首次在视觉生成领域验证了类似 GPT 的 Scaling Laws——模型性能(用 FID 衡量,越低越好)与模型参数量、数据量和计算量之间存在幂律关系。实验表明,当参数量从 3.1 亿增长到 23 亿时,VAR 的 FID 从 3.55 稳步下降到 2.63;最好的模型 VAR-d30-re 在 ImageNet 256×256 基准上达到了 1.80 的 FID,超过了同期最好的扩散模型 DiT。
这个发现的意义远超论文本身——它意味着,只要继续扩大数据规模和模型规模,视觉生成的质量还有巨大的提升空间。这也直接催生了后续工作 Infinity(文本到图像)和 InfinityStar(文本到视频),并分别被 CVPR 2025 和 NeurIPS 2025 录用为 Oral。
作为一项研究工作,VAR 的定位是学术研究人员而非普通用户。它需要:
安装步骤相对标准:pip 安装 requirements.txt 中的依赖项,配置 ImageNet 数据集路径,运行 train.py 即可开始训练。代码支持 flash-attention 和 xformers 加速(如已安装)。虽然没有 Web UI,但提供了 demo_sample.ipynb Jupyter Notebook,可以在不训练的情况下加载预训练权重生成图像。
VAR 的获奖和后续发展,证明了自回归范式在视觉生成领域的巨大潜力。它的核心贡献——「next-scale prediction」机制——已经被多个后续工作沿用和扩展。但也需要客观看到:扩散模型在生成多样性和创意控制上仍有优势,VAR 主要在 ImageNet 类别条件生成上表现突出,在开放域文本到图像生成上的竞争力仍需通过后续的 Infinity 工作来证明。
对于 AI 研究者而言,VAR 是一个值得深入研究的标杆性工作——代码结构优雅、论文写作详尽、实验覆盖面广,特别是 Scaling Laws 的发现为视觉生成领域的「大模型」路线提供了重要参考。