LLaDA
首个从零训练的8B大语言扩散模型,用掩码扩散替代自回归,在基准测试中比肩LLaMA3 8B
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个从零训练的8B大语言扩散模型,用掩码扩散替代自回归,在基准测试中比肩LLaMA3 8B
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个能像画家一样"从模糊到清晰"生成文字的AI——它不像传统模型那样一个字一个字地往外蹦,而是像魔法擦除布一样,把遮住的文字一点一点还原出来。这就是 LLaDA(Large Language Diffusion with Masking)带给我们的震撼。
2025年2月,来自 ML-GSAI 的研究团队发布了 LLaDA,这是全球首个从零训练的 8B 规模大语言扩散模型。在 benchmarks 评测中,LLaDA-8B 的表现已经可以与 LLaMA3 8B 相媲美——要知道,LLaMA3 可是整个开源社区公认的顶级自回归语言模型。LLaDA 用扩散概率建模(diffusion)替代了传统自回归(autoregressive)建模,证明了:AI 理解语言的能力,并不一定要依赖"一个字接一个字"的生成方式。
主流大语言模型(如 GPT、LLaMA)几乎无一例外地采用自回归(Autoregressive)建模:从左到右,逐词预测下一个token。这条路线已经走得非常成功,但也有人认为它存在瓶颈——无法并行、推理速度受限。
LLaDA 换了一条路。它采用**掩码扩散(Masked Diffusion)**框架:训练时,随机遮住句子中的某些词,让模型学会预测被遮住的内容;生成时,从全部是 MASK token 的状态开始,通过多步去噪,逐步还原出完整的文本。
这种方法的数学形式上,训练目标是负对数似然的上界,这使得 LLaDA 天然具有Fisher 一致性——当模型和数据规模足够大时,模型的最优解就是真实分布。这与自回归模型的理论性质一致,从而在规模扩展上不存在根本性障碍。
LLaDA 提供了两个版本:
两个版本均托管在 HuggingFace,可直接加载使用。
经过 SFT(监督微调)后,LLaDA 展现出令人惊喜的指令跟随和多轮对话能力。FAQ 中提到,LLaDA 能够处理数学推理(甚至可以先给出答案再生成中间步骤),这说明模型的推理过程是完整的,只是在生成顺序上与人类阅读习惯不同。
LLaDA 的发布只是一个开始。团队在2025年持续迭代:
图3:LLaDA 去噪重掩码过程可视化——非白色区域为模型正在生成的内容,白色区域为当前步骤的预测
LLaDA 底层使用标准 Transformer 架构(与 GPT 系列相同),但在概率建模层面做了根本性改变:
LLaDA 坦诚地承认了当前瓶颈:采样速度比自回归模型慢,主要因为:
但团队认为这是正常的"探索上限"阶段,正如图像扩散从 DDPM 到 Consistency Model 的4年加速历程一样,采样效率的优化值得期待。Block Diffusion 和 Consistency Distillation 已经是被看好的方向。
在 2.3T tokens 的完整预训练过程中,只遇到一次训练崩溃(loss=NaN,发生在 1.2T tokens 处),解决方案是从检查点恢复并降低学习率(4e-4 → 1e-4)。整体训练相当稳定。
transformers==4.38.2(必须精确版本)generate.py(条件生成)、get_log_likelihood.py(困惑度评估)chat.py(命令行多轮对话)、app.py(Gradio Web 界面)HuggingFace Spaces 提供了交互式 Demo,打开浏览器即可体验 LLaDA-8B-Instruct 的对话能力,无需任何安装。
pip install gradio
python app.py # 启动本地 Gradio 服务
浏览器访问 http://localhost:7860 即可使用图形界面。
python chat.py # 直接进入多轮对话交互
LLaDA 的意义不只是"又一个开源模型",而是一次范式层面的挑战。长期以来,业界几乎默认"要达到 LLM 级别能力,就必须用自回归"。LLaDA 用 8B 规模证明了:即使在语言建模这种离散序列生成任务上,扩散模型也可以做到与自回归相当的水平。
更值得关注的是它的快速迭代能力——从 Base 模型到 Instruct、V、1.5、MoE 只用了不到一年,且每次都在不同方向突破。这说明 LLaDA 背后的团队具备持续推进的工程能力。
未来,随着采样加速技术的成熟(比如 Consistency Distillation),扩散语言模型有望在保持高质量输出的同时,推理速度逐步逼近甚至超越自回归模型。这条路,才刚刚开始。