le-wm
首个纯像素端到端稳定训练的世界模型JEPA,Yann LeCun团队出品,超参从6个减至1个,规划速度比扩散模型快48倍
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个纯像素端到端稳定训练的世界模型JEPA,Yann LeCun团队出品,超参从6个减至1个,规划速度比扩散模型快48倍
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:LeWorldModel 在多种 2D/3D 任务上的规划轨迹可视化
你盯着屏幕,看着一个机械臂在混乱的桌面环境中自如地推物体。它能「看见」下一步该去哪里,甚至在你改变场景后依然能做出正确判断。这不是强化学习模型反复试错的结果,而是一个从像素直接学会物理直觉的世界模型在背后规划路径。这就是 LeWorldModel(LeWM)做的事。
世界模型(World Model)是 AI 领域的一个核心概念:让机器像人类一样,建立对环境的内部表征,理解「推这个物体会倒」「那个角落机器人够不到」这类物理规律,从而在采取行动之前就能在脑海中预演结果。这类能力是自动驾驶、机器人控制等场景的关键。
现有的世界模型方案大多基于扩散模型或 GAN,依赖大型预训练模型(如 Stable Diffusion),推理速度慢(规划速度比基于基础模型的世界模型慢 48 倍),且训练过程脆弱——需要精心设计的多个损失项、指数移动平均、预训练的编码器等,才能避免表征崩溃(representation collapse)。
2023 年起,Meta 的 Yann LeCun 团队开始推广联合嵌入预测架构(JEPA,Joint Embedding Predictive Architecture),核心思路是:不再重建像素,而是预测在表征空间中的下一个状态。这种方法效率更高,但之前的方法依然依赖复杂的辅助手段才能稳定训练。
LeWM 是由 Meta AI 研究员 Lucas Maes、Quentin Le Lidec、Damien Scieur、Yann LeCun 及 Randall Balestriero 等人提出的全新 JEPA 方案,它解决了 JEPA 领域的核心难题——训练稳定性。
具体来说,LeWM 做到了两件事:
1. 极简的双损失项设计
LeWM 是首个能够从原始像素端到端稳定训练的 JEPA 方法,仅依赖两个损失项:
相比此前唯一可对比的端到端方法,LeWM 将可调超参数从 6 个减少到 1 个——只需设置一个正则化系数 weight 即可。这个改进大幅降低了训练难度,让研究者和工程师不再需要反复调参。
2. 小型化与高效推理
LeWM 的参数量约为 1500 万,可以在单块 GPU 上几小时内完成训练,这对于学术研究和中小团队来说门槛极低。更令人惊讶的是,它在规划速度上比基于扩散模型的基础模型世界模型快 48 倍——这意味着它不只是训练快,实际推理时也极具竞争力。
LeWM 的核心模块包括:
module.py 中使用了 AdaLN-zero(Adaptive Layer Normalization zero)调制技术,这是从 DiT(Diffusion Transformer)借鉴来的设计,能够根据输入动态调整归一化层的参数,增强模型的表达能力。
论文的另一个亮点是:LeWM 学到的潜空间(latent space)本身编码了有意义的物理量。研究团队通过探针(probing)实验发现,潜空间维度与物理属性(如速度、加速度)存在对应关系。这意味着模型不仅学会了预测动作后果,还隐式地理解了底层物理规律。
此外,团队还引入了 Surprise Evaluation(惊讶评估):当模型遇到物理上不合理的事件时,其预测误差会显著增大,这说明它能可靠地检测物理上不可能发生的事件。
LeWM 在多种 2D 和 3D 控制任务上进行了验证:
| 任务类型 | 环境名称 | 说明 |
|---|---|---|
| 2D | Push-T | 平面推物体 |
| 2D | Two-Room | 双房间导航 |
| 3D | Cube | 立方体操作 |
| 3D | Reacher | 机械臂到达目标 |
预训练 checkpoints 已发布在 Hugging Face Hub(quentinll/lewm-pusht 等仓库),方便直接加载使用。
适合谁:
安装流程:
uv venv --python=3.10
source .venv/bin/activate
uv pip install stable-worldmodel[train,env]
数据集需从 HuggingFace 下载并解压到 $STABLEWM_HOME 目录。训练通过 Hydra 配置管理,启动命令简洁:
python train.py data=pusht
需要 WandB 账户并配置 entity 和 project(见 config/train/lewm.yaml)。
硬件需求:单块 NVIDIA GPU(8GB+ VRAM),推荐 16GB 以上显存。
LeWM 的设计面向离线的、基于模型的预测控制(MPC),不直接支持在线强化学习(Online RL)的无缝接入。此外:
stable-pretraining 生态,虽然简化了代码,但增加了间接依赖LeWM 的出现标志着 JEPA 从「理论优雅但训练脆弱」走向「简洁实用」的关键一步。Yann LeCun 团队长期押注 JEPA 路线,LeWM 证明了在极简损失约束下,JEPA 可以稳定地从零学习世界表征,而且速度比扩散模型快 48 倍。
这一方向的商业价值在于:机器人控制、自动驾驶模拟、工业自动化等领域都需要高效的世界模型——能在毫秒级完成规划,同时消耗极低的算力。LeWM 的小型化设计(15M 参数)意味着它可以部署在边缘设备上,而非必须依赖云端大型 GPU 集群。
结合当前多模态大模型的发展趋势,世界模型与视觉语言模型的组合将是从感知走向行动的关键技术路径。LeWM 为这一方向提供了一个轻量级的、可复现的基准。