lyra
NVIDIA 开源生成式 3D 世界模型,单张图像即可生成可探索的 3D 场景与动态世界
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NVIDIA 开源生成式 3D 世界模型,单张图像即可生成可探索的 3D 场景与动态世界
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:给 AI 一张森林照片,它就能为你生成一片可以走进去、转身回顾、派机器人去巡逻的完整 3D 世界。这不是科幻——这是 Project Lyra 正在做的事。
2025 年 9 月,NVIDIA Toronto AI Lab 发布了 Lyra 1.0;2026 年 4 月,团队乘胜追击推出 Lyra 2.0,将单图生成 3D 世界的边界再次向前推进。这两个版本共同构成了目前开源领域最完整的生成式 3D 世界模型解决方案。

图1:Lyra-1 从单张输入图像生成可实时渲染的 3D 高斯泼溅(3DGS)场景(来源:GitHub 项目页面)
Lyra 1.0 的核心创新在于自蒸馏框架。传统 3D 重建依赖真实多视角数据,采集成本极高;Lyra 1.0 另辟蹊径,利用视频扩散模型(基于 NVIDIA Cosmos)强大的"想象力",先生成多视角视频 latent,再通过一个专门的 3DGS 解码器 将 2D 视频 latent 蒸馏为 3D 高斯泼溅表示。
具体而言:RGB 解码器输出作为监督信号,训练 3DGS 解码器,使后者能从纯合成数据中学会 3D 重建能力。推理时只需输入一张图片或一段视频,即可端到端生成可实时渲染的静态或动态 3D 场景。
如果说 Lyra 1.0 解决的是"能不能生成 3D",Lyra 2.0 要解决的则是"能走多远"。2.0 版本的核心挑战是长距离 3D 一致视频生成——即当相机绕场景移动较远时,生成画面依然保持空间一致性。
团队指出了两大瓶颈:
Lyra 2.0 的解法:逐帧维护 3D 几何,用几何信息路由检索相关历史帧、建立目标视角的密集对应,而外观合成完全依赖生成先验;同时通过自增强历史(Self-Augmented Histories)训练,让模型接触自身退化输出,教会它纠正漂移而非传播漂移。

图2:Lyra-2 从单张图像生成可探索 3D 世界的完整视频轨迹(来源:GitHub 项目页面)
从代码结构看,Lyra 采用了典型的"扩散先验 + 3D 表示"架构:视频扩散模型使用 NVIDIA Cosmos Predict1(CV8x8x8-720p tokenizer)提供强大的 2D 视频生成能力;3D 表示层采用 3D Gaussian Splatting(3DGS),高效、可微分、适合实时渲染;几何估计模块 Lyra-1 用 ViPE,Lyra-2 用 Depth Anything 3;加速组件包括 Flash Attention 2 和自定义 CUDA 扩展(Apex);训练框架使用 Accelerate + DeepSpeed 支持分布式训练。Lyra-1 和 Lyra-2 共享部分基础设施,但推理管线独立。
硬件要求极度苛刻:Lyra-1 推荐 A100 80GB,Lyra-2 推荐 H100 80GB,训练和推理均不支持消费级 GPU。
部署流程极度复杂:没有 Docker、没有 Web UI,全流程手动操作——创建 conda 环境(Python 3.10)、安装 PyTorch + CUDA 12.8、编译 Flash Attention 和 Apex CUDA 扩展、安装 MoGe/Transformer Engine/Mamba 等多个自定义依赖、手动下载 HuggingFace 权重(Cosmos Tokenizer + Lyra 模型)。Lyra-2 比 Lyra-1 更复杂,还需额外编译 ViPE 和 Depth Anything 3 的 CUDA 扩展。
好在有 Demo 样例:项目提供了预生成 latent 的 Demo,下载 HuggingFace 测试集后直接运行加速脚本即可看到效果,不需要从零跑扩散模型。
显存瓶颈:即使做推理也需要 80GB 显存,普通实验室难以承担。内容保真度:扩散模型的"脑补"能力在罕见场景、复杂几何结构下仍有幻觉问题。缺乏交互生成:当前仅支持预设轨迹或自定义相机轨迹,无法通过自然语言实时编辑场景内容。长期维护风险:依赖大量 NVIDIA 内部工具(Cosmos、MoGe),开源社区贡献和维护能力存疑。商业化限制:Lyra-1 模型权重使用单独许可证(不同于 Apache 2.0 代码许可证),需注意。
Project Lyra 的出现,标志着生成式 AI 从"生成图像/视频"迈向"生成可交互 3D 世界"的关键一步。类似 2019 年 GPT-2 之于大语言模型的意义,Lyra 在 3D 领域验证了"预训练扩散模型可蒸馏为 3D 表示"这一范式。

图3:Lyra 自蒸馏框架流程:从视频扩散模型到 3DGS 表示(来源:项目仓库)
未来,随着视频生成模型分辨率和时序一致性的持续提升,3D 世界模型将成为游戏开发、机器人仿真、自动驾驶数据生成的核心基础设施。NVIDIA 选择开源代码而非闭源,既是为了建立技术影响力,也是借助社区力量验证和迭代这一前沿方向。
总结:Lyra 是一款面向顶级研究机构的生成式 3D 世界模型,研究意义重大,工程化程度低,落地需要较强的 GPU 基础设施和 CUDA 编译能力。对普通开发者而言,Demo 体验价值大于实际部署价值。