cosmos
开源世界模型平台,让机器理解物理世界、预测未来情景,赋能机器人与自动驾驶
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源世界模型平台,让机器理解物理世界、预测未来情景,赋能机器人与自动驾驶
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
![]()
图1:NVIDIA Cosmos 官方 Logo
凌晨三点的自动驾驶测试场里,一辆工程车正在雨夜中巡航。它的感知系统不只看见了前方路况——它同时在内心「模拟」着接下来三秒内路面积水的反光轨迹、旁边车道大货车的制动距离,以及自己继续加速时可能遭遇的追尾风险。这种「看见+预判」的组合能力,正是 Physical AI(物理人工智能)想要赋予机器的核心能力。而 NVIDIA Cosmos,正是这个领域目前最引人注目的开源平台。
2024 年 11 月,NVIDIA 正式开源 Cosmos;2026 年 5 月 31 日,Cosmos 3 重磅发布,迅速吸引了超过 8000 颗 GitHub 星。这个平台不仅仅是几个模型权重——它是一套完整的世界模型工具链,涵盖模型、数据集、推理引擎和评估工具,试图成为物理 AI 领域的基础设施级开源项目。
传统 AI 模型擅长处理静态信息——一张图片是什么,一个句子什么意思。但物理世界是动态的、因果的:物体的运动遵循物理定律,多个物体之间会相互作用,时间的前后顺序直接影响意义。世界模型(World Model)正是要跨越这道鸿沟,让 AI 能够像人类一样,在脑海中模拟物理过程、预测未来状态。
NVIDIA 将 Cosmos 定位为「世界基础模型平台」,目标是为三类场景提供支持:机器人(工厂机械臂、家庭服务机器人)、自动驾驶(乘用车、商用车)、智能基础设施(城市摄像头、工业监控系统)。这些场景有一个共同点:AI 必须理解三维空间、时间演进和物理因果,不能只靠模式识别。
Cosmos 3 是当前版本的名称,其技术架构值得深入了解。它基于一种叫做**混合 Transformer(Mixture-of-Transformers,MoT)**的统一架构,同时支持两种运行模式:
Reasoner(推理模式) 负责理解和分析。输入文本和图像后,模型通过自回归(AR)Transformer 处理因果注意力,输出对物理世界的理解和规划建议。这类似于一个强大的视觉-语言模型,能够回答「这个场景里发生了什么」「机械臂下一步应该如何动作」这类问题。
Generator(生成模式) 负责创建和模拟。输入文本、图像、视频、音频甚至动作序列,模型通过扩散 Transformer(DM)进行去噪处理,输出连贯的多模态内容——可以是逼真的视频、匹配的音频,或者符合物理规律的动作序列。这类似于一个世界模拟器,能够「想象」未来可能发生的情景。
两种模式共享同一个 Transformer 架构和一套统一的**多维旋转位置编码(mRoPE)**系统,该编码能够同时表示空间维度和时间维度的信息,使得模型在处理图像、视频、音频和动作时保持一致的表示能力。

图2:Cosmos 3 模型架构图(来源:NVIDIA 官方 GitHub 仓库)
Cosmos 项目的真正价值在于其完整生态。NVIDIA 开源了多个相互关联的仓库:
Cookbook 是理解 Cosmos 的最佳入口。每个 cookbook 都是一个 Jupyter Notebook,演示如何通过不同后端(Diffusers、Transformers、vLLM、Cosmos Framework)运行模型。以 Generator with Diffusers 为例,用户只需几条命令就能加载 Cosmos3OmniPipeline,输入一段文字描述,获得对应的视频输出。这种设计大大降低了研究人员的上手门槛。
使用 Cosmos 不可避免地面临硬件门槛。Cosmos 3 包含从 7B 到 40B+ 参数的多个模型规模,7B 模型在 FP16 精度下最低需要约 24GB 显存,大型模型则需要 80GB 甚至更多。除了显存,还需要:
uv(Astral 出品的 Python 包管理工具)来处理依赖安装流程大约包含以下步骤:创建 uv 虚拟环境 → 安装 PyTorch 和 CUDA 依赖 → 克隆 Cosmos Framework → 从 HuggingFace 下载模型权重 → 配置 HF 授权。整个过程在没有缓存的情况下可能需要 2-4 小时。
值得注意的是,Cosmos 没有提供 Docker 容器化方案,也没有 Web 界面。这决定了它当前的定位是面向研究人员和工程师的专业工具包,而非面向终端用户的开箱即用产品。
NVIDIA 官方文档坦诚列出了 Cosmos 3 的多项局限:
官方明确指出,对于需要物理精确仿真、安全关键控制或复杂多智能体行为的应用,Cosmos 目前还不足以直接支撑,需要额外的验证、护栏和安全分析。
Cosmos 的发布对行业有三重意义。首先,降低了世界模型研究的门槛——在此之前,高质量的世界模型基本只存在于大厂内部。其次,推动了数据飞轮的形成:NVIDIA 同步开源了数据整理工具 Cosmos Curator,研究者可以用自己的数据微调模型,形成数据-模型-数据的正循环。第三,建立了多模态统一标准:Cosmos 的 omnimodal 设计理念——将图像、视频、音频、动作统一到一个框架中——可能成为未来 Physical AI 研究的参考范式。
从 GitHub 增长曲线来看,Cosmos 在发布后数月内迅速突破 8000 星,远超同期大多数开源 AI 项目。这说明开发者社区对世界模型和物理 AI 有着强烈的需求,而开源是满足这一需求的最有效路径。