Cosmos-Drive-Dreams
NVIDIA开源的自动驾驶合成数据生成流水线,用世界基础模型批量生产逼真驾驶视频,扩增感知训练数据
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NVIDIA开源的自动驾驶合成数据生成流水线,用世界基础模型批量生产逼真驾驶视频,扩增感知训练数据
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
自动驾驶行业面临一个核心困境:训练一个能在各种极端场景下都安全行驶的感知模型,需要海量且高质量的标注数据。然而,真实道路数据的采集代价高昂,Corner Case(极端案例)覆盖率极低——比如暴雨天在十字路口遇到闯红灯的行人,这种场景在真实数据中凤毛麟角,却恰恰是事故高发的关键。
NVIDIA 多伦多 AI 实验室推出的 Cosmos-Drive-Dreams(下称 CDD)正是为解决这个数据缺口而来。这是一个基于世界基础模型(World Foundation Model)的合成数据生成(SDG)流水线,能以 HDMap(高精地图)、LiDAR 深度图或 3D 场景描述为条件,批量生产逼真的多视角驾驶视频。

CDD 在 Waymo 开放数据集和内部 RDS-HQ 数据集上的实验表明,使用合成数据扩增后,3D 车道线检测精度显著超越基线模型。 这意味着合成数据不只是"凑数",而是真的能帮助下游感知模型在实际道路上表现更好。
Cosmos-Drive-Dreams 诞生于 NVIDIA 的 Cosmos 世界基础模型计划。Cosmos-1 是 NVIDIA 在 2024 年底发布的一系列视频生成模型,涵盖从文本到视频(T2V)、图像到视频(I2V)等多个方向,参数规模从 7B 到 34B 不等。
CDD 的核心贡献在于:专门针对自动驾驶领域微调出一套 Cosmos-Drive 模型家族。这和通用视频生成不同——驾驶视频要求:
CDD 背后的论文《Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models》由 NVIDIA 多伦多 AI 实验室联合多位学者发表,在 2025 年 6 月公开后迅速获得关注。

图1:CDD 生成的多视角驾驶视频,条件分别为 HDMap、LiDAR 深度图和 World Scenario
CDD 开源了完整的模型权重,覆盖视频生成的各个环节:
| 模型 | 用途 | 规模 |
|---|---|---|
| Cosmos-7B-AV-Sample | 基础视频生成(单视角) | 7B |
| Cosmos-7B-Multiview-AV-Sample | 多视角同时生成 | 7B |
| Cosmos-Transfer1-7B-Sample-AV | 视频条件视频生成(核心模型) | 7B |
| Cosmos-7B-Single2Multiview-Sample-AV | 单转多视角上采样 | 7B |
| Cosmos-7B-LiDAR-GEN-Sample-AV | LiDAR 深度图条件生成 | 7B |
所有模型均可从 HuggingFace 下载:https://huggingface.co/collections/nvidia/cosmos-drive-dreams
CDD 发布的数据集包含两部分:
这正是 SDG 的精髓——用少量高质量人工标注,撬动大量合成数据扩增。
cosmos-drive-dreams-toolkits/ 目录提供了完整的数据预处理和渲染工具:
render_from_rds_hq.py:从 RDS-HQ 数据集渲染条件视频(支持 HDMap 和 World Scenario 两种渲染模式)convert_waymo_to_rds_hq.py:Waymo 3D 格式转 RDS-HQ 格式convert_lidar_pointcloud_to_rangemap.py:点云转距离图(LiDAR 深度条件)create_t5_embed.py:生成文本 embedding(T5 编码,用于文本条件)crop_traffic_lights.py:交通灯标注裁剪工具2025 年 10 月底,CDD 集成了 World Scenario Rendering 功能(源自 Cosmos-Transfer 2.5),提供基于 3D 几何的高保真控制信号。相比传统 HDMap 渲染,World Scenario 模式可以渲染出更丰富的车道线纹理和边界框图案,在复杂路口场景中优势明显。

图2:传统 HDMap 渲染 vs World Scenario 渲染对比
CDD 的 SDG 流水线分为四个阶段:
输入标注 (HDMap/LiDAR/World Scenario)
↓
[阶段1] Cosmos-Tokenize1: 视频 tokenizer(将条件视频压缩为离散 token)
↓
[阶段2] Cosmos-Transfer1: 视频到视频的条件生成(核心扩散模型,7B DiT 架构)
↓
[阶段3] Cosmos-Guardrail1: 安全过滤(Llama-Guard-3-8B 驱动的内容安全审核)
↓
[阶段4] 输出合成视频 + 标注对
技术细节:
transformer-engine[pytorch]==2.4.0,涉及 Triton 编译Cosmos-7B-Multiview 系列模型代码库中 cosmos-transfer-lidargen/ 子目录包含独立的 LiDAR 生成模块(Cosmos-Predict1),采用自定义的 tokenizer + diffusion 架构,可在 LiDAR 距离图条件下生成对应的视频帧。
CDD 的部署复杂度不低,主要体现在以下几个方面:
cosmos-transfer-lidargen/Dockerfile 基于 NVIDIA PyTorch 24.10 容器,适合云端推理合成数据最大的争议在于域差距(Domain Gap):合成视频再怎么逼真,和真实摄像头拍摄的图像仍有细微差异(噪声模式、光照物理、色调风格)。如果模型过度依赖合成数据,可能在真实场景中出现性能退化("sim-to-real gap")。NVIDIA 在论文中通过 3D 车道线检测任务验证了 CDD 生成数据的有效性,但其他感知任务(如目标检测、语义分割)的提升幅度尚需更多验证。
CDD 深度绑定 NVIDIA 生态:CUDA、cuDNN、NGC 容器、Transformer Engine、Triton……在 AMD GPU 或 CPU-only 环境下基本无法运行。对于非 NVIDIA 硬件的团队,这是一个较高的迁移成本。
7B 参数模型在生成 10 秒 1280×720@30fps 视频时,推理时间在 A100 80GB 上约为数十秒到数分钟不等(取决于批量大小),还无法做到实时生成。如果目标是数据扩增而非交互式可视化,这点尚可接受。
Cosmos-Drive-Dreams 代表了自动驾驶数据生产的范式转变:从"尽可能多地采集真实数据"到"用 AI 生成高质量合成数据补充真实数据"。随着世界基础模型能力的提升,合成数据的质量和多样性将持续逼近真实数据。
从 GitHub 数据来看,CDD 虽只有 500+ stars,但背后是 NVIDIA 完整的模型权重 + 数据集开源,在工业界的实际影响力远超这个数字。HuggingFace 上的模型集合已有数万次下载。
适用场景总结: