awesome-vla-for-ad
自动驾驶 VLA 领域最全 Awesome List,收录 279 个模型/数据集条目,275 篇
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
自动驾驶 VLA 领域最全 Awesome List,收录 279 个模型/数据集条目,275 篇
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:一个自动驾驶系统,不再依赖工程师手写的一层层「感知→决策→控制」规则,而是像人类一样,用眼睛看世界、用语言思考、用身体执行动作——这就是 VLA(Vision-Language-Action)模型正在实现的事情。而 awesome-vla-for-ad 正是这个前沿领域最全面的知识地图。
传统自动驾驶系统就像一个由大量「如果-那么」规则组成的复杂决策树:摄像头看到红灯就停车、毫米波雷达检测到前方物体就减速。这些规则在简单场景下运行良好,但在施工绕行、夜间逆光、长尾障碍物等 corner case 面前往往束手无策。更关键的是,多个模块串联的结构会将上游的感知误差逐级放大,最终导致规划失误。
VLA 模型的崛起标志着端到端学习范式的回归。与传统模块化架构不同,VLA 将感知、推理和规划整合到单一模型中:输入是多视角相机图像(可能还有文字指令),输出直接是车辆控制信号(方向盘角度、油门刹车)。这种「所见即所得」的范式借鉴了人类驾驶员的决策模式——不经过中间语言描述,直接从视觉感知映射到动作输出。
该项目(worldbench/awesome-vla-for-ad)由 worldbench 团队维护,对应论 arXiv:2512.16760,同步提供 HuggingFace 排行榜和 项目主页。截至分析时,项目已收录约 279 个模型/数据集条目,涵盖 275 篇 arXiv 论文和 102 个 GitHub 仓库链接。
该项目以 Markdown 表格形式系统梳理了自动驾驶 VLA 领域的全貌,按主题分为五个章节:
第一章:视觉-动作模型(Vision-Action Models)
早期端到端自动驾驶的探索阶段,主要收录不依赖语言输入、直接从图像预测动作的模型。代表工作包括:
这一阶段的共同特点是不使用语言模态,模型能力上限受限于纯视觉表征的丰富程度。
第二章:视觉-语言-动作模型(Vision-Language-Action Models)
这是仓库的核心主体,按技术路线进一步细分为两大范式:
End-to-End VLA:将 VLM(大语言模型视觉版)与动作预测头直接串联,感知、推理、规划在同一个网络中完成。代表模型有 DriveMLM(首个将 MLLM 引入自动驾驶的项目)、DriveGPT4(用生成式方法统一建模)和 DriveVLM(清华团队工作,融合思维链推理)。
Dual-System VLA:将慢速推理(VLM 负责场景理解和决策分析)与快速执行(专用运动规划器负责实时控制)分开。DriveLM 系列是其典型代表,将自动驾驶建模为图视觉问答(Graph VQA)任务,通过结构化推理提升安全性。
此外还有新兴的 Multimodal LLM Planner 路线,如 RAG-Driver(检索增强)、VLP(视觉语言规划器)等。
第三章:数据集与基准(Benchmarks)
涵盖自动驾驶 VLA 研究的核心数据资源,包括:
数据集部分还区分了纯视觉-动作数据集和视觉-语言-动作数据集,后者是训练 VLA 模型的关键。
第四章:应用(Applications)
收录 VLA 模型在真实自动驾驶系统中的落地案例,包括实车部署、仿真验证、特定场景(高速公路、园区、港口等)的应用研究。
第五章:其他资源(Other Resources)
延伸阅读材料、相关 Awesome List 索引、工具库推荐等补充内容。
从时间线来看,该仓库梳理了一条清晰的 VLA 技术进化路径:
2019-2021 萌芽期:端到端模仿学习主导,模型从专家驾驶数据中学习直接动作映射。代表工作 LBC、NEAT、Roach、WoR 等奠定了「视觉→动作」的基础范式。
2022-2023 突破期:大语言模型的崛起为自动驾驶带来了语言推理能力。DriveMLM 率先将 MLLM 引入规划状态对齐;ThinkTwice 提出了两阶段慢思考架构;DriveVLM 则将思维链(Chain-of-Thought)引入驾驶决策。
2024-2025 爆发期:VLA 进入百家争鸣阶段。DriveGPT4 统一了动作生成与文本生成目标;Elaine 引入长视频推理;SurrealDriver 探索认知导向的驾驶行为。这一时期也是数据驱动闭环训练大规模应用的起点。
2026 量产期:以 OpenDriveVLA(AAAI 2026)为代表,VLA 开始向可量产落地的端到端系统演进,兼顾推理效率与安全性。
对 AI 爱好者:该项目是理解自动驾驶 AI 演进的极佳入口。从「规则系统」到「端到端学习」再到「VLA 多模态融合」,每一步演进都有对应的论文和代码仓库可追溯。用类比来说,这就像是一张自动驾驶 AI 的「进化图谱」,让非专业读者也能把握技术发展脉络。
对 AI 开发者:该仓库的论文覆盖广度(275+ 篇)和关联仓库数量(102+ 个 GitHub 链接)使其成为快速调研的最佳起点。无论是想了解特定 VLA 架构的实现细节、寻找预训练数据集,还是对比闭环仿真基准的表现数据,都能在此找到入口。HuggingFace 排行榜还提供了统一的性能对比视图。
行业趋势信号:从收录的论文时间分布来看,2024-2025 年是 VLA 研究的高速增长期,对应着多模态大模型(GPT-4V、Gemini、LLaVA 等)能力的快速提升。可以预见,VLA 将成为 L4/L5 自动驾驶系统的核心技术路线之一。
上手门槛极低:由于是静态 Markdown 文档,无需安装任何依赖,直接阅读即可。建议从 README 开头的背景介绍入手,理解 VA 和 VLA 的本质区别后,再按需深入各章节。
局限性需注意:
如需获取具体模型的代码实现,应跳转至各论文关联的 GitHub 仓库。该项目本质上是「论文索引」,而非「代码框架」。
结论:awesome-vla-for-ad 是目前自动驾驶 VLA 领域内容最丰富、结构最清晰的Awesome List 之一。它不仅是一份论文清单,更是一部用 Markdown 书写的领域技术简史——从模仿学习到语言推理,再到端到端多模态融合,每个阶段都有迹可循。对于想快速了解该领域的 AI 爱好者或希望系统性调研的开发者,它都是不可多得的导航工具。
对应论文:Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future (arXiv:2512.16760)