Awesome-VLM-AD-ITS
VLM4AD领域最全论文索引库,IEEE T-IV期刊论文支撑,覆盖自动驾驶感知/规划/决策/端到端
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
VLM4AD领域最全论文索引库,IEEE T-IV期刊论文支撑,覆盖自动驾驶感知/规划/决策/端到端
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,当你坐在一辆自动驾驶汽车里,车辆不仅能「看见」前方的行人、红绿灯和道路标线,还能用自然语言向你解释它在做什么——「前方有一名行人正在过马路,我正在减速让行」。这种让车辆「开口说话」的能力,正是视觉-语言大模型(Vision-Language Model,VLM)在自动驾驶领域最激动人心的应用方向之一。
自动驾驶技术正从传统的感知-规划-控制模块化流水线,逐步向端到端一体化方向演进。在这一过程中,纯视觉感知模型虽然能在目标检测、车道线识别等任务上取得接近人类水平的表现,但在复杂场景理解、长尾问题处理和跨域推理方面仍然存在明显短板。2023年以来,随着GPT-4V、LLaVA等多模态大语言模型的兴起,研究者们开始探索将强大的语言理解能力注入自动驾驶系统,从而诞生了一个全新的研究分支——视觉-语言大模型在自动驾驶中的应用(VLM4AD)。
本项目(Awesome-VLM-AD-ITS)由**德国慕尼黑工业大学人工智能机器人研究所(TUM-AIR)团队维护,是该领域最系统、最全面的开放论文汇总。项目作者包括 Zhou Xingcheng、Liu Mingyu、Yurtsever Ekim 等学者,相关综述论文已于2024年5月被IEEE Transactions on Intelligent Vehicles(IEEE T-IV)**正式接收,这是自动驾驶领域顶级期刊之一,论文还拥有对应的arXiv预印本(arXiv:2310.14414),学术影响力可见一斑。
图1:VLM在自动驾驶与智能交通系统中的应用全景
项目将VLM在自动驾驶与智能交通系统中的应用划分为两大板块、七个细分方向:
感知与理解(Perception and Understanding): 这是VLM在自动驾驶中最早落地的方向。传统自动驾驶感知系统只能输出「这里有一个行人」这样的封闭标签,而VLM能够理解「一位老人正在使用助行器过马路,需要特别注意」这样丰富的语义信息。项目收录了15篇相关论文,涵盖交通场景描述、3D目标检测与跟踪、开集词汇识别等核心任务。例如 SimpleLLM4D 项目将视觉问答(VQA)引入自动驾驶,让模型能够回答「前方拥堵的原因是事故还是红绿灯」这类开放性问题。
导航与规划(Navigation and Planning): 该方向探索如何利用LLM的推理能力辅助路径规划。与传统基于规则或强化学习的规划器不同,VLM能够理解「这条路的施工信息来自导航APP的标注」等文本线索,进行更智能的决策。项目收录7篇相关论文,包括 VLP(Vision-Language Planning)等代表性工作。
决策与控制(Decision-Making and Control): 将语言条件引入车辆横向/纵向控制决策,使自动驾驶系统能够在人类自然语言指令(如「在前方路口左转并汇入主路」)的引导下完成操控动作。该方向同样收录7篇论文,研究如何弥合语言指令与低层控制信号之间的语义鸿沟。
端到端自动驾驶(End-to-End Autonomous Driving): 这是当前最前沿的研究热点,也是收录论文最多的方向之一(9篇)。代表性工作包括 DriveLM(商汤联合多机构提出),该系统将图神经网络与语言模型结合,建模驾驶场景中各要素之间的因果关系,实现了在 nuScenes 等主流数据集上的领先性能。
数据生成(Data Generation): 利用VLM生成高质量的自动驾驶训练数据,解决长尾场景数据稀缺问题。该方向有7篇论文,研究基于语言描述生成逼真驾驶场景、模拟罕见危险工况等应用。
ITS方向收录9篇论文,分为两个子方向:ITS感知与理解聚焦交通流量监控、异常事件检测;ITS管理系统则研究如何利用VLM辅助交通信号优化、路网调度等宏观决策。
项目还系统整理了自动驾驶领域常用的语言增强数据集,共收录33个数据集条目,涵盖三大类:
这些数据集为研究者训练和评估 VLM4AD 模型提供了标准化的数据基础。
从代码架构看,本项目虽然是一个纯 Markdown 知识库,但其在知识组织层面的设计颇具匠心:
使用方式极为简单: 只需 git clone 克隆仓库即可查阅全文,无需安装任何依赖。对于AI爱好者,这是了解VLM4AD领域全貌的最佳入门路径;对于开发者,可作为技术选型的文献调研工具,按图索骥找到感兴趣的论文深入阅读。
主要局限:
本项目反映了一个重要趋势:多模态大模型正在深刻重塑自动驾驶的技术栈。从2023年GPT-4V发布后的爆发式增长,到2024年IEEE T-IV综述论文的系统性总结,VLM4AD已经从单点创新进入系统性突破阶段。项目收录的论文从2019年(语言引导的自动驾驶导航)到2024年最新成果,覆盖了整整5年的研究演进,是观察这一趋势的理想窗口。
未来,随着多模态推理能力的持续提升,VLM在自动驾驶中的角色将从「辅助感知」逐步扩展到「核心决策」,真正实现「车辆会思考、能解释、懂常识」的终极愿景。本项目作为这一领域的百科全书,将持续跟踪这一激动人心的技术演进。