Awesome-LLM4AD
上海交大ReThinklab维护的LLM4AD知识库,聚合数百篇论文/数据集/代码,覆盖VLM/VL
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
上海交大ReThinklab维护的LLM4AD知识库,聚合数百篇论文/数据集/代码,覆盖VLM/VL
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你是一名自动驾驶算法工程师,正在研究如何在端到端自动驾驶中让视觉-语言模型(VLM)理解复杂的交通场景语义。你打开Google Scholar一顿猛搜,发现论文分散在arXiv、IEEE、顶级会议各处,还要手动整理作者、机构、数据集链接——光是收集文献就花了两天。这是2024年以前无数研究者的真实困境。
2023年11月,上海交通大学ReThinklab实验室发布了一个持续更新的Awesome列表项目——Awesome-LLM4AD(LLM for Autonomous Driving),试图用一份精心维护的GitHub README,将LLM在自动驾驶领域的前沿研究全部串联起来。短短一年半,收获1847颗星,成为该领域最具影响力的资源聚合仓库之一。

图1:LLM4AD概念全景图,展示了大型语言模型如何与自动驾驶感知-决策链路融合。
该项目由上海交通大学ReThinklab实验室(Thinklab-SJTU)主导维护,核心联系人是杨振捷(yangzjie@sjtu.edu.cn)和贾松松(jiaxiaosong@sjtu.edu.cn)。实验室同时发布了该领域的综述论文(arXiv:2311.01043),被引用次数持续增长。
LLM4AD的核心目标是构建一个统一的框架,涵盖三类技术路线:
这三个方向构成了从感知理解到动作执行的完整技术栈。
截至2026年中,该项目已收录数百篇论文,涵盖以下核心分类:
| 分类 | 说明 |
|---|---|
| Perception | 感知任务:目标检测、语义分割、场景理解 |
| Prediction | 轨迹预测:行人、车辆意图识别与轨迹预测 |
| Planning | 规划决策:路径规划、行为决策、运动控制 |
| Simulation | 仿真环境:世界模型、仿真器、数据集构建 |
| VLA/World Model | 视觉-语言-动作模型与世界模型前沿 |
| Evaluation | 基准评测:数据集、评估指标、排行榜 |
每篇论文的条目格式严格,包含:作者、机构、arXiv链接、代码仓库、数据集、发布时间、核心摘要、关键指标。读者无需跳转即可获取论文全貌。
除了论文,项目还收录了自动驾驶领域的主流数据集:
通过梳理项目中的论文脉络,可以清晰看到2024-2026年LLM4AD领域的三代技术演进:
以GPT4Drive、LLM-Driver为代表,让大语言模型直接输出驾驶决策(如「减速」「左转」)。优点是具备可解释的推理链,缺点是缺乏真实世界感知能力,容易产生幻觉。
以DriveLM、PromptDrive为代表,用视觉编码器提取图像特征,LLM进行场景理解和规划。关键创新在于将3D检测、轨迹预测等感知任务与语言推理对齐,形成多任务统一框架。
以SparseWorld、DriveWAM为代表,使用视频扩散Transformer直接建模「感知→决策」端到端链路。DriveWAM将预训练视频扩散模型改造为自回归视频-动作策略,保持视频生成架构用于动作生成,在NAVSIM达到SOTA。
(arXiv:2605.24354)提出稀疏世界模型概念:传统世界模型预测全场景,而SparseWorld只预测关键场景元素(道路边界、行人、车辆意图),通过Sparse Dreamer+时空联合注意力实现未来预测,nuScenes开环规划碰撞率仅0.05%。
(arXiv:2605.27038)针对VLM自动驾驶中常见的「空间幻觉」和「表征干扰」问题,提出任务引导表征净化框架TPS-Drive。通过代理中心tokenizer(Agent-Centric Tokenizer)+任务引导向量量化,将有限的codebook容量从静态背景重新分配给动态目标,在NAVSIM达到SOTA安全性能。
(arXiv:2605.24562)将行人意图预测重新定义为视觉问答任务,提供了大规模视频QA数据集,证明在PEDESTRIANQA上微调VLM可显著提升意图分类和轨迹预测准确率。
(arXiv:2605.28544)将预训练视频扩散Transformer改造为自回归视频-动作策略,引入了场景演化驾驶引导(frozen VLM生成语义意图)和选择性KV记忆(有限长时horizon rollout),在NAVSIM和PhysicalAI-Autonomous-Vehicles达到强规划性能,数据Scaling实验证实了Scaling潜力。
适合谁使用?
如何使用?
该项目本质上是Markdown格式的静态页面,无需安装任何依赖:
局限性
Awesome-LLM4AD的出现,标志着LLM4AD从「学术单点突破」走向「系统工程化整合」。项目所聚合的论文网络,展示了三个关键趋势:
对于想要进入自动驾驶AI领域的研究者和开发者,Awesome-LLM4AD是目前最全面的「地图」——它不教你造车,但它告诉你这条路上有哪些里程碑式的论文、哪些关键数据集值得使用,以及整个领域正往哪个方向演进。