awesome-embodied-vla-va-vln
具身智能领域最全论文索引,265篇VLA/VLN论文覆盖机器人看听说做全链路研究
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
具身智能领域最全论文索引,265篇VLA/VLN论文覆盖机器人看听说做全链路研究
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:家里来了一位新室友,它能听懂你说「把桌上的咖啡端到沙发前」,然后在陌生的客厅里自己规划路线、绕过障碍物、稳稳地把咖啡送到你面前——这不是科幻电影,而是具身智能(Embodied AI)正在努力实现的目标。awesome-embodied-vla-va-vln 就是这个领域最全面的学术资源索引。
长期以来,传统机器人只能执行预设程序——每一步动作都必须人类手把手编写。然而,真实世界的家庭、工厂、办公室环境千变万化,机器人不可能预先遍历所有场景。
随着大语言模型(LLM)和视觉语言模型(VLM)的突破,研究者开始探索一条新路:让机器人像人类一样,通过视觉感知环境、用语言理解指令、用行动完成目标。这就是 Vision-Language-Action(VLA)模型 的核心思想——不仅能「看见」世界,还能「理解」并「行动」。
具身智能因此成为 AI 领域近年来最炙手可热的研究方向之一,汇集了计算机视觉、自然语言处理、机器人学、强化学习等多个领域的技术融合。
该项目是一个精心整理的学术资源列表,截至目前收录了 265 篇 相关领域顶级论文,按照以下结构组织:
| 方向 | 说明 |
|---|---|
| Survey(综述) | 领域全景梳理,帮助快速建立认知框架 |
| VLA / WAM 模型 | 视觉-语言-动作多模态模型,按年份排列(2022-2026) |
| VLN 模型 | 视觉-语言导航,让机器人在环境中找到目标位置 |
| MLLM 具身学习 | 基于多模态大模型的机器人推理与规划 |
| Physics-aware Policy | 结合物理先验的策略学习 |
| Benchmark | 评测基准与仿真器资源 |
从时间线来看,2024-2026 年是 VLA 爆发期,大量论文集中在这三年发表,反映了具身智能从学术研究走向工程落地的关键转折。
VLA 模型的核心架构通常包含三个模块:
1. 视觉编码器(Visual Encoder) 接收机器人摄像头捕捉的图像帧,提取空间和语义特征。例如,看到一张桌子,视觉编码器会输出「桌子在左前方 1.2 米处,表面有咖啡杯」这样的结构化信息。
2. 语言理解器(Language Encoder) 处理人类的自然语言指令。「帮我把遥控器拿过来」这类模糊指令,需要语言模型理解意图(拿什么?给谁?在哪里拿?)。
3. 动作生成器(Action Head) 最关键的环节:将视觉和语言理解的结果融合,输出具体的机器人控制指令(关节角度、末端执行器位置、力控参数等)。这一模块也是 VLA 区别于普通多模态模型的核心差异。
类比理解:可以把 VLA 想象成给机器人装上了一个 AI 大脑,它既有眼睛(视觉),又有耳朵和嘴巴(语言),还能指挥四肢(动作)——真正的知行合一。
VLA / VLN 技术的落地场景非常广泛:
值得注意的是,该列表还收录了多个 Sim2Real(仿真到现实迁移) 相关工作,这是具身智能从实验室走向真实世界的关键技术路径——先在仿真器中大规模训练,再迁移到真实机器人。
评测基准是推动研究的关键基础设施。该项目收录了多个主流 benchmark:
这些 benchmark 设定了标准化的评测指标,让不同研究团队的工作可以公平对比。
尽管进展迅猛,VLA 领域仍面临诸多挑战:
数据瓶颈:真实世界的机器人操作数据极为稀缺,采集成本高昂,仿真数据与真实世界之间的 domain gap 仍是难题。
泛化能力:大多数 VLA 模型在训练分布内表现优异,但面对全新物体、未见过的新房间布局时,性能会显著下降。
实时性要求:机器人控制需要低延迟响应,而大型多模态模型的推理速度仍是瓶颈。
物理交互:精确的力量控制、柔性物体操作(如抓取毛巾、叠衣服)仍是 VLA 的弱项。
安全问题:在家用场景中,机器人的安全交互至关重要,错误动作可能导致物品损坏甚至人员受伤。
awesome-embodied-vla-va-vln 的价值在于:为研究者和工程师提供了一站式知识入口。
从发展趋势来看,2026 年的 VLA 研究呈现出几个明显方向:
该项目持续更新,是跟踪该领域最新进展的优质资源。