具身智能与大型语言模型研究综述库:Awesome Embodied Robotics and Agent
当机器人开始"思考":一个研究者的发现之旅
2023年夏天,一位名叫 Haonan Zhang 的研究者(GitHub @zchoi)在 GitHub 上创建了一个项目。彼时,ChatGPT 刚刚掀起大语言模型的热潮,而具身智能(Embodied AI)——让 AI "长出身体"、在真实或虚拟环境中执行任务——还是一个小众但暗流涌动的研究方向。他没有想到,两年后这个项目会积累超过 1800 颗星,成为该领域最受欢迎的开放资源库之一。
这是一个什么样的项目? 简单来说,它是一个持续更新的"论文超市",专门收录具身智能与大型语言模型(LLM/VLM)交叉领域的研究论文、benchmark、数据集和代码实现。作者将其命名为"Awesome"——这是 GitHub 社区对高质量资源合集的约定俗成的命名惯例,意味着"权威精选"。

图1:项目维护者 Haonan Zhang 的 GitHub 头像
为什么这个领域值得关注?
具身智能是什么? 打个生活化的比方:传统的大语言模型就像一个"纸上谈兵"的智者——它读过百万本书,能回答各种问题,但从来没有拿起过工具、走进过厨房、或者在陌生房间里找到自己的路。而具身智能的目标,是让 AI 不仅能"想",还要能"做"——操作机械臂抓取物体、在家庭环境中导航、按照自然语言指令完成复杂的多步骤任务。
这个方向的爆发,背后有三个关键技术的汇合:
- **视觉-语言模型(VLM)**的成熟,让机器人能"看懂"环境并理解人类指令
- **大语言模型(LLM)**的推理能力,让机器人能规划复杂任务序列
- 低成本机器人硬件(如 Unitree、Hover)降低了实验门槛
该项目的 README 中引用了一张趋势图,展示了近年来具身智能研究的爆发式增长曲线,尤其以 2023-2024 年最为显著。
项目内容全解析:14个研究子领域
这个列表的组织方式非常清晰,按照研究主题分为 14 个板块,每个板块下收录了数十到上百篇精选论文。以下是各板块的核心内容:
1. Survey(综述论文)
综述类论文是了解一个领域最快速的途径。项目收录了多篇高质量综述:
- A Survey on Efficient Vision-Language-Action Models(2025年10月,同济大学)——最新最全的 VLA 高效化综述
- A Survey on Vision-Language-Action Models for Embodied AI(2024年3月,港中文+华为诺亚方舟实验室)
- Large Multimodal Agents: A Survey(2024年2月)
- A Survey on Self-Evolution of Large Language Models(2024年1月,北大+阿里+南洋理工)
这些综述覆盖了从基础模型到自我进化能力的全栈研究,适合刚进入该领域的研究者建立全局认知。
2. Vision-Language-Action Model(VLA 模型)
这是最核心、最活跃的板块,收录了当前最前沿的视觉-语言-动作模型:
- π0 / π0.5(Physical Intelligence,2024-2025):当前最知名的开源机器人控制模型家族。π0 基于流匹配(Flow Matching)技术,能够控制机器人执行多样化操作任务,已在实际机器人上验证有效。
- OpenVLA:开源的视觉-语言-动作模型,代表了"人人都能用的 VLA"的趋势。
- D2E(ICLR 2026):在桌面数据上进行视觉-动作预训练,可迁移到具身 AI 场景,来自斯坦福、首尔国立大学和 MAUM.AI。
- ABot-M0(阿里巴巴 CV Lab):基于动作流形学习的 VLA 基础模型。
3. Self-Evolving Agents(自我进化智能体)
让 AI 智能体在实践中自我学习、自我改进:
- AGENTGYM(复旦大学):在多样化环境中进化 LLM-based 智能体。
- Symbolic Learning Enables Self-Evolving Agents:探索符号学习与自我进化的结合。
4. Advanced Agent Applications(高级应用)
将具身智能应用于移动设备操控、自动驾驶、游戏等场景:
- Mobile-Agent-v2(阿里巴巴):多智能体协作的手机操控助手,已在 ICLR 2024 Workshop 发表。
- CRADLE:在《荒野大镖客2》游戏中训练 LLM 智能体——研究者用它来低成本验证智能体的复杂推理能力。
5. LLMs with RL or World Model(强化学习与世界模型)
- UniSim(ICLR 2024 杰出论文奖,UC Berkeley + Google DeepMind):学习交互式真实世界模拟器,一篇解决数据稀缺问题的里程碑工作。
- KALM(NeurIPS 2024):用 LLM 生成数据来做离线强化学习。
6. Planning and Manipulation(规划与操控)
- RoboSpatial(CVPR 2025 Oral,NVIDIA):教 2D/3D 视觉-语言模型理解空间关系,是机器人操作的关键能力。
- RoboRefer:用视觉-语言模型进行机器人空间指代理解。
7. Multi-Agent Learning(多智能体协作)
多机器人如何分工合作?这一板块收录了协同学习相关研究。
8. Vision and Language Navigation(视觉-语言导航)
智能体在真实或虚拟环境中按照自然语言指令移动:
- CANVAS(ICRA 2025): commonsense-aware 导航系统,来自 MAUM.AI 和延世大学。
- NavSpace(ICRA 2026):评估智能体空间智能的新 benchmark,刚于 2026年5月加入列表。
9. Benchmark(评测基准)
评测是进步的标尺。该板块收录了各种具身 AI 评测基准,帮助研究者标准化评估方法。
10. Simulator(仿真器)
真实机器人训练成本高,仿真器是核心基础设施。Isaac Sim、Habitat 等主流仿真器均被收录。

图2:高效 VLA 综述的框架图。 该图将 VLA 研究系统性地分为三个核心支柱:(1)高效模型设计——包含高效架构和模型压缩技术;(2)高效训练——覆盖高效的预训练和后训练策略;(3)高效数据收集——包括高效数据收集和增强方法。此外还综述了 VLA 基础、关键应用、挑战与未来方向。
项目特点与学术价值
优点
- 覆盖面极广:从 2023 年至今的具身智能主流研究几乎无遗漏,特别关注 VLM/LLM 与机器人结合的方向。
- 更新及时:作者持续追踪最新顶会论文(CVPR、ICLR、NeurIPS、CoRL、ICRA),平均每1-2个月更新一次。
- 信息结构化:每个条目包含论文链接、arXiv ID、发表会议/时间、GitHub 仓库和项目主页,方便直接访问。
- 作者关联性强:维护者 Haonan Zhang 本身是具身智能领域活跃研究者,所选论文质量有保障。
局限性
- 非代码项目:这是一个纯 Markdown 文档,没有任何可运行的代码或 Docker 部署包,无法直接进行实验复现。
- 英文为主:所有论文引用均为英文,对中文读者有一定语言门槛。
- 不提供摘要:每篇论文仅给出标题和链接,缺乏核心贡献的简要总结——这对于快速筛选文献不太友好。
- 偏向 VLA 方向:对非视觉的纯语言规划类智能体收录较少,侧重视觉-语言-动作的融合路线。
适合谁使用?
| 用户类型 | 推荐程度 | 原因 |
|---|
| AI/机器人研究方向的研究生 | 极高 | 建立领域认知、找论文、追踪前沿 |
| 想要快速了解具身智能的开发者 | 高 | 按需查阅各子领域精选论文 |
| 产品/投资经理 | 中 | 快速了解行业技术现状 |
| 想复现论文代码的工程师 | 低 | 无代码,需另行搜索 GitHub |
行业趋势观察
从 2023 年到 2026 年,这个列表见证了几个重要趋势的演变:
- 从"纯导航"到"通用操控":早期具身智能大量集中在室内导航任务,近两年操作类任务(抓取、装配家务)研究显著增加,特别是 VLA 模型的突破。
- 从"单一智能体"到"多智能体协作":多机器人协同任务成为新的研究热点。
- 从"仿真"到"真实世界迁移":UniSim 等工作试图解决仿真到现实的差距(Sim2Real)问题。
- 模型效率成为核心挑战:随着模型越来越大,如何高效训练和部署 VLA 成为 CVPR 2025 等顶会的核心议题——这催生了大量模型压缩和高效训练的研究。
总结
Awesome Embodied Robotics and Agent 是具身智能与大型语言模型交叉领域最值得收藏的开放资源库之一。它以"开放论文索引"为核心价值,虽然不是可以直接运行的项目代码,但对于研究者来说是追踪前沿、构建知识图谱的利器。项目由独立研究者维护,更新稳定,在 GitHub 上获得了超过 1800 颗星和 98 个 Fork,体现了社区对其质量的认可。
如果你正在进入具身智能领域,或者想了解 AI 如何"长出身体",这个项目是一个极佳的起点。建议配合论文原文阅读,才能真正理解每项工作的技术细节。