Embodied_AI_Paper_List
中山大学HCPLab打造的最全具身智能论文资源库,覆盖六大研究方向的完整知识图谱
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
中山大学HCPLab打造的最全具身智能论文资源库,覆盖六大研究方向的完整知识图谱
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:具身智能研究框架总览,涵盖从感知、交互到智能体的完整技术栈(来源:HCPLab-SYSU/Embodied_AI_Paper_List)
想象一个场景:你在厨房里说「帮我把蓝色的杯子拿过来」,一个机器人立刻理解你的意图,穿过障碍、识别杯子、稳稳递到你手中。这不是科幻——这正是 具身智能(Embodied AI) 正在努力实现的目标。
传统 AI 擅长处理数据、生成文字、识别图像,但它「困在」数字世界里。而具身智能要做的,是让 AI 真正「长出手脚」,与物理世界发生交互。这正是通往通用人工智能(AGI)的关键路径之一。
HCPLab-SYSU(中山大学人机物智能融合实验室)联合鹏城实验室,发布了这份重量级综述——《Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI》,发表于 IEEE/ASME Transactions on Mechatronics 2025。该仓库收录了 300+ 篇相关论文,覆盖具身智能的全链条研究。
这个仓库远远超出了「贴 arXiv 链接」的范畴。其 README 长达 16 万字,按研究主题精细分类,形成了完整的学习地图。
| 分类 | 内容 | 论文规模 |
|---|---|---|
| 具身感知 | 主动视觉探索、3D 视觉定位、视觉语言导航、触觉感知 | 约 80 篇 |
| 具身交互 | 人机物理交互、工具使用、任务规划 | 约 40 篇 |
| 具身智能体 | 多模态基础模型、VLA 方法、机器人操控与控制 | 约 100 篇 |
| Sim-to-Real | 仿真到真实的迁移、域适应方法 | 约 30 篇 |
| 数据集 | 感知/导航/问答/操控全场景数据集 | 50+ 个 |
| 具身仿真器 | Isaac Sim、Habitat、Webots 等主流仿真平台 | 覆盖主流 |
| Books & Surveys | 相关专著与综述著作 | 持续更新 |
此外还附有完整的 arXiv 论文 PDF(EmbodiedAI_Review.pdf),可直接下载阅读,无需跳转到外部网站。

图2:中山大学人机物智能融合实验室(HCPLab-SYSU)GitHub 主页
从 2023 年 Vision-Language-Action Model(VLA)浪潮,到 2025 年的世界模型(World Models)在机器人领域的应用,这份综述几乎涵盖了具身智能领域的每一条重要技术路线。收录的论文按主题分类组织,读者可以快速定位感兴趣的方向。
论文将具身智能的研究目标归纳为四大维度:
(1)具身感知(Embodied Perception):让智能体理解环境——不只是看到,还要主动探索、推理空间关系。这涉及主动视觉探索(Active Visual Exploration)、3D 视觉定位(3D Visual Grounding)和视觉语言导航(VLN)。
(2)具身交互(Embodied Interaction):理解意图、执行动作、操作物体。核心问题是如何让机器人在真实物理环境中完成「拿、取、放、推」等基础操作。
(3)具身智能体(Embodied Agent):这是最前沿的方向——利用多模态大模型(MLM)和世界模型(WM)构建能够感知、推理和执行的统一智能体。VLA(Vision-Language-Action)方法正在成为主流范式。
(4)Sim-to-Real 适应:在仿真环境中训练,迁移到真实机器人。这是降低数据成本、加速研究迭代的关键技术路径。
仓库保持着活跃更新(最近更新:2026年3月31日,发布 Physics-R1 项目),每次具身智能领域有重大突破,作者团队都会及时补充相关工作。这种持续维护在学术资源库中非常难得。
对于不同背景的读者,这个仓库有不同的使用方式:
AI/机器人研究者:按分类浏览论文,快速了解某一子方向的 SOTA 工作。特别推荐「Embodied Multimodal Foundation Models」和「Sim-to-Real Adaptation」两个子章节,前者覆盖 VLA 和世界模型最新进展,后者解决实际部署中的核心痛点。
硕博研究生:作为文献调研的一站式入口。每个子分类下都标注了论文的关键信息(方法、数据集、实验设置),节省大量检索时间。结合 PDF 综述全文,可以快速建立对领域的系统性认知。
工业界工程师:重点关注数据集章节——这里收录了几乎所有主流具身智能基准数据集的链接和说明,包括 OSRT、Habitat-Matterport 3D、Meta-World 等,是选择基准测试环境的重要参考。
这个仓库是综述性资源库而非代码项目,以下几点值得注意:
不提供可运行代码:所有代码需参考各论文原始仓库。本仓库仅做内容组织和引用,不对各论文方法提供额外实现或 demo。
论文质量参差不齐:收录范围广意味着包含了从顶会论文到 arXiv 预印本的不同层次工作,读者需要自行甄别论文的同行评审状态和学术影响力。
中文资料有限:综述内容以英文为主,对中文学习者可能存在一定语言门槛。不过论文列表本身不受语言限制,是无障碍的学习资源。
具身智能正处于历史性突破的前夜。2024-2025 年,Google RT 系列、Tesla Optimus、国内的宇树科技和傅利叶智能等掀起了具身机器人热潮。而这些进展的底层,是具身感知、多模态理解、Sim-to-Real 适应等核心技术的持续积累。
HCPLab-SYSU 的这份综述仓库,不仅是一个论文索引,更是一张具身智能研究全景图。它告诉我们:这个领域正在往哪里走、走了多远、以及还差什么。对于任何想要进入这个领域的人来说,这都是一份不可多得的起点资源。
GitHub 持续更新中,预计随着具身智能热潮的持续,这个仓库的 star 数还将继续攀升。