embodied-agents
用几行Python代码将GPT-4、Claude、OpenVLA等大模型接入任意机器人控制栈的轻量级
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用几行Python代码将GPT-4、Claude、OpenVLA等大模型接入任意机器人控制栈的轻量级
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:mbodied 标志
2024年初,全球多个顶尖机器人实验室都在面对同一个难题:如何将最新的大模型能力快速集成到真实的机器人控制栈中?OpenVLA、RT-2、Octo 等模型相继发布,效果惊艳,但将它们落地到真实机械臂或移动机器人上,往往意味着数千行定制代码、大量环境适配工作,以及漫长的调试周期。一个博士生可能需要花三个月,才能让一个新模型在实验室的机器人上跑通一个简单任务。
mbodied(GitHub: mbodiai/embodied-agents)正是在这个背景下诞生的。它由专注于具身 AI 的初创公司 Mbodi AI 推出,是一个 Python 优先的轻量级工具包,目标是用最少的代码,将最先进的多模态大模型接入任何机器人系统。核心设计哲学是:开发者不需要关心模型加载、API调用、结果验证的细节,只需要调用统一的 .act() 接口,剩下的一切交给框架处理。

图2:mbodied Logo(项目演示截图见 GitHub 仓库)
mbodied 的架构围绕三个核心组件展开,每个组件又细分为三种元模态——语言(Language)、运动(Motion)、感知(Sense),灵感来自中枢神经系统的效率分层:
Language Agents(语言智能体):负责任务理解、推理与规划。底层支持 OpenAI GPT 系列、Anthropic Claude、Google Gemini、Ollama、vLLM 以及 Gradio 托管模型。通过 Pydantic 进行输出验证,确保返回格式可控。在推理链模式下,语言智能体可以先"思考"再"行动",将复杂任务拆解为多个可执行的子步骤。
Motor Agents(运动智能体):将高层指令转化为具体的机器人动作。当前已集成 OpenVLA(视觉-语言-动作模型),支持在真实机械臂上直接执行「看图+指令→动作」的控制闭环。此外还支持 ROS 消息格式的输出,方便与现有机器人控制系统对接。
Sensory Agents(感知智能体):为机器人提供视觉理解能力,包括深度估计(Depth Anything)、目标检测(YOLO)、图像分割(SAM2)等。所有感知能力均提供托管 API 端点(api.mbodi.ai/sense/),无需本地 GPU 即可调用。
三种智能体通过统一的 act() / async_act() 接口暴露,调用方无需关心底层是本地推理还是远程 API 调用——框架自动处理同步/异步、本地/远程的执行路由。
mbodied 的功能矩阵相当完整,不仅限于模型推理,而是覆盖了机器人 AI 开发全流程:
本地数据集录制是一大亮点。通过 RobotRecorder,框架可以自动记录机器人在执行任务过程中的传感器数据(图像、关节角度、末端执行器姿态等),并可选地将数据直接上传到 HuggingFace Datasets,形成可复用的具身数据集。这对需要积累模仿学习样本的研究团队来说尤为实用。
**RAG(检索增强生成)**功能在 2025 年 4 月加入。框架集成了 ChromaDB 作为向量数据库,支持在机器人知识库中检索相关操作文档或历史案例,辅助语言智能体做出更准确的任务规划。
AutoAgent是一个动态智能体选择器。给定任务描述和可用硬件,AutoAgent 会自动初始化最合适的智能体组合,降低了非专业用户的上手门槛。
框架还提供了功能完善的 CLI 工具 mbodied,通过命令行即可直接体验感知 API(深度估计、目标检测等),无需编写 Python 代码。
从 pyproject.toml 可以看出,mbodied 在工程层面下了相当功夫:
mypy 作为类型检查工具。pytest + pytest-asyncio,支持并行测试和覆盖率统计,测试路径与源代码路径严格一一对应。ruff 作为 linter,120 字符行宽,遵循严格的代码规范。hatchling,支持 pip 安装、从源码安装以及 Conda 环境。mbodied 的安装极其简单——一行 pip install mbodied 即可完成基础安装,包含核心依赖(openai、anthropic、pydantic、gradio 等)。如需视觉能力,加装 pip install mbodied[extras],将自动安装 PyTorch、OpenCV、Transformers 等重量级依赖。
不过,"一键安装"背后有几点需要留意:
总体来看,mbodied 的部署难度为"简单"——Python >= 3.10 环境即可运行基础功能,但充分发挥其能力(本地运动模型推理)需要额外配置 GPU 环境。
项目 README 坦诚列出了当前局限:mbodied 目前不支持从上下文经验中在线学习。具体而言:
路线图上,团队计划陆续支持 Pi0 运动智能体、ROS 集成、RT-1/Octo 等更多运动模型,以及更多设备(OpenCV 相机)的接入。微调脚本也在规划中。
mbodied 代表了具身 AI 领域的一个趋势:从"大模型在云端"走向"大模型在机器人身边"。随着 OpenVLA、π0 等视觉-语言-动作模型的效果持续提升,如何让这些模型快速落地成为行业痛点。mbodied 通过统一抽象层和开箱即用的 API,将这个门槛大幅降低。
截至 2025 年,该项目在 GitHub 上获得了 292 颗星,在 pending 状态项目中排名第一,显示出社区对其解决实际问题能力的认可。对于机器人研究者、具身 AI 开发者以及希望快速验证大模型+机器人结合方案的团队,mbodied 是一个值得关注的工具。