phosphobot
开源机器人 AI 全家桶:一键遥操作录制 + VLA 模型训练,支持 SO-100/Unitree
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源机器人 AI 全家桶:一键遥操作录制 + VLA 模型训练,支持 SO-100/Unitree
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
phospho(或 phosphobot)是一款面向机器人的开源"全家桶"——它让用户用键盘、游戏手柄、甚至 Meta Quest 头盔来遥操作真实机器人,将动作数据记录下来,然后训练 Vision-Language-Action(VLA)模型,最终让 AI 自动控制机器人完成任务。这个项目覆盖了从"让机器人动起来"到"让机器人学会自己动"的完整流程,在 GitHub 上已获得 381 颗星,兼容 SO-100、SO-101、Unitree Go2 等主流硬件,并获得了 Y Combinator W24 孵化支持。
想象一下:要训练一个能帮你叠衣服的机器人,传统的做法是工程师手工编写大量控制代码,调试每一个关节的角度——这通常需要数月的专业知识积累。而 phospho 的思路是:让人类先示范,机器人再模仿。你戴上 VR 头显或握住游戏手柄,实际操作一遍"如何叠衣服",phospho 记录下摄像头画面 + 手臂动作,然后交给 VLA 模型去学习这个映射关系。
这种"模仿学习"(Imitation Learning)思路并非 phospho 独创——Physical Intelligence 的 π0、Google DeepMind 的 RT-2、特斯拉的 Optimus 都采用了类似方法。但 phospho 的独特之处在于:它是完全开源的、硬件兼容范围极广的、社区驱动的中间件。一个树莓派 + 几百美元的机械臂,配合 phospho 就能完成从数据采集到模型训练的全流程。这极大地降低了机器人 AI 研究和开发的门槛。
phospho 团队来自 Y Combinator W24,创始成员均有机器人学背景。其 GitHub 仓库吸引了 82 个 fork、32 个 open issues、活跃的 Discord 社区(1.1万+ 成员),说明其在爱好者和研究社区中有真实的使用者。
phospho 将机器人 AI 开发流程拆解为清晰的五个步骤,每一步都有对应的工具支持。
phospho 提供了跨平台一键安装脚本,支持 Raspberry Pi、Linux、macOS 三种平台。脚本自动检测操作系统、安装 Python 依赖、配置硬件驱动。安装后只需一条命令 phosphobot run 即可启动 Web 控制面板(默认 localhost:80)。服务端基于 FastAPI + Uvicorn,提供 REST API 和 WebSocket 接口,方便程序化控制。
值得注意的是,服务端并非容器化部署(无 Dockerfile / Docker Compose),需要直接安装到宿主机——这对于嵌入式场景(Raspberry Pi 控制的机器人)是合理的设计选择,但也意味着部署到新环境时需要手动处理依赖冲突。
phospho 支持多种控制输入设备:
支持的机器人涵盖 SO-100、SO-101、Unitree Go2、AgileX Piper 等。项目的模块化硬件抽象层(phosphobot/hardware/)设计良好,新增一种机器人只需实现统一的接口协议,无需改动核心代码。
录制过程在 Web UI 上可视化呈现。录制格式为 [摄像头画面序列] + [关节角度序列],存储为 Parquet 格式(fastparquet),可通过 dataset-viewer 组件预览。录制 50 条 episode(每条几分钟)后即可开始训练。项目还支持在 PyBullet 仿真环境中进行录制,方便没有实体机器人的用户实验。
这是 phospho 最具技术含量的部分。项目支持多种主流模仿学习算法:
| 算法 | 论文 | phospho 支持 |
|---|---|---|
| ACT | Zhao et al., CoRL 2023 | 完整训练脚本 + 推理服务 |
| smolVLA | 小型 VLA 模型 | 社区支持 |
| π0 / π0.5 | Physical Intelligence | 集成 openpi 推理 |
| gr00t-n1.5 | NVIDIA robotics | 微调教程(tutorials/00_finetune_gr00t_vla.md) |
训练采用 HuggingFace lerobot 框架,模型权重导出到 HuggingFace Hub。训练脚本由 uv 管理 Python 环境,保证依赖隔离。GPU 训练建议 8GB+ 显存,但推理可以在消费级 GPU 上运行。
训练好的模型通过 inference/ 下的客户端脚本加载。phospho 的 AI 控制模块(ai_control.py,约 8.5KB)负责将 VLA 模型的输出转换为电机控制指令。推理路径支持两种模式:本地 GPU 推理和远程推理服务器。
phospho 的代码架构分为三个主要组件:
后端(Python + FastAPI):核心逻辑在 phosphobot/ 目录下,约 24 个 Python 模块,分工明确:
app.py:FastAPI 应用入口,定义 REST API 和 WebSocket 端点camera.py(62KB):摄像头管理,支持 RealSense、立体相机、普通 USB 摄像头teleoperation.py(22KB):遥操作逻辑,处理各类控制输入设备recorder.py(25KB):数据集录制和存储robot.py(12KB):机器人抽象层,定义统一的硬件接口leader_follower.py(14KB):主从臂跟随控制算法ai_control.py(8.5KB):VLA 推理后处理前端(TypeScript + React):dashboard/ 是一个完整的 React 19 应用,使用 Radix UI 组件库 + Tailwind CSS 样式方案,集成 Zustand 状态管理和 SWR 数据获取。dashboard 不仅提供可视化控制界面,还内置了 API 文档(基于 FastAPI 的 auto-generated docs)和模型管理功能。
数据层:使用 Supabase(PostgreSQL + Realtime)存储用户数据和会话,支持实时同步到 HuggingFace Hub 的数据集格式。
整体代码质量较高:pytest 完整测试套件、ruff + mypy 静态检查、pyproject.toml 标准依赖管理。code_quality_score 评估约 80/100。
phospho 的设计定位介于"极客玩具"和"工业级工具"之间,有几个值得关注的门槛:
硬件门槛:录制和训练 VLA 模型确实需要 NVIDIA GPU(建议 8GB+ 显存),这对于个人爱好者是主要障碍。不过,纯推理阶段可以在 Jetson Nano 等边缘设备上运行,phospho 的 wasmtime 集成表明团队在探索 WebAssembly 推理路径。
非容器化:项目没有提供 Docker 镜像,这意味着在非标准环境(如国产 Linux 发行版、ARM 服务器)部署时,可能遇到依赖冲突。树莓派上的安装脚本相对成熟,但其他平台偶有驱动兼容性问题。
摄像头兼容性:项目支持 RealSense 深度相机(Linux/Windows)和标准 USB 摄像头,但 macOS 的摄像头支持依赖系统 API,对某些特殊相机型号可能需要额外驱动。
phospho 代表了一个重要趋势:用软件降低机器人 AI 的获取门槛。2024-2025 年,VLA(Vision-Language-Action)模型成为机器人 AI 的主流方向,Physical Intelligence 的 π0、Google 的 Gemini Robotics、Figure AI 的 Helix 都展示了令人惊艳的能力。但这些商业方案的模型和训练数据并不开源,开发者只能使用 API 或购买硬件。
phospho 的价值在于:它提供了一个完全透明、可修改、端到端的开源方案。任何有编程基础的人都可以:
作为 Y Combinator 孵化的项目,phospho 已经证明商业化与开源并不矛盾。其盈利模式可能是销售配套硬件( phospho Starter Pack)和企业级支持服务,而非封闭核心代码。这为机器人 AI 领域的开源创业提供了一个值得参考的商业模型。
图1:phospho 项目概览

phospho 官方项目 Banner,展示完整的机器人遥操作 + 训练 + 推理工作流。
图2:GitHub 仓库预览
GitHub 官方仓库预览图,展示 phospho 的代码组织结构和 star 趋势。