VisionClaw
将 Meta Ray-Ban 眼镜秒变 AI 贴身助手,实时视觉理解 + Gemini Live +
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将 Meta Ray-Ban 眼镜秒变 AI 贴身助手,实时视觉理解 + Gemini Live +
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象这样一个场景: 你走进一家咖啡馆,点了杯美式,但忘记问价格。戴上眼镜,盯着收据,AI 立刻读出了金额——这不是科幻,这是 VisionClaw 正在做的事。
2024 年,Meta Ray-Ban 智能眼镜销量突破百万,成为少数真正走向大众的 AR/AI 可穿戴设备。但它的默认体验很有限:只能拍照、听音乐、呼叫 Meta AI——一个答完即忘的语音助手。
Sean Liu(GitHub @sseanliu,Intent-Lab)想更进一步:如果让 Gemini 的实时视觉理解能力,直接"看到"眼镜捕捉到的画面,再配合能够真正执行任务的 Agent 工具,会是什么体验? 这个问题的答案,就是 VisionClaw。
VisionClaw 不是一个 demo,而是一个完整的、生产级的 iOS/Android 应用,在 GitHub 已获得 2368 Stars 和 443 Forks,社区活跃度高。
VisionClaw 的核心是一套精密的实时数据管道,将眼镜 → 手机 → 云端 AI → 执行工具串联起来:

第一层:硬件采集 Meta Ray-Ban 眼镜(或手机摄像头)负责采集视频帧(约 1fps)和音频(16kHz PCM)。开发者利用 Meta 官方 Wearables DAT SDK 实现与眼镜的通信和数据获取,无需自行破解协议。
第二层:实时传输 iOS/Android App 作为中间层,通过 WebSocket 连接到 Google Gemini Live API,持续上传视频帧和音频流,同时接收 Gemini 的实时语音响应(PCM 24kHz)。这意味着用户说话 → AI 听到 → AI 回复,全流程几乎是同步的,没有传统 STT→LLM→TTS 链路中的延迟积累。
第三层:Agent 执行 Gemini 支持 Tool Calls(工具调用)——当用户说"帮我加牛奶到购物清单",Gemini 识别这是一个动作请求,通过 App 路由到 OpenClaw 本地网关。OpenClaw 本身是一个独立项目,为 Gemini 提供了 56+ 工具能力:网页搜索、发消息、管理购物清单、控制智能家居、设定提醒……这条工具链让 AI 真正从"回答问题"进化到"替你办事"。
| 功能 | 实现方式 |
|---|---|
| 实时视觉问答 | 眼镜摄像头 → Gemini Live → 语音回答 |
| 购物比价 | Gemini 识别商品 → OpenClaw 搜索电商价格 |
| 消息发送 | 语音指令 → OpenClaw → WhatsApp/Telegram/iMessage |
| 智能家居 | 语音指令 → OpenClaw → Home Assistant |
| 实时直播 | WebRTC 推流,眼镜画面共享到浏览器 |
| 手机模式 | 无眼镜时,直接用手机摄像头替代 |
VisionClaw 的 iOS 和 Android 代码均采用平台原生开发:
项目基于 MIT 许可证开源,代码结构清晰,模块化良好。
硬件门槛较高(Meta Ray-Ban 眼镜约 299 美元起),但 App 支持纯手机模式,无需眼镜也能体验完整 AI 流程。核心步骤:
VisionClaw 依赖 Gemini Live API,需要稳定的互联网连接,眼镜本身不具边缘推理能力。Gemini Live API 的定价和速率限制尚未完全公开,企业级大规模部署存在成本不确定性。此外,iOS 端依赖 Meta DAT SDK,Android 端通过 GitHub Packages 分发 DAT SDK,配置流程相对繁琐,对新手不够友好。
VisionClaw 代表了 AI 眼镜从"玩具"到"工具"的关键转折。它展示了可穿戴设备 + 多模态大模型 + Agent 工具链的组合路径:摄像头作为感知入口,Gemini 作为理解大脑,OpenClaw 作为执行末梢。这条路与苹果 Vision Pro 的 VisionOS 应用生态、Rabbit R1 的 LAM 概念殊途同归,但 VisionClaw 的优势在于完全开源、社区驱动、快速迭代。
随着 Meta Ray-Ban 眼镜销量持续增长,以及 Gemini Live API 的逐步开放,VisionClaw 类项目有望成为可穿戴 AI 时代的重要基础设施之一。