mobileClaw
Android 原生 AI Agent 运行时,通过 VLM 视觉感知 + Python 调度,让多模型在同一群聊中互相博弈辩论
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Android 原生 AI Agent 运行时,通过 VLM 视觉感知 + Python 调度,让多模型在同一群聊中互相博弈辩论
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这个场景:你手里有一台旧 Android 手机,系统是 Android 11+ ——它能做的事,可能比你想象的要多得多。
MobileClaw 把这部手机变成了一个 AI Agent 实验室。它通过 Android 的 无障碍服务(Accessibility Service)读取屏幕内容,借助 VLM(视觉语言模型) 理解界面,再通过 Python 运行时(Chaquopy)执行自动化脚本,最后把不同平台、 不同性格的 AI 角色丢进同一个"群聊游戏"里——让它们互相辩论、投票、 互相拆台,看谁的"演技"更好、谁的推理更稳。
这不是一个聊天机器人,这是一场多模型博弈实验。
作者 eggbrid2 的出发点很纯粹:LLM Agent 很火,但大多数跑在云端或电脑上, 普通用户很难直观感受 AI 之间的差异。而 Android 手机几乎是家家户户都有的设备, 用它来做 AI Agent 的载体,既有真实场景(自动化操作真实 App),又足够接地气。
这个项目的灵感来源之一是"Mihomo VPN 工作流"——在 Android 上打通内外网的 代理通道,让手机成为一个可控的 Agent 执行环境。结合 VLM 的视觉感知能力, 手机能"看见"屏幕,再结合 Python 脚本的调度能力,手机能"操控"屏幕。
MobileClaw 这次更新的核心功能是群聊游戏模式:
类比来说,这就是一场手机上的 AI 狼人杀,只是玩家都是大模型。

MobileClaw 的技术选型非常务实:
项目使用 Gradle Kotlin DSL 构建,app/build.gradle.kts 中集成了
chaquopy 插件,说明 Python 层的依赖管理也纳入了 Android 构建体系。

从项目结构看,MobileClaw 遵循标准的 Android 工程规范:
app/src/ 包含 Compose UI 和业务逻辑role-market/ 存放 AI 角色的定义和头像资源docs/recipes/ 包含使用配方文档(手机控制、Codex 桌面桥接、Tailscale 引导等)scripts/ 包含辅助脚本(调试、发布到蒲公英等)文档质量较高,有中文 README_zh.md、详细的快速入门文档和设计文档, 但代码注释相对稀疏,测试覆盖率不明。整体代码质量中等偏上, 架构清晰但以原型实验为主。
除了核心的群聊功能,MobileClaw 还支持:

MobileClaw 是一款原生 Android 应用,没有服务端组件,部署方式完全在本地:
没有 Dockerfile 和 docker-compose,这意味着它不是一个"云端项目"—— 它本质上是一个移动端 AI Agent 工具,使用场景是"拿着手机玩 AI"。
不过项目提供了详细的 docs/quickstart.md 快速入门指南,以及 scripts/assemble_debug.sh
辅助脚本,降低了一定的上手门槛。

MobileClaw 的一些局限性值得注意:
MobileClaw 代表了一种趋势:端侧 AI Agent 的探索。
它不依赖云端 API 调用,而是尽量在本地完成感知→决策→执行的全链路。 虽然目前 Android 端侧推理能力有限(主要依赖远程 VLM),但项目结构为未来 在手机上跑本地模型奠定了基础。
更重要的是,它让"AI 斗蛐蛐"这件事变得可视化、可交互、门槛低—— 你不需要懂技术,只需要一部旧手机,就能让 GPT、Claude、Gemini 在同一个 群里互相battle。这本身就是一件很有趣的事。