mobilerun
用自然语言命令直接操控 Android/iOS 设备的 LLM Agent 框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用自然语言命令直接操控 Android/iOS 设备的 LLM Agent 框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Mobilerun 官方 Logo
你或许用过 ChatGPT 让 AI 帮你写文案,也用过 Claude 帮你分析代码。但如果有一天,你告诉 AI「帮我打开微信,给妈妈发一条生日祝福」,AI 能直接在你的真实手机上完成操作——点哪、划哪、输入什么——就像一个不知疲倦的数字助手替你拿起手机?这正是 Mobilerun 正在做的事情。
传统的手机自动化工具(如 Appium、UI Automator)本质上是一套基于坐标和控件定位的脚本系统:你得精确知道「登录按钮在第 200 像素处」,才能写出一条点击指令。这种方式有两个致命问题:一是 UI 稍有变化(按钮移位、文字更新)整个脚本就失效;二是非技术用户根本无法编写和维护这些脚本。
Mobilerun 的出现,恰好填补了这一空白。它是一个开源的移动端 AI Agent 框架,核心思路是:让大语言模型(LLM)直接理解手机屏幕的「无障碍树」(Accessibility Tree)——这是 Android 系统自带的一种 UI 结构描述——再结合截图视觉理解,LLM 就能像人一样「看懂」屏幕,并决定下一步操作。
Mobilerun 提供两套控制路径,分别对应不同场景:
直接任务模式:用户通过 CLI 输入自然语言指令,如 mobilerun run "打开设置并开启深色模式",Agent 立即规划步骤并执行——读取界面状态、判断下一步操作、执行点击或滑动。这种模式适合一次性任务,不需要复杂规划。
推理模式(--reasoning):当任务涉及多步骤、需要根据中间结果调整策略时,Agent 进入 manager-executor 架构:manager 负责任务分解和进度追踪,executor 负责具体操作。每一步都会记录执行轨迹,便于事后复盘和 debug。官方测试基准达到 91.4% 的成功率,这一数字在移动端自动化领域相当亮眼。
多模型兼容:Mobilerun 采用 LLM-agnostic 设计,不绑定任何特定 AI 提供商。内置支持 OpenAI GPT-4o、Anthropic Claude、Gemini、DeepSeek、Ollama(本地部署)以及 OpenRouter 等。切换模型只需改一行配置,适合做跨模型效果对比。
从代码结构看,Mobilerun 分为以下几个核心模块:
依赖层面,Mobilerun 基于 LlamaIndex 构建 Agent 编排层(v0.14.4 + workflows v2.16),使用 Pydantic 做数据验证,Rich 和 Textual 构建终端 UI(TUI),async_adbutils 连接 Android 设备。整体技术栈以 Python 异步为主,适合集成到现有 Python 项目中。
Mobilerun 对开发者相当友好。使用 uv 安装:
uv tool install mobilerun
或同时安装 Python SDK:
uv pip install mobilerun
首次运行需要完成三步配置:通过 mobilerun setup 在手机上安装 Portal 应用并开启无障碍权限;通过 mobilerun configure 配置 LLM provider(API key 或本地模型);通过 mobilerun ping 验证连接。完成后就可以开始自然语言控制了:
mobilerun run "打开设置,找到关于手机,告诉我 Android 版本" --vision
mobilerun run "找到联系人里叫张三的人,给他发一条消息:今晚见" --reasoning
Docker 部署也受支持:官方 Dockerfile 基于 python:3.12-slim 构建,预装 ADB 和 uv,一条命令即可容器化运行。适合在 CI/CD 流程中做自动化测试。
Mobilerun 并非万能。首先,它依赖真实手机或模拟器——没有物理设备,框架无法运行,这对想纯云端体验的用户是个门槛。其次,推理模式耗 token 较快:多步任务的每一步都需要 LLM 推理,长流程任务的成本需要考虑。第三,Android 和 iOS 体验不对称:Android 通过 Portal App + ADB 直连本地设备,iOS 则需要走单独的 Portal 流程,实测文档中 Android 场景更完善。
此外,框架目前处于 Beta 阶段(v0.6.2),API 尚未稳定,大规模生产环境使用需评估版本升级风险。
Mobilerun 的价值不仅在于技术实现,更在于它让移动端 AI Agent 变得触手可及。在此之前,能在真实手机上执行复杂任务的 AI Agent 通常是大厂专属(如 Apple 的 Siri 深度集成、Google 的 Assistant),普通开发者难以介入。Mobilerun 以开源方式提供了一套标准化的「AI 控制手机」基础设施,降低了移动端 Agent 的开发门槛。
从商业角度看,它同时推出了 Mobilerun Cloud(云端托管手机)作为商业化路径:用户可以选择不使用自己的手机,而是连接云端虚拟设备或托管真机,按 API 调用量付费。这是一种聪明的开源 + SaaS 双轨模式。
总结:Mobilerun 是一个将 LLM Agent 能力落地的优秀实践,适合移动端自动化测试、无障碍辅助、重复任务机器人等场景。如果你对「让 AI 操作我的手机」感兴趣,它是最值得一试的开源框架。