AppAgent
让AI像人一样操作Android手机的多模态Agent框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让AI像人一样操作Android手机的多模态Agent框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你可能有过这样的经历:手机里装了几十个App,但某个不常用的功能藏在多层菜单深处,怎么也找不到;或者需要重复操作手机来完成一项任务,比如批量处理照片、自动化填写表单,手动一步步点下来既枯燥又容易出错。如果有一个"智能助手"能像人一样看懂屏幕、操作手机,帮你完成这些繁琐的点击滑动,那该有多好?
这正是 AppAgent 想要解决的问题。作为腾讯光子安全实验室(Tencent QQGY Lab)的研究成果,AppAgent 是一个基于多模态大模型(VLM)的自主智能体框架,专门设计用于操作 Android 智能手机应用。它让 AI 不再只是聊天,而是真正拥有了"动手能力"——能像人类用户一样,看懂截图、理解界面、执行点击和滑动操作。

图1:AppAgent 系统概览,展示了 AI 智能体如何与 Android 手机交互
该项目在 2023 年 12 月正式开源,并在人机交互顶级会议 CHI 2025 上发表学术论文,引起了学术界和工业界的广泛关注。截至目前,GitHub 星标数超过 6700 个,是 AI Agent 领域最具代表性的开源项目之一。
智能手机已经成为现代人生活中不可或缺的工具,App 的数量和复杂度也在持续增长。然而,对于 AI 助手来说,"操作手机App"这件事长期缺乏有效解决方案,原因在于:
传统方案依赖系统后端接口。 过去,自动化手机操作的方案(如 Android 的 Accessibility Service、Appium 等)都需要深度系统权限,或者依赖应用提供公开 API。一旦应用更新了界面或收紧了权限,这些方案就会失效,维护成本极高。
纯视觉方案面临挑战。 让 AI 直接"看图操作"看似简单,但手机屏幕空间有限、UI 元素密集,大模型需要精确理解每个按钮、输入框的位置和功能,难度远超桌面环境。
AppAgent 的创新之处在于,它首次将 GPT-4V 等多模态大模型的视觉理解能力与 Android 调试桥(ADB)结合,创造了一种既灵活又鲁棒的"第三种路径"——不依赖系统后端,也不依赖固定规则,而是让 AI 自己学会操作每一个 App。
AppAgent 采用了创新的两阶段工作流,分为探索阶段(Exploration Phase)和部署阶段(Deployment Phase)。
在探索阶段,AppAgent 会自主探索目标 App 的界面和功能。具体来说:
uiautomator dump 获取界面 XML 结构,提取每个元素的层级关系和属性(resource-id、class、content-desc 等)。com.app.name:id/button_confirm),方便后续精确操作。这种探索可以由 AI 自主完成,也可以由人类示范引导。人类用户可以亲自演示一遍操作流程,AI 观察学习后自动整理成文档。
拿到探索阶段生成的文档后,AppAgent 进入部署阶段。用户只需给出自然语言任务指令(如"帮我在微信里给张三转账 100 元"),AI 就会:
AppAgent 的代码结构清晰,主要模块如下:
| 模块 | 功能 |
|---|---|
and_controller.py | Android 控制层:封装 ADB 命令,实现截图、XML 解析、元素定位、点击/滑动等操作 |
model.py | 多模态模型接入层:支持 OpenAI GPT-4V 和阿里通义千问 Qwen-VL-Max,统一接口 |
task_executor.py | 任务执行引擎:协调控制层和模型层,完成探索/部署全流程 |
self_explorer.py | 自主探索逻辑:AI 自主导航 App 界面,生成操作文档 |
document_generation.py | 文档生成模块:整理探索过程,输出结构化操作文档 |
run.py / learn.py | 入口脚本:分别对应部署阶段和探索阶段的启动脚本 |
关键技术细节:
adb shell 执行,无需 Root 权限或专用 App。系统自动发现连接的设备(支持真机和模拟器)。REQUEST_INTERVAL 控制 API 调用频率,避免触发服务商限流。AppAgent 目前的形态是命令行工具,对用户有一定技术要求:
环境要求:
适合人群:
不适合:
AppAgent 的出现,标志着 GUI Agent(图形界面智能体)研究进入了一个新阶段。它证明了多模态大模型具有真正的"视觉操作"能力,两阶段学习范式(探索+部署)是一种可行且高效的 AI 操作手机方案。后续许多 GUI Agent 项目(如 AppAgentX、SeeAct 等)都在 AppAgent 的基础上进行了扩展和改进。

图2:AppAgent 在 X(Twitter)App 上执行关注用户任务的演示截图
如果你对 AI Agent、多模态大模型、具身智能感兴趣,AppAgent 是值得深入研究的开源项目。即使不直接使用,它的架构设计和两阶段学习思路,也能为相关研究提供重要参考。