MobileAgent
基于多模态大模型的跨平台GUI智能体,支持桌面/移动/浏览器自动化操作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于多模态大模型的跨平台GUI智能体,支持桌面/移动/浏览器自动化操作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你正在开会,突然想起手机里有一份重要文件需要立刻发给客户,但手机不在手边——你能用电脑发一条指令,让AI帮你拿起手机、打开微信、把文件发过去吗?
或者,你是一名测试工程师,需要在20台不同的Android手机上,反复执行"打开APP→搜索→截图→填写表单"这一套操作。以前这意味着一个人肉重复劳动的黑洞;现在,阿里巴巴通义实验室开发的 Mobile-Agent 让AI真正接管了你的GUI操作。
Mobile-Agent 是一个覆盖桌面端(PC)、移动端(Android/iOS)、浏览器端三大平台的多智能体协作框架。它不是简单地把截图发给大模型让模型"猜"下一步,而是构建了一套完整的感知→规划→执行→反思闭环,让AI能够像真人一样操控图形界面。
在 Mobile-Agent 出现之前,AI 自动化领域存在两条主流路径:
**RPA(机器人流程自动化)**依赖预定义的规则和坐标,需要工程师手动标注每个按钮的位置。一旦界面改版,整个流程就得推倒重来,维护成本极高。
纯视觉大模型方案直接将截图发给 GPT-4V 等多模态模型,由模型"看图说话"决定下一步操作。这种方式更灵活,但缺乏系统性规划,多步复杂任务中容易"迷路"——模型可能在第3步就忘了第1步的上下文。
Mobile-Agent 的出现代表了第三条路:基于原生多模态大模型的端到端 GUI Agent。它不只是让模型"看图操作",而是构建了一个完整的智能体架构,融合了视觉感知、任务规划、工具调用、记忆机制和自我反思能力。
这个项目来自阿里巴巴通义实验室(mPLUG/Owl 团队),该团队在多模态大模型领域有多年的技术积累。2024年初发布 v1 版本以来,项目持续迭代,如今已演进到 v3.5 版本,形成了包含 Mobile-Agent(移动)、PC-Agent(桌面)、GUI-Critic-R1(错误诊断)等子项目的完整家族体系。
Mobile-Agent 的发展历程本身就折射了 GUI Agent 领域的技术进化:
v1/v2 探索了基于视觉感知的基础 Agent 架构,证明了多模态大模型可以在移动设备上执行简单任务,但面对长序列任务时规划能力不足。
v3 引入了多智能体协作机制,将任务分解为规划智能体(Planner)、执行智能体(Executor)和验证智能体(Verifier),三者各司其职、相互反馈,显著提升了复杂任务的完成率。
v3.5 是当前最新稳定版,核心升级在于内置的 GUI-Owl-1.5 系列模型——一套基于 Qwen3-VL 构建的原生 GUI Agent 基础模型,提供了从 2B 到 235B 的完整参数规模,覆盖从边缘设备到超大规模服务器的所有场景。
ToolCUA(2026年5月最新发布)是 v3.5 的进一步升级,引入了"计算机使用 Agent"能力,不仅能操作 GUI,还能调用外部工具API,实现 GUI操作+工具调用+MCP协议 三位一体的最优路径编排。
移动端自动化(mobile_use):通过 ADB(Android Debug Bridge)连接真实Android设备或模拟器,支持屏幕感知、触摸操作、APP启动、截图等核心能力。配合无影云手机(阿里云)还可以实现云端Android环境的远程操控,无需实体设备。
桌面端自动化(computer_use):支持 Windows/macOS 桌面环境,通过截图+鼠标/键盘事件注入执行任务。相比移动端,桌面端界面更复杂、信息密度更高,v3.5 通过 GUI-Owl-32B 等大参数模型来应对。
浏览器自动化(browser_use):基于 Playwright/Selenium 实现网页操作,支持网页导航、表单填写、内容提取等场景。这对于爬虫、自动化测试、网页数据采集等场景尤为实用。
Mobile-Agent v3+ 引入了一个关键能力:执行过程中遇到失败时能够自我反思并调整策略。当某个操作未能达到预期效果时,Agent 会分析失败原因、重新规划下一步,而不是机械地重复失败的动作。这使得长序列任务(10步以上)的成功率大幅提升。
Mobile-Agent 的整体架构可以类比为一个分工明确的实验室团队:
各版本在架构上有所演进:
代码结构上,项目采用 monorepo 风格,按平台分为多个子目录:
Mobile-Agent-v1/ # 早期版本,含 Qwen 模型集成
Mobile-Agent-v2/ # 视觉感知增强版
Mobile-Agent-v3/ # 多Agent协作框架,含 OSWorld/AndroidWorld 基准测试
Mobile-Agent-v3.5/ # GUI-Owl-1.5 原生模型版(核心版本)
PC-Agent/ # 桌面端专用
GUI-Critic-R1/ # 错误诊断与预防模型
ToolCUA/ # 工具调用增强版(最新)
技术栈以 Python 为核心,主要依赖:
坦率地说,Mobile-Agent 目前主要面向有技术背景的用户:
优点:
挑战:
推荐入门路径:
API 依赖风险:尽管 v3.5 推出了 GUI-Owl 原生模型,但当前开源版本仍高度依赖阿里云 dashscope API,存在密钥管理和成本控制问题
平台覆盖不完整:iOS 端自动化能力尚未开源,移动端仅支持 Android,与 Apple 生态的打通仍是空白
复杂任务成功率有限:对于超过 20 步的超长序列任务,即使有自我反思机制,成功率仍然随步数增加而显著下降
竞品压力:Anthropic 的 Claude Computer Use、Google 的 Jules 等竞品在桌面端自动化上已有成熟方案,Mobile-Agent 需要在端到端性能和开源生态上持续发力
从数据看:截至2026年5月,Mobile-Agent 已在 GitHub 获得 8750+ stars,882 forks,189 个 open issues,社区活跃度在 GUI Agent 领域处于头部位置。
从技术演进看:Mobile-Agent 的发展轨迹(从 v1 的单 Agent 到 v3.5 的多 Agent + 原生模型 + ToolCUA)几乎浓缩了 GUI Agent 领域过去两年的技术进化史。它不仅是阿里巴巴多模态 Agent 能力的集中体现,也通过开源推动了整个社区对 GUI Agent 基础设施的共识。
从行业趋势看:随着多模态大模型能力的持续提升,GUI Agent 正在从"演示 Demo"走向"生产可用"。Mobile-Agent 率先在 Android 移动端实现了较高的任务完成率,结合阿里云无影云手机的云端部署方案,为企业级 GUI 自动化提供了可行的技术路径。未来,随着 GUI-Owl-1.5 系列模型的开源深化和 ToolCUA 的持续迭代,Mobile-Agent 有望成为跨平台 GUI Agent 领域的重要基础设施之一。