Agent-S
首个在 OSWorld 超越人类表现的 GUI 智能体框架,让 AI 像人一样操控电脑
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个在 OSWorld 超越人类表现的 GUI 智能体框架,让 AI 像人一样操控电脑
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你在出差途中,突然需要远程关闭公司的某台电脑上的程序、调整一个配置文件,或者给同事发一封带有特定附件的邮件。通常这件事意味着漫长的远程桌面连接、卡顿的网络、反复的身份验证。但如果有一个 AI 助手,能够像你一样"看见"电脑屏幕、理解界面上的按钮和输入框,然后自动帮你完成这些操作呢?
这正是 Agent S 正在做的事。
2024 年,随着 GPT-4V、Claude 3.5 等多模态大模型的出现,AI 第一次具备了"看"屏幕的能力。但光能看见还不够——AI 还需要学会"动手":点击正确的按钮、在输入框里输入文字、从下拉菜单里选择选项。这些在人类看来再简单不过的操作,对 AI 来说却涉及坐标定位、界面理解、动作规划等多个环节的协同。
Simular 团队(来自南京大学)敏锐地捕捉到了这个方向,在 2024 年 10 月发布了 Agent S 论文与代码,并在次年的 ICLR 2025 大会上获得 Agentic AI for Science Workshop 最佳论文奖。随后团队持续迭代,从 S1 到 S2、S2.5,再到 2025 年底的 S3,Agent S 系列持续刷新着计算机操作智能体的性能上限。
如果把大语言模型比作"大脑",那么 Agent S 就是给这个大脑装上了"手"和"眼睛"的完整系统。你可以把它理解为:一个既看得懂电脑屏幕上发生什么、又知道怎么操作鼠标键盘的 AI 实习生。
这个"实习生"与众不同的地方在于,它不是在执行预设的脚本,而是真正理解任务目标后自主规划操作路径。例如你说"帮我把桌面上的截图发给老板",它会自己找到桌面文件夹、识别截图文件、打开邮件应用、输入收件人地址、添加附件、发送——整个过程无需你一步步教它怎么做。
Agent S 的架构建立在三大技术支柱之上,每一项都是当前 GUI Agent 研究的前沿课题:
第一,视觉界面理解(Grounding)。传统的 AI 模型只能"看懂"屏幕截图上有什么文字,但 Agent S 需要知道"按钮在哪里"——即屏幕上每个可交互元素的精确坐标。S3 版本使用了 UI-TARS 系列 grounding 模型,能够将视觉语义理解与精确坐标预测结合起来,输出可靠的点击/输入动作指令。这解决了此前 GUI Agent 常见的"指错位置"问题。
第二,长程任务规划(Trajectory Management)。真实世界的电脑操作往往涉及几十步、上百步的操作流,比如"安装一个软件并配置好环境"这类任务。S3 引入了 Behavior Best-of-N(bBoN)机制,通过多轨迹采样和选择策略,在 100 步的 OSWorld 基准测试中达到了 66% 的准确率,配合 bBoN 后更是突破了 72.6%——首次超越了人类水平的 72%。
第三,自主反思与纠错(Reflection Agent)。S3 默认启用了反思智能体,当主智能体的操作失败或陷入循环时,反思智能体会分析当前状态并给出调整建议。这相当于给 AI 配备了一个实时在旁边的"导师",大幅提升了复杂长任务的完成率。
从代码结构来看,Agent S 采用了清晰的模块化设计:
AgentS3:主智能体入口,负责接收任务指令、管理对话历史和操作轨迹
OSWorldACI:Grounding 智能体,负责将视觉观察转化为具体的鼠标键盘操作指令
LocalEnv(可选):本地代码执行环境,使智能体能够直接运行 Python 和 Bash 脚本处理数据、文件和系统任务
支持的模型层覆盖了主流大模型供应商:OpenAI(GPT-5/4o)、Anthropic(Claude 3.7/3.5)、Google Gemini,以及通过 OpenRouter 和 vLLM 接入的自定义端点。Grounding 模型推荐使用 ByteDance 的 UI-TARS-1.5-7B。
技术栈方面,核心代码为 Python,主要依赖包括 OpenAI/Anthropic SDK、FastAPI(提供 API 服务框架)、PyAutoGUI(跨平台 GUI 自动化)、PaddleOCR(文字识别)、pytesseract(OCR 辅助)、websockets(实时通信)等。
Agent S 主要通过命令行界面使用,不提供开箱即用的 Web UI。安装相对简单:pip install gui-agents,但需要额外安装 tesseract(Linux/Mac 下用 brew install tesseract)。
运行前还需要配置 OpenAI API Key 或其他模型提供商的密钥,并推荐部署一个 UI-TARS grounding 模型服务(可以通过 Hugging Face Inference Endpoints)。整体来说,对于有一定 Python 编程经验和 API 使用能力的开发者来说,上手难度中等;对于完全没有技术背景的用户,存在一定门槛。
首先,Agent S 会直接操控你的电脑,包括执行任意代码、安装软件、修改配置等。这意味着它既有强大的自动化能力,也有潜在的破坏性风险——尤其是开启 --enable_local_env 选项后,智能体可以在本地执行任意 Python/Bash 代码。官方也明确警告:"仅在可信环境和可信输入下使用此功能"。
其次,当前版本仅支持单显示器环境,多显示器用户需要注意。
第三,依赖商业 API(OpenAI/Anthropic 等),运行成本不可忽视,尤其在处理大量长任务时。
2025 年被业界称为"GUI Agent 元年",Agent S 是这个浪潮中的重要推动力量。它的 S3 版本不仅在 OSWorld 基准上首次超越人类表现,更重要的是验证了"规模化"(scaling)在智能体能力提升中的有效性——当配合 Behavior Best-of-N 的多轨迹策略时,模型性能出现显著跃升,这为后续研究指明了方向。
从 GitHub 数据看,Agent S 目前拥有 11,700+ stars,topics 覆盖了 GUI Agents、Computer Use、CUA 等核心关键词,已成为该领域最受欢迎的标杆项目之一。其代码库 gui-agents 在 PyPI 上的周下载量也持续攀升。
如果你对 AI 自动化、计算机操控智能体或人机协作的前沿方向感兴趣,Agent S 是一个值得深入研究的项目——无论是直接使用、基于其框架二次开发,还是从中学习 GUI Agent 的设计思路。