OSWorld
NeurIPS 2024顶会论文,全球首个在真实操作系统中评测AI Agent开放式任务能力的ben
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NeurIPS 2024顶会论文,全球首个在真实操作系统中评测AI Agent开放式任务能力的ben
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你可能见过 AI 在编程竞赛中虐掉人类冠军,在围棋棋盘上走出从未有人见过的妙手,在数学考试里横扫满分——但你有没有想过:如果让 AI 去帮你安装一个 Spotify 音乐软件,它能搞定吗?
这听起来是个再简单不过的任务。双击安装包、点几下「下一步」、完成。可正是这样看似 trivial 的操作,暴露了当前大模型 Agent 与真实人类之间最深的鸿沟。NeurIPS 2024 的一项研究(xlang-ai/OSWorld,2953★)专门针对这个问题给出了系统性的答案:答案是——差距还相当大。人类在这类任务上的成功率是 72.36%,而目前最强的多模态 Agent 只做到了 12.24%。
在此之前,AI Agent 的评测主要在两类环境中进行:网页(WebArena、Mind2Web)和手机界面(AndroidArena)。但这些环境有一个共同的局限性——它们都是「沙盒化」的,Agent 接触不到真实操作系统的全部能力。
试想,一个真正的个人助手需要做什么?安装软件、编辑文档、管理文件、在不同应用之间传递数据……这些都发生在真实的桌面操作系统中,而非浏览器或手机 App。OSWorld 的核心创新在于:它在真实的虚拟机(Ubuntu / Windows / macOS)中运行任务,而不是模拟环境。
这个项目来自 xlang-ai 团队(与 XLang NLP Group 关联),论文发表于 2026 年的 NeurIPS。团队成员包括 Tianbao Xie、Danyang Zhang、Jixuan Chen 等研究者,他们长期关注 LLM Agent 的评测与能力边界问题。
OSWorld 的设计哲学可以用一个类比来理解:它把整个操作系统(OS)封装成了一个 Gymnasium 风格的强化学习环境。
核心模块 DesktopEnv 继承自 gym.Env,暴露三个标准方法:reset() 初始化虚拟机状态,step() 执行 Agent 操作(点击、输入、命令执行),close() 清理资源。开发者只需几行代码就能初始化一个完整的桌面任务环境:
from desktop_env.desktop_env import DesktopEnv
env = DesktopEnv(
provider_name="vmware", # VMware / VirtualBox / Docker / AWS
os_type="Ubuntu", # Ubuntu / Windows / macOS
action_space="pyautogui", # pyautogui / accessibility_tree
)
obs = env.reset(task_config=example)
**状态观测(Observation)**通过两种方式返回给 Agent:截图(RGB 图像)和无障碍树(Accessibility Tree)。截图分辨率越高,Agent 表现越好,这是经过消融实验验证的结论。
动作空间支持多种粒度:基于 PyAutoGUI 的像素级点击/拖拽、基于 PyWin32 的 Windows UI Automation,以及纯命令行的 bash/powershell 操作。Agent 可以混合使用这些动作类型。
任务配置(Task Config)是 OSWorld 的精髓。每个任务是一个 JSON 描述,包含初始状态设置(需要在 VM 中执行的预置命令)、自然语言指令("请帮我安装 Spotify")、以及评估函数。评估函数非常关键——它不是简单的字符串匹配,而是在 VM 中真正执行命令并检查结果,确保任务的完成是通过可验证的 side-effect 来确认的。OSWorld 共提供了 134 个执行类评估函数。
项目支持 VMware Workstation、VirtualBox、Docker 和 AWS 四种虚拟机提供方式。Docker 支持从 2024 年 10 月加入,使得在云端部署评测环境成为可能。macOS 主机因缺乏 KVM 支持,仅支持 VMware 方案。
OSWorld 发布了 369 个跨平台任务 + 43 个 Windows 专属任务,涵盖 Web 应用、桌面应用、文件系统操作和跨应用工作流。评测结果显示:
| 模型/方法 | 成功率 |
|---|---|
| 人类基线 | 72.36% |
| GPT-4o + CoT | ~8% |
| Claude 3.5 Sonnet | ~10% |
| 最佳 Verified 模型 | 12.24% |
两大核心瓶颈被反复验证:
1. GUI 定位(GUI Grounding)问题:Agent 能「看懂」截图,但常常无法准确地将指令映射到屏幕上的正确位置。点击「安装」按钮实际点到了「取消」,这是 60%+ 失败案例的直接原因。
2. 操作知识(Operational Knowledge)缺失:人类用户知道「安装软件要去官网下载 .deb 文件」「解压 zip 压缩包用右键菜单」,但这些常识性知识对 AI 来说是 hard problem。模型会在不必要的地方重复尝试,在关键步骤上直接跳过。
另一个有趣的发现是:轨迹历史(trajectory history)对基于文本的 Agent 有效,但对纯视觉 Agent 无效。这说明语言形式的反思比视觉注意力回溯更可靠。
坦率地说,OSWorld 的部署难度是极高的。官方提供了三种接入方式:
方式一:本地 VMware/VirtualBox(难度最高) 需要 Linux 宿主机 + KVM 虚拟化支持 + 200GB+ 磁盘空间下载 VM 镜像。还需要配置 Google 账号 + GCP 项目 + OAuth2.0 凭证(用于 Google Drive 相关任务)。预计部署时间:2-7 天。
方式二:Docker(难度中等)
Linux 宿主机安装 Docker Engine,通过 provider_name="docker" 接入,支持 Ubuntu 和 Windows 两种 guest OS。镜像预下载后启动较快,但仍需 GPU 资源和大量配置工作。
方式三:公共评测平台(最推荐) 联系作者(tianbaoxiexxx@gmail.com)安排评测会议,提交 Agent 实现后由官方统一跑分,可获得 OSWorld-Verified 认证。这是目前最被推荐的使用方式。
硬件需求:至少 16GB 显存 GPU(论文推荐 RTX 3090 级别),32GB+ 系统内存,200GB+ SSD 存储。
Python 版本:要求 Python >= 3.12,主要依赖 PyTorch、PyAutoGUI、Playwright、OpenCV、Transformers 等。没有 Web UI,完全通过命令行/API 交互。
OSWorld 自身也存在一些局限性值得关注:
1. 虚拟机性能开销:在 VM 中运行 GUI 任务天然比真机慢,单个任务可能需要数分钟。评测 369 个任务的时间成本极高。
2. Google 服务依赖:8 个 Google Drive 相关任务在 IP 变化或网络不稳定时会失败。官方允许跳过这些任务(361/369 也是可接受的评测子集)。
3. 可复现性问题:OSWorld-Verified 2025-07-28 的更新修复了多个社区报告的问题,版本迭代较快,不同时间跑分的结果可能无法直接对比。
4. 评估函数覆盖:虽然有 134 个评估函数,但开放式任务的质量判断仍高度依赖人工定义规则,无法完全自动化。
5. Agent 实现门槛:官方的 Agent 实现接口(mm_agents/agent.py)需要开发者自行实现 PromptAgent 类,熟悉 benchmark 框架才能接入,对新用户不够友好。
OSWorld 的出现填补了「真实操作系统任务评测」这一空白。它证明了当前最强的大模型在开放式 GUI 操作任务上与人类存在巨大差距——12% vs 72%,这个数字既是挑战,也是机会。
从研究趋势看,这个 benchmark 正在推动几个方向的进展:
GUI Agent 微调:如 UI-TARS、Agent-S 等专门针对 GUI 操作优化的小模型正在涌现,OSWorld 是它们的试金石。
多模态架构演进:论文明确指出「更高的截图分辨率带来更好的性能」,这直接影响了对 VLM 输入分辨率的工程决策。
Agent 记忆与规划:轨迹历史有效性的发现,让研究者更关注「让 Agent 学会从历史错误中学习」的机制设计。
跨平台泛化:验证结论显示在 Ubuntu 上训练的 insight 可以迁移到 Windows,这对 Agent 的跨 OS 泛化能力提出了新的研究问题。
如果你在做 AI Agent 研究,OSWorld 几乎是必跑的 benchmark。如果你在做产品,想知道 AI 帮你操作电脑离落地还有多远,这个 72% vs 12% 的数字就是最好的答案。
项目速览