OSWorld-G
NeurIPS 2025 Spotlight:通过 UI 分解与合成技术,让小型视觉语言模型精准定位
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NeurIPS 2025 Spotlight:通过 UI 分解与合成技术,让小型视觉语言模型精准定位
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否见过这样的场景——一个 AI 助手信誓旦旦要帮你填表,结果点了屏幕右上角的关闭键,把整个页面关掉了?或者让它在浏览器里搜索,结果点击了广告链接?这种"界面理解错位"的问题,正是 GUI Grounding(图形界面定位) 的核心挑战:如何让 AI 准确理解自然语言指令,并精准地映射到屏幕上的具体 UI 元素位置。
OSWorld-G 正是为解决这一难题而生——它是 xlang-ai 团队在 NeurIPS 2025 发表的 Spotlight 论文"Scaling Computer-Use Grounding via UI Decomposition and Synthesis"的核心项目,包含基准测试、数据集训练管线以及两款轻量级模型 Jedi-3B 和 Jedi-7B。

图1:OSWorld-G 项目概览(来源:GitHub 官方仓库)
GUI Grounding 需要模型同时具备三种能力:软件常识(理解图标含义、组件功能)、布局理解(理解侧边栏位置、面板层级)和细粒度组件操控(精确点击滑块、在字符级别选中文本)。传统方案要么依赖闭源大模型(如 Claude Computer Use),要么模型太大无法本地部署,在实际应用中存在效率与精度的双重瓶颈。
xlang-ai 团队提出的核心思路是 UI 分解与合成(UI Decomposition and Synthesis):将复杂的 GUI 任务拆解为可独立处理的小单元,再通过大规模合成数据进行训练,从而实现高效且精准的界面理解。
Jedi 是基于 Qwen2.5-VL 架构训练的多尺度 VLM(视觉语言模型),提供了 3B 和 7B 两个版本。Jedi 的核心创新在于通过 Jedi Dataset(400万样本) 进行训练,该数据集由图标数据(dataset/icon)、文档/表格/演示文稿的真实数据增强(dataset/component_handcraft)以及布局数据(dataset/layout)三部分构成,覆盖了移动端、Web 端和桌面端多种场景。
Jedi-3B 版本的推荐显存仅为 6GB+,在消费级 GPU 上即可运行,极大降低了研究门槛。相比之下,Jedi-7B 需要约 14GB 显存,适合有更高精度需求的场景。项目在 demo.py 中提供了完整的使用示例,基于 vLLM 高效推理引擎加载模型,通过 agent_function_call.py 中定义的 MobileUse 工具类与设备交互。
from vllm import LLM, SamplingParams
from agent_function_call import ComputerUse
model_path = "xlangai/Jedi-3B-1080p" # 或 Jedi-7B
llm = LLM(model=model_path)

图2:Jedi 模型的点击位置可视化(来源:GitHub 官方仓库)——绿色圆圈标注了模型预测的点击位置,验证了其精确定位 UI 元素的能力。
OSWorld-G 基准测试包含 564 个精心标注的样本,涵盖文本匹配、元素识别、布局理解和精确操控四类任务类型。评估脚本(evaluation 目录)支持与多个主流模型的对比评测,包括 Gemini、Qwen2.5-VL 等,并提供了多种评估脚本以适配不同的模型框架。
值得注意的是,团队公开了两版指令集:原始版 OSWorld-G.json 和精炼版 OSWorld-G_refined.json。精炼版去除了需要额外领域知识的任务,专注于纯粹的界面定位挑战,使评估更加纯粹、更具对比性。
论文实验数据显示,接入 Jedi-3B 后,基础模型在 OSWorld 任务上的成功率从 23% 跃升至 51%,实现了超过 2 倍的性能提升,在 ScreenSpot-v2 和 ScreenSpot-Pro 等多个基准上也刷新了 SOTA。
项目推荐使用 Conda 管理环境,Python 版本需要 >= 3.9。核心依赖包括 transformers、torch、vllm、qwen-agent 等主流 ML 库。需要注意的是,当前项目没有提供 Docker 支持,也没有 Web UI 界面,部署需要一定手动配置——但安装流程清晰,官方 README 提供了分步骤指引,有 ML 环境经验的研究人员可在 30 分钟内完成环境搭建。
硬件方面,必须配备 NVIDIA GPU(CUDA 支持),显存需求视模型大小而定。模型权重托管在 HuggingFace(xlangai/Jedi-3B-1080p、xlangai/Jedi-7B-1080p),可通过 huggingface-hub 自动下载。
需要坦诚指出的是,OSWorld-G 当前版本仅覆盖英文界面环境,对于中文 GUI 场景的支持有限。此外,benchmark 数据集较大(OSWorld-G.json 约 272KB),本地复现完整评估需要一定的存储和计算资源。项目缺乏 Docker 一键部署方案,对于希望快速试用而非深入研究的用户存在一定门槛。
OSWorld-G 的发布标志着 GUI Agent 领域从「能用大模型点屏幕」向「小模型精准点对位置」的范式转变。Jedi-3B 的出现意味着高精度 GUI 定位不再是超大模型的专利,3B 级别模型已足以支撑复杂的界面交互任务。这一趋势将加速 AI 桌面助手、自动化测试工具、RPA(机器人流程自动化)等应用场景的落地。
同时,"UI 分解与合成"的训练范式为多模态模型的细粒度视觉理解提供了新的训练思路,预计将影响后续 GUI Agent 基准和模型的设计方向。
本报告基于 NeurIPS 2025 Spotlight 论文及 GitHub 官方仓库信息生成。模型权重请从 HuggingFace 下载:Jedi-3B (xlangai/Jedi-3B-1080p),Jedi-7B (xlangai/Jedi-7B-1080p)。