GUI-R1
首个将 R1 推理风格与强化学习引入 GUI Agent 的视觉-语言动作模型,仅用 0.02% 数据超越 SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个将 R1 推理风格与强化学习引入 GUI Agent 的视觉-语言动作模型,仅用 0.02% 数据超越 SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你对着一款全新的手机 App 说出「帮我完成这个月的报销」,AI 便能像真人一样自动打开应用、点击报销入口、填写表单、提交审核——全程无需你动手。这不是科幻,而是 GUI-R1 正在努力实现的目标。
近年来,大型视觉语言模型(LVLM)在图像理解领域取得了惊人的突破——它们能识别照片中的物体、读懂图表数据、甚至理解视频内容。然而,当我们把这些「火眼金睛」放到真实的图形用户界面(GUI)环境中,它们的表现却常常令人失望。
问题出在哪里?GUI 交互不仅仅是「看」,更是「做」——模型不仅要理解屏幕上显示的内容,还需要预测正确的点击位置、输入文字内容、选择下拉菜单、处理弹窗。这些动作空间远比文字问答复杂得多。
此前主流方案依赖 Accessibility Tree(无障碍树)或 HTML DOM 等结构化元数据来「绕过」视觉感知,代价是需要应用提供完整的无障碍接口支持,在移动端和桌面应用场景中根本无法通用。2024 年问世的 OS-Atlas 尝试直接做视觉层面的 GUI 操作预测,但在 1300 万条数据上训练后,仍未达到理想效果。
GUI-R1 的核心创新在于将 DeepSeek-R1 的推理链式思维(Chain-of-Thought)与 GRPO(Group Relative Policy Optimization)强化学习算法结合,首次在 GUI Agent 领域实现了统一动作空间的规则化建模(Unified Action Space Rule Modeling)。
具体来说,GUI-R1 采用了 Qwen2.5-VL 作为基座模型——Qwen 系列是目前中文开源生态中性能最强的视觉语言模型之一,具备原生分辨率感知和多语言支持能力。在此基础上,团队定义了三大可验证奖励(Verifiable Rewards):
这三种奖励共同构成了一个可量化的优化目标,让强化学习算法能够直接在像素级别指导模型行为,而无需依赖平台特定的无障碍接口。
更令人惊讶的是数据效率。GUI-R1 仅使用了 3000 条(GUI-R1-3K)精心筛选的高质量数据——仅为 OS-Atlas 的 0.02%——便在 8 个跨平台基准测试上实现了全面超越,覆盖移动端(Android)、桌面端(Windows/Linux/MacOS)和 Web 三大场景。

图1:GUI-R1 在 ScreenSpot Grounding 任务上的性能对比。 即使数据量缩减了 99.98%,GUI-R1 依然超越了基于 1300 万数据训练的 OS-Atlas 基线方法。
代码层面,GUI-R1 的训练模块基于 VERL(Versatile Efficient Reinforcement Learning)框架构建,这是一个由字节跳动开源的高性能 RL 训练框架。VERL 的核心架构包括:
推理阶段则使用 vLLM(Vectorized Large Language Model)作为推理引擎——vLLM 支持 PagedAttention 显存管理和连续批处理,能显著提升推理吞吐量。代码库提供了 guir1/inference/ 目录下 6 种不同平台的推理脚本,分别处理 Android Control、Web GUI Act、GUI Odyssey、OmniAct 和 ScreenSpot 等不同数据集的评测任务。

图3:High-level 任务(意图驱动的动作序列预测)的性能对比。
尽管 GUI-R1 的核心思路优雅,但其部署门槛并不低,这是由其本质——大型视觉语言模型的强化学习训练——所决定的。
硬件需求:训练阶段推荐 8 张 NVIDIA A100/H100 GPU(80GB 显存),每张卡需承载约 30GB+ 的模型权重、优化器状态和梯度;推理阶段至少需要 1 张 GPU(如 RTX 3090),显存需求约 15GB+。
环境依赖:项目提供了完整的 NVIDIA PyTorch 基础镜像(nvcr.io/nvidia/pytorch:24.08-py3),内置 vLLM 0.7.4、FlashAttention-2.7.4、Transformers 4.49+ 等核心依赖,但需要自行准备 Qwen2.5-VL-3B/7B 模型权重(需从 HuggingFace 下载并申请授权)以及 GUI-R1-3K 数据集(~数 GB)。
技能要求:需要熟悉 Ray 分布式训练框架、WandB 实验日志管理、Linux Shell 脚本编写,以及基础的 RL/PPO 算法原理知识。对于只想体验推理效果的开发者,可以直接调用 guir1/inference/ 下已封装好的脚本,但同样需要准备模型权重。
GUI-R1 并非完美,当前版本存在几个值得关注的局限:
1. 数据多样性仍有限:3000 条数据虽效率惊人,但覆盖的平台类型和任务复杂度仍有提升空间。论文中承认,模型在某些罕见 UI 布局和长程任务规划上仍有不足。
2. 动作空间粒度受限:当前的点击坐标预测是连续值回归任务,对于超高分辨率屏幕(如 4K 显示器)和密集 UI(大量小型按钮)场景,坐标预测精度可能成为瓶颈。
3. 缺乏实时交互能力:推理脚本为批处理模式,不支持实时屏幕截图-推理-执行的闭环交互,这意味着距离真正替代人工操作还有一定距离。
4. 基座模型依赖:GUI-R1 强依赖 Qwen2.5-VL 的视觉感知能力,若基座模型在特定 UI 场景下存在感知盲区(如透明按钮、动态加载内容),强化学习也难以弥补。
GUI-R1 的出现代表了 AI Agent 领域一个重要趋势:从依赖结构化元数据的「捷径」走向真正的视觉感知时代。过去几年,业界普遍绕开视觉感知——因为直接处理像素太难、太贵。但 GUI-R1 证明,只要数据足够精、方法足够巧,视觉路线不仅可行,而且效率远超预期。
更值得关注的是其数据效率背后蕴含的哲学:DeepSeek-R1 的 GRPO 算法之所以强大,是因为它教会模型「推理」而非「记忆」。在 GUI 场景中,这意味着模型学到的不是某个特定 App 的操作流程,而是跨平台通用的界面理解与操作规律。这种「元能力」的获得,才是真正通往通用 GUI Agent 的钥匙。
据 arXiv 论文(2504.10458)和项目动态显示,团队已于 2025 年 5 月发布了 800K 超大规模 RL 数据集,并应用 DAPO 算法进一步优化,为社区提供了超越原始 GUI-R1 性能的复现路径。
如果你正在研究多模态 Agent、视觉-语言模型强化学习,或希望打造跨平台的自动化操作工具,GUI-R1 是不容错过的参考实现。