OpenAdapt
用视觉语言模型让 AI 自动操控电脑桌面的开源流程自动化框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用视觉语言模型让 AI 自动操控电脑桌面的开源流程自动化框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有遇到过这种情况:每天上班第一件事,就是机械地重复同样的操作——打开某个系统、填表、截图、发邮件。这些操作枯燥且耗时,但偏偏必须由人来完成,因为传统自动化工具根本"看不懂"屏幕上的内容。
OpenAdapt 就是来解决这个问题的。它是第一个真正意义上的"AI 优先"流程自动化框架——用大模型(VLM/LMM)代替人类的视觉理解能力,让 AI 不仅能"看见"屏幕上发生了什么,还能"学会"你的操作习惯,然后自动替你执行。

图1:OpenAdaptAI 开源组织头像
传统的 RPA(机器人流程自动化)依赖规则匹配——你必须精确告诉它"点击第3行第5列的按钮"。一旦界面改版,整个流程就废了。这就好比给机器人一张地图,但地图一变,机器人就迷路了。
OpenAdapt 的诞生源自一个朴素的观察:人类操作电脑时,最重要的信息来源是屏幕截图。我们不是靠坐标来点击按钮的,而是靠"看起来是什么样"来判断该点哪里。
基于这个洞察,OpenAdapt 团队(由 Richard Abrich 主导)开发了一套完整的"录制-训练-执行-评估" pipeline:用户演示一遍操作,AI 从中学习策略,然后自动化复现。
OpenAdapt 的工作流分为四个阶段:
运行 openadapt capture start --name my-task 后,系统开始记录你在 GUI 上的所有操作。关键的是,它不只记录"点击了哪里",而是记录完整的观察-动作对(Observation-Action Pair):
这些数据以 JSON/Parquet 格式存储到本地 Demonstration Library 中,作为训练素材。
录制足够多的演示后,运行 openadapt train start --capture my-task --model qwen3vl-2b 启动训练。当前版本支持:
| 模型 | 说明 |
|---|---|
| Qwen VL(推荐) | 阿里通义千问视觉语言模型,2B 参数,v1.2.4 默认 |
| Claude API | Anthropic Claude |
| GPT-4o | OpenAI 多模态模型 |
| Gemini | Google 多模态模型 |
训练过程使用收集的轨迹数据,通过监督学习让模型学会"看到 X 画面时应该执行 Y 操作"。
训练好的策略模型接收到新的屏幕截图,推理出下一步操作,然后通过 openadapt-agent 子包在实际 GUI 中执行这些操作。执行引擎负责将模型输出翻译为真实操作事件。
openadapt eval run 启动基准测试。openadapt-evals 包提供了 Benchmark Adapter,支持:
评估指标包括:任务成功率、平均执行步数、总执行时间。
v1.0+ 版本采用了 Modular Meta-Package Architecture(模块化元包架构),这是整个项目最值得关注的工程设计决策:
openadapt (主包,仅 ~3245 行 CLI 代码)
├── openadapt-capture # 录制引擎:跨平台 GUI 事件捕获
├── openadapt-ml # ML 引擎:Qwen VL 适配器、训练、推理
├── openadapt-evals # 评估系统:Benchmark Adapter、指标计算
├── openadapt-viewer # HTML 可视化:轨迹回放
├── openadapt-grounding # UI 元素定位:提升动作精度
├── openadapt-retrieval # 多模态检索:相似轨迹 Few-shot
├── openadapt-privacy # 隐私清理:PII/PHI 自动脱敏
└── openadapt-agent # 执行引擎:策略→操作翻译
所有子包均可通过 PyPI 独立安装,通过 openadapt[all] 一次性装满所有模块。这种设计带来了几个显著优势:
openadapt[capture] 即可值得注意的是,openadapt 主体仅包含约 3245 行 Python 代码(__init__.py),核心逻辑全部下沉到子包中,主包通过 lazy import 实现"按需拉起",保持了 CLI 的轻量化。
OpenAdapt 的安装体验非常友好:
# 最简安装(仅 CLI)
pip install openadapt
# 图形录制支持
pip install openadapt[capture]
# 完整安装
pip install openadapt[all]
前提条件:Python 3.10+,无 GPU 需求(纯推理),需要 macOS 辅助功能权限(macOS 用户需额外配置 Accessibility 和 Screen Recording 权限)。
虽然没有提供 Docker 镜像或 docker-compose,但 pip install 的方式已经足够简单。对于大多数用户来说,5-10 分钟即可完成安装并录制第一个任务。
openadapt-desktop 子包提供了桌面 GUI 应用(openadapt-tray 系统托盘),但目前处于相对早期阶段。
诚实地讲,OpenAdapt 目前仍面临几个现实挑战:
openadapt[privacy] 并妥善管理数据OpenAdapt 代表着 RPA 领域的一个重要趋势转变:从规则驱动到视觉驱动的自动化。当 AI 能真正"看懂"屏幕时,自动化就不再受限于固定的 UI 结构。
这个方向与 Anthropic 的 Computer Use、OpenAI 的 Operator 以及微软的 Power Automate AI 处于同一条技术路线上。OpenAdapt 作为开源实现,为研究者和企业提供了不受制于特定云平台的自主选择。
如果你对 AI Agent 操控电脑感兴趣,OpenAdapt 是目前最完整、最活跃的开源实现之一,值得深入研究。