clawdcursor
通过MCP协议让任意AI模型直接操控桌面应用,支持Windows/macOS/Linux,为AI A
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
通过MCP协议让任意AI模型直接操控桌面应用,支持Windows/macOS/Linux,为AI A
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你的AI编程助手不仅能帮你写代码、查文档,还能直接帮你打开终端输入命令、点击IDE的按钮、在浏览器里填表——就像一个远程实习生,有眼睛(屏幕读取),有手(鼠标键盘控制),还有安全意识(危险操作先问你)。这就是 Clawd Cursor 正在做的事:给大语言模型装上真正操控桌面应用的能力,让AI从「顾问」变成「执行者」。
2026年2月正式发布,短短4个月便积累了近400颗GitHub星标,在AI Agent工具类目中上升速度惊人。它不是又一个「套壳GPT」的聊天机器人,而是一个专为AI Agent设计的桌面控制引擎——通过MCP(Model Context Protocol)协议与任何AI模型连接,让模型能够真正「看到」屏幕内容、「摸到」界面元素、「执行」具体操作。
图1:Clawd Cursor — AI桌面控制引擎
开发团队在构建AI Agent时发现了一个普遍痛点:当AI需要操控一个没有API的桌面应用时,现有方案几乎束手无策。GitHub API可以调用,但本地老旧的CRM软件呢?Browser Automation(Playwright/Puppeteer)能做网页自动化,但Word文档、PDF阅读器、IDE插件呢?直接操作文件可以,但很多操作必须通过图形界面完成。
传统AI Agent的工作流通常止步于「生成操作建议」——AI告诉你应该点什么按钮,但实际点击还得人来完成。Clawd Cursor的出现就是为了填补这个「最后一步」的空缺:让AI直接驱动光标和键盘,真正操控任何桌面应用。
项目作者 AmrDab 在项目README中明确表达了一个设计哲学:这是「最后的备选方案」(FALLBACK ONLY)。只有在以下全部失败后才应该使用:
只有四条路都走不通时,Clawd Cursor才登场——但一旦登场,它就是那把打开任意应用的万能钥匙。
Clawd Cursor 最聪明的设计之一是成本感知的感知阶梯(Cheapest-tier-first Perception)。AI想要「看到」屏幕,方式有四种,价格从低到高:
第一层:无障碍树(A11y Tree)——免费
通过操作系统提供的辅助功能API,直接读取窗口的UI元素结构。每个按钮、下拉菜单、输入框都有可访问的名称和句柄(el_NN格式)。这是最便宜、信息最丰富的方式,Clawd Cursor 默认优先使用这一层。
第二层:OCR文字识别——便宜
当无障碍API无法读取某些内容时(如自定义绘制的界面、截图中的文字),使用操作系统级别的OCR引擎识别屏幕上文字。不需要调用视觉大模型,成本极低。
第三层:浏览器DOM——中等
对于Electron应用和WebView2应用,当检测到是WebView环境时,通过Chrome DevTools Protocol(CDP)直接读取DOM结构。这一层由 system.detect_webview 工具自动触发。
第四层:截图+视觉模型——昂贵
作为最后手段,截取屏幕截图并送入视觉语言模型。这是成本最高的感知方式,只在其他三层都无法获取所需信息时才启用。项目通过 obs·vision 标记来管理这一层。
这种分层设计的核心理念:让AI每次感知都选择「够用且最便宜」的方案,而不是一上来就截屏调用GPT-4V。在一个复杂任务的数百次感知循环中,这能节省惊人的成本。
图2:Clawd Cursor 感知层架构 — 从A11y树到截图的四层阶梯
感知到屏幕内容后,下一步是「动手」。Clawd Cursor 提供了一套精心设计的工具系统,包含98个精细化工具 + 7个复合聚合器,覆盖了桌面操作的各种场景:
界面交互类:click、double_click、right_click、drag、type、press_key、scroll、hover、focus_window……这些是最基础的操作单元。
应用控制类:open_app、close_app、get_window_info、list_windows、get_active_window……管理应用的启动、关闭和窗口状态。
浏览器增强类(通过CDP):browser.navigate、browser.click、browser.type、browser.get_dom、browser.screenshot……对Electron/WebView应用提供原生级别的浏览器控制。
批量操作类:batch —— 允许将多个操作组合成一个原子事务,要么全部成功,要么全部回滚。这对于需要执行一系列有依赖关系的操作至关重要(比如:先打开文件 → 输入内容 → 保存 → 关闭)。
剧本编排类(Playbooks):extract.compose(从网页提取结构化数据)、find.replace(批量查找替换)等高阶工具。
所有工具的执行都必须经过单一安全门(Single Safety Gate)—— safety.evaluate() 函数。这是项目架构的核心约束:没有任何工具可以绕过安全评估直接执行。安全门将操作分为三个等级:
这种「感知-决策-执行-验证」的闭环设计,让AI的桌面操作变得可控而非失控。
图3:Clawd Cursor 工作流总览
桌面自动化的地狱级难题在于跨平台兼容性。每个操作系统的辅助功能API、权限模型、输入法交互方式都截然不同。Clawd Cursor 通过 PlatformAdapter 抽象层解决了这个问题——平台代码只需要与这个适配器交互,而不是直接调用系统API。
macOS:需要借助Swift编写的原生助手(native/Sources/),配合Accessibility权限。用户首次使用需要通过 clawdcursor grant 命令手动授权(macOS的安全限制无法绕过)。
Windows:通过 nut-js 库处理鼠标键盘操作,配合Win32 API读取窗口信息。
Linux/X11:读取X11无障碍属性,与macOS类似的树状结构。
Linux/Wayland:通过screenshot+OCR兜底(Wayland的无障碍API尚不成熟),并在 src/platform/wayland-backend.ts 中实现了专门的后端处理。
项目还内置了原生Swift助手(ScreenshotHelper、PermissionCheck、ClawdCursorHost),用于macOS上的敏感操作,体现了作者对平台安全模型的尊重。
Clawd Cursor 通过 Model Context Protocol(MCP) 与AI模型连接,而不是传统的REST API或WebSocket自定义协议。这是一个非常聪明的选择——MCP已经成为AI Agent工具调用的事实标准,Anthropic Claude Code、Cursor、Windsurf、Zed等主流编辑器都已原生支持。
MCP的核心优势在于工具发现的标准化:AI模型不需要预先知道Clawd Cursor有哪些工具,只需要按照MCP的schema接收工具列表,每个工具的描述、参数格式都已结构化定义。项目甚至提供了 clawdcursor mcp --tools 命令来列出所有可用工具。
Clawd Cursor 支持两种MCP传输方式:
3847 端口启动HTTP MCP服务器,适合远程Agent或无头运行场景另外,项目还提供了内置薄Agent循环(clawdcursor agent):如果AI模型本身没有推理能力,可以用项目自带的thin loop配合Claude/GPT/Gemini等模型,让Clawd Cursor变成一个独立运行的桌面Agent。
图4:Clawd Cursor 完整架构 — 从LLM到桌面操作的全链路
安装过程对非技术用户来说稍显繁琐,但对开发者而言非常直接。核心依赖只有两样:Node.js >= 20 和对应平台的辅助功能权限。
macOS用户需要运行 clawdcursor grant 启动交互式权限授予向导,然后在「系统设置 → 隐私与安全性 → 辅助功能」中手动添加Clawd Cursor并开启权限。这是macOS的安全限制,无法绕过。
Windows和Linux用户权限授予流程相对简单,但仍需手动确认。
安装完成后,通过 clawdcursor doctor 可以一键诊断环境配置状态(权限、AI模型凭证等),这对排查问题非常有帮助。项目还提供了Claude Code的一键插件安装方式,对使用Claude Code的开发者来说体验接近无缝。
CLI命令一览:
clawdcursor consent # 管理桌面控制同意权限
clawdcursor grant # 授予macOS辅助功能权限
clawdcursor doctor # AI模型配置诊断
clawdcursor status # 环境就绪状态检查
clawdcursor mcp # stdio MCP服务器(编辑器集成)
clawdcursor agent # HTTP MCP + 内置Agent循环
clawdcursor stop # 停止所有运行模式
图5:Clawd Cursor 实际运行截图
从代码仓库来看,这是一个工程化程度非常高的项目:TypeScript编写,1000+单元测试(Vitest框架),完整的类型覆盖,ESLint代码规范检查。包管理使用npm,Node.js >= 20引擎要求明确。
项目采用模块化插件架构,核心决策点只有两个:PlatformAdapter 是平台代码的唯一入口,safety.evaluate() 是所有工具执行的唯一路径。这两个「缝合点」设计让代码意图清晰,也便于后续扩展新平台或新工具。
MCP Server配置通过 server.json 定义,符合MCP官方schema,并提供了完整的snapshot测试(test:mcp-schema-snapshot)确保兼容性不退化。这种对标准协议的严格遵守,让项目能够随MCP生态一起演进。
内置了 cost-meter(成本计量)和 correlation(可观测性日志)模块,帮助用户在AI Agent执行过程中追踪操作成本和调用链路——这是商业化部署的必要基础设施。
尽管设计精良,Clawd Cursor 仍有不可忽视的局限:
平台限制:macOS上需要辅助功能权限,但沙盒应用(App Store下载)即使授予权限也无法控制。Windows的UAC(用户账户控制)也会阻断某些高权限操作。
性能瓶颈:每次感知-执行循环都涉及进程间通信(Node.js ↔ 原生助手/操作系统API),对于需要极高频率操作的场景(如实时视频游戏),响应延迟可能无法接受。
安全权衡:安全门设计虽然严密,但「Confirm」级别的操作依赖用户及时响应。如果用户在长时间任务中离开电脑,Agent可能陷入等待状态,无法实现真正的「提交后离开」式自动化。
AI模型依赖:Clawd Cursor 本身只是执行引擎,真正的「智能」来自所连接的LLM。模型对无障碍树结构的理解能力、推理规划能力直接决定了任务成功率。当前版本的98个工具虽已相当丰富,但仍无法覆盖所有桌面操作场景。
「最后备选」的设计哲学本身也是一种局限:它明确将API/CLI/文件操作/Slack Automation放在优先级更高的位置,这意味着如果上游服务提供了更好的方案,Clawd Cursor就不应该被使用。对于某些场景,这反而增加了开发者的选择困难。
Clawd Cursor 的出现,折射出一个更大的趋势:AI Agent正在从「对话」向「行动」演进。2024-2025年的主流Agent产品(AutoGPT、AgentGPT等)主要停留在「生成建议、描述操作」层面;而2026年的新一代工具开始真正具备「执行操作、验证结果」的能力。
在GitHub的topics标签中,computer-use、desktop-automation、gui-automation 正在成为新的热门方向。Anthropic的Claude Computer Use、OpenAI的Operator、Browser-use等项目都在探索类似的路径——让AI模型直接操控计算机。Clawd Cursor 的差异化在于:它专注桌面应用(而非浏览器),支持任意GUI应用(而非Web应用),并通过MCP实现了与主流AI生态的无缝对接。
作者选择在MCP生态中深耕,而非另起炉灶建立自己的Agent协议,是务实的技术判断。随着MCP成为行业标准(已被Anthropic、Sourcegraph、Cline等广泛采用),Clawd Cursor 有望成为MCP生态中桌面控制的事实标准层。
从增长曲线来看,4个月近400 stars、58 forks、0 open issues(维护状态极佳)的数据,表明项目正在健康快速地成长。其TypeScript-first的设计、详尽的测试套件、遵守semver的版本管理,都预示着它不会是一个「昙花一现」的实验性项目。
如果你正在构建需要操控桌面应用的AI Agent,Clawd Cursor 值得认真评估。它也许不是最优雅的方案,但在「让AI真正动手做事」这个目标上,它目前是开源领域最完整、最认真的选择之一。