Agentic-AI-Computer
masfaatanveer/Agentic-AI-Computer加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨三点,你被一个重复性任务叫醒——需要手动把 300 份 PDF 里的表格数据录入 Excel。这活儿枯燥、耗时、毫无技术含量,偏偏又必须由人操作。
如果这时候有一个"虚拟员工",能像你一样盯着屏幕、点击按钮、输入文字,完全自主完成这一切,而你就躺着喝咖啡等它做完——是不是很美好?
这就是 Agentic AI Computer(Self-Operating Computer)要解决的问题。
想象一下,你给 AI 下了一个指令:"帮我打开浏览器,去 GitHub 搜索 Self-Operating Computer,给这个项目点个 star。"
项目的工作流程是这样的:
第一步:看屏幕。 通过截图(pyscreenshot / mss)捕获当前屏幕画面,把图像转成 base64 编码发给多模态 AI 模型。
第二步:让 AI 思考。 把截图 + 你的指令一起发给 GPT-4o(或 Claude 3 / Gemini / LLaVA),让 AI 理解当前屏幕上有什么、该做什么。
第三步:执行操作。 AI 给出操作指令(点击坐标、输入文字、按键),pyautogui 负责在真实系统上执行这些动作。
第四步:循环迭代。 截图 → 分析 → 执行 → 再截图……直到任务完成。
整个过程完全模拟人类使用电脑的方式——看到屏幕、做出决策、执行动作,区别只是"手"变成了 pyautogui。
光有截图还不够——AI 知道"这个区域是搜索框",但它未必知道搜索框的精确像素坐标。
项目通过两种方式解决这个问题:
默认使用的就是 GPT-4-with-OCR 模式,开箱即用。
除了输入文字指令,项目还支持 --voice 模式。你对着麦克风说"打开 VS Code,写一个 Hello World",AI 听到你的语音指令后自动执行。
底层用 Deepgram API 做语音转文字(文本再转语音也有),支持双手解放的操作场景。
项目不绑定单一 AI 提供商,目前已支持:
| 模型 | 特点 |
|---|---|
| GPT-4o | OpenAI 主力多模态模型,效果最佳 |
| Claude 3 | Anthropic 模型,推理能力强 |
| Gemini Pro Vision | Google 模型,免费额度友好 |
| LLaVA(Ollama) | 本地运行,完全免费,无需 API Key |
Ollama 本地模式特别有意思——完全离线运行,数据不上传到任何云端,适合隐私敏感场景。
安装确实简单:
pip install self-operating-computer-automation
operate
一行命令装好,输入 API Key 就能跑。
但有几个坑需要注意:
部署难度评为"中等"——比大多数开源 AI 项目简单,但没有 Docker 一键部署的兜底。
除了命令行,项目还自带一个 Streamlit Web 界面(app.py),输入 API Key、点"Start"就能用。对于不想折腾命令行的用户,这个界面降低了使用门槛。
AI 执行错误难以恢复。 如果 AI 误点了某个按钮(比如误触"删除"),当前版本没有回滚机制,可能会导致不可逆操作。
长任务稳定性存疑。 对于需要 50+ 步操作的任务,误差会不断累积,正确率下降明显。
安全性考量。 项目被设计为"完全自主运行",意味着 AI 有权限操控你电脑上的所有应用。在正式环境中使用需要谨慎,最好在虚拟机或沙箱中测试。
版权争议。 这个项目 fork 自 OthersideAI/self-operating-computer(2023年11月发布,公认的"计算机自主操作"领域先驱),作者署名信息保留了原始项目标注,但主要的开发工作由 masfaatanveer 完成。
2023年11月 OthersideAI 发布 Self-Operating Computer 时,业界普遍认为这是 AI Agent 领域的一个有趣尝试,但实用性存疑。不到两年,Anthropic 的 Claude 3.5、OpenAI 的 Computer Use、微软的 Windows Agent 纷纷跟进,"让 AI 操控电脑"已经成为头部科技公司的标配能力。
这个开源项目的价值在于:降低了研究门槛——任何人都可以用几百行代码 + 一个 API Key,亲身体验"视觉感知 + 决策推理 + 自动化执行"的完整 Agent 闭环,而不需要阅读 Paper 或者搭建复杂的系统。
如果你在构建 AI Agent、RPA(机器人流程自动化)或智能助手类产品,这个项目是非常值得研究的参考实现。

图注:Self-Operating Computer 工作流程:屏幕截图 → 多模态 AI 分析 → 决策生成 → pyautogui 执行操作,形成感知-决策-执行的完整闭环。