openbrowser-ai
让 AI 直接编写 Python 代码操作浏览器,突破传统脚本的脆弱性,支持 15 家 LLM 提供
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 AI 直接编写 Python 代码操作浏览器,突破传统脚本的脆弱性,支持 15 家 LLM 提供
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,你又一次面对一个反爬机制严密的电商网站。IP 被封、验证码弹出、页面结构隔三差五改一次——每一次自动化脚本都在无声崩溃。你开始怀疑:为什么 AI 已经能写代码、理解自然语言,却还是搞不定一个简单的网页操作?
答案藏在大多数 AI 浏览器工具的核心架构里:它们把 AI 当成了一个「听话的点击机器人」,让它逐字逐句地执行「点击按钮 A → 等待 → 输入文本 B → 等待」这种指令序列。一旦页面稍有变化,整个流程就断裂。
而 OpenBrowser 正在从底层改变这个范式。它的核心理念是:让 AI 直接写 Python 代码来操作浏览器,而不是用自然语言描述每一步操作。这听起来只是换了一种交互方式,但实际效果截然不同——代码可以写循环、处理条件分支、调用外部库、记忆中间状态。
浏览器自动化经历了三个阶段。第一阶段是 Selenium/Playwright 时代,用代码精确描述每一步操作,灵活但脆弱。第二阶段是早期 AI 自动化,用 LLM 生成操作指令并逐条执行,理解能力强了,但容错性依然不足。第三阶段就是 OpenBrowser 所代表的 CodeAgent 架构,LLM 编写完整代码片段在持久化命名空间中执行,像 Jupyter Notebook 一样有记忆、可复用。
OpenBrowser 的作者 billy-enrizky 将其定位为「AI browser automation, powered by code」,强调代码生成能力是核心差异化竞争力。项目支持 15 家 LLM 提供商(OpenAI、Anthropic、Google、AWS Bedrock、Azure、Ollama、DeepSeek 等),并深度集成了 Claude Code、Codex、OpenCode 等主流 AI 编程工具,形成了一个完整的 AI + 浏览器自动化开发生态。
从技术架构来看,OpenBrowser 的设计非常清晰,可以分为三层理解:
第一层:浏览器执行引擎。 OpenBrowser 直接与 Chrome DevTools Protocol(CDP)通信,跳过 Playwright 等中间层,实现对浏览器最大程度的精确控制。底层使用 cdp-use 库和 Playwright(Chromium)两种模式,兼顾控制力与兼容性。同时集成 Xvfb(虚拟帧缓冲)+ x11vnc + noVNC 提供完整的 VNC 实时流,让用户在浏览器中看到 AI 的每一步操作。
第二层:Agent 编排层。 基于 LangGraph 构建状态机式的 Agent 编排逻辑,支持多轮推理和决策回溯。系统 prompt 以 Markdown 形式内置(system_prompt.md、system_prompt_flash.md 等变体),可以在不同任务场景下切换——快速响应模式 vs 深度推理模式。代码执行则通过 code_use 模块处理,将 AI 生成的 Python 代码注入持久化命名空间,变量和函数状态跨调用保留。
第三层:集成与扩展层。 项目实现了完整的 MCP(Model Context Protocol)服务器,向 Claude Desktop、Claude Code、Codex、OpenCode 等工具暴露 execute_code 工具,让这些 AI 助手直接调用浏览器自动化能力。此外还有 Claude Code 插件(6 个内置技能:网页爬取、表单填写、端到端测试、页面分析、无障碍审计、文件下载)、OpenClaw CLI 工具、以及一个完整的云端 Web UI(Next.js 前端 + FastAPI 后端 + PostgreSQL 数据库)。
OpenBrowser 的技术选型体现了「工具链组合」的思路,而非重复造轮子。依赖列表中的核心库包括:langgraph + langchain-core(Agent 编排)、playwright(浏览器控制)、cdp-use(CDP 通信)、litellm==1.80.0(统一 LLM 调用)、aiofiles/httpx/websockets(异步 I/O)、pydantic/pydantic-settings(数据验证与配置管理)、boto3(AWS 集成,S3 存储截图和视频)、reportlab(PDF 生成)、modal(可选的 serverless 部署)。语言方面以 Python 为主(核心库),前端使用 Next.js(TypeScript),整体 235 星、MIT 许可。
OpenBrowser 提供了极其丰富的安装方式,满足从个人开发者到企业的不同场景:
本地 CLI 安装(最轻量):支持 curl | sh 一键脚本(macOS/Linux)、PowerShell 一键脚本(Windows)、Homebrew、pip、uv、uvx 零安装运行。本地安装后,通过 openbrowser-ai 命令行工具或 Textual TUI 界面操作,无需 Docker,适合快速验证和日常脚本集成。
Docker 一键部署(推荐生产):项目提供 docker-compose.yml,包含三个服务:PostgreSQL 数据库(数据持久化)、FastAPI 后端(处理 API 请求、VNC websockify、Xvfb 虚拟显示)、Next.js 前端(交互界面)。支持 Xvfb 虚拟帧缓冲,无需图形桌面环境即可运行浏览器。适合团队协作、需要 Web UI 界面的场景。
Claude Code / Codex / OpenCode 插件集成:通过 MCP 协议,将浏览器自动化能力无缝嵌入 AI 编程助手的工作流。这是最有想象力的使用方式——在你写代码的同时,AI 可以自动帮你查文档、截图、填表单。适合开发者深度集成。
云端托管版(商业化):作者还提供了 openbrowser.me 云端服务,包含保存的 Cookie 管理(KMS 加密)、定时任务(EventBridge + SQS)、邮件通知(SNS/SES)等企业级功能,处于 waitlist 阶段。
OpenBrowser 并非银弹,需要理性看待几个问题:
反爬对抗的局限。 2026 年的网站反爬机制已经高度成熟,AI 生成的代码同样会触发 Bot 检测。项目虽然通过 CDP 直接通信尽力降低可检测性,但在面对 Cloudflare、PerimeterX 等高级反爬系统时,成功率仍然不稳定。这是整个 AI 浏览器自动化领域的共同挑战。
稳定性与容错。 CodeAgent 架构让 AI 编写代码执行,带来了灵活性,但也意味着每次执行的代码质量参差不齐。如果 LLM 生成的代码有 bug,整个任务就会失败,用户需要检查 AI 生成的代码并手动修正——这对非技术用户存在门槛。
资源消耗。 Docker 部署中包含完整的 Xvfb + Chromium 环境,内存占用约 4GB,磁盘 2GB。对于只想偶尔使用的轻量场景,略显笨重。
文档体验。 项目 README 非常详尽,但分散在 GitHub、docs.openbrowser.me 和 PyPI 三处,首次上手需要一定的信息整合能力。
2026 年的一个显著趋势是:浏览器正在从「人看网页的工具」转变为「AI 操作网页的控制面板」。OpenAI Operator 和 Anthropic Computer Use 的发布将这一方向推向了主流视野,而 OpenBrowser 则代表了一种开源、可自托管、深度可定制的实现路径。
它的价值不仅在于工具本身,更在于构建了一个开放生态:CodeAgent 架构让 AI 不再只是执行指令,而是拥有编写和修正代码的自主权;MCP 集成让浏览器自动化能力可以被任何 AI 工具调用;LangGraph 编排让复杂多步骤任务有了可靠的状态管理框架。这些设计选择,使 OpenBrowser 成为了 2026 年 AI 浏览器自动化领域最值得关注的技术选型之一。