web-ui
用自然语言指挥 AI Agent 控制浏览器,一键完成网页自动化任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用自然语言指挥 AI Agent 控制浏览器,一键完成网页自动化任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你可以像指挥一位不知疲倦的数字助手一样,用自然语言"命令"浏览器自动完成复杂任务——搜索信息、填表、爬取数据、批量处理网页操作——而整个过程你只需要在网页界面上点点按钮。这正是 Browser Use Web UI 带来的体验。
Browser Use Web UI 是 browser-use 核心库的官方图形化界面,托管于 GitHub 仓库 browser-use/web-ui,截至目前已获得超过 16,000 颗 Stars 和 2,700+ 次 Fork,是 AI 浏览器自动化领域最受关注的开源项目之一。GitHub 主题标签涵盖 ai-agent、browser-automation、browser-use-box 和 cloud-browser,充分反映了它的定位:让 AI 代理能够像人类一样操控浏览器。

图1:Browser Use Web UI 主界面(来源:项目官方仓库 assets/web-ui.png)
Browser Use Web UI 由开发者 @WarmShao 发起,最初版本于 2025 年 1 月初发布,旨在为 browser-use 核心 Python 库提供一款易用的 Gradio 网页界面。它将浏览器自动化从需要编写代码的程序员专属能力,转变为任何人都可以通过自然语言指令操作的傻瓜式工具。
首批版本即支持多款主流大语言模型(LLM):OpenAI GPT 系列、Google Gemini、Anthropic Claude、DeepSeek、Ollama(本地模型)等,并引入了自定义浏览器功能——用户可以复用自己浏览器中已登录的会话,免去反复登录的烦恼,同时支持高清屏幕录制。
1月下旬,@vvincent1234 贡献了 DeepSeek-r1 推理模型集成,@richard-devbot 贡献了全新设计的 Web UI 界面。值得注意的是,通过 Ollama 还能在本地运行 DeepSeek-r1(推荐 14B 以上模型),实现完全本地化的 AI 浏览器代理。
v1.7 是一个里程碑式的重要更新。团队发现并修复了一个高危安全漏洞:配置保存机制使用了 Python pickle 序列化,存在任意代码执行风险。修复方案是将配置迁移至 JSON 格式。这是一个影响所有用户的安全补丁,项目方紧急呼吁所有用户立即更新。
v2.0 引入了 MCP(Model Context Protocol)服务器支持,允许 AI 代理与外部工具和服务进行交互,极大扩展了代理的能力边界。同时推出了全新的对话式 Web UI,支持在任务执行过程中进行人工干预。DeepResearch 代理也得到了增强,获得了 MCP 支持。
v3.0 带来了最激进的变化:项目宣布推出全新的 Chrome 扩展 VibeSurf,完全重建为开源 Agentic AI 浏览器。这一决策背后的核心逻辑是:传统 Gradio Web UI 受限于浏览器窗口切换、多标签页同时查看等技术瓶颈,无法真正模拟"人肉操作浏览器"的体验。VibeSurf 基于 cdp-use(替代 Playwright)提供底层 CDP 控制,支持并行多代理(多个 Agent 同时在不同标签页运行)、深度研究、智能爬取和内容摘要等能力,一句 uv pip install vibesurf && vibesurf 即可启动。
Browser Use Web UI 的代码采用清晰的分层架构:
src/
├── agent/ # AI 代理层
│ ├── browser_use/ # 核心浏览器代理(继承自 browser-use 库的 Agent 类)
│ └── deep_research/ # 深度研究代理
├── browser/ # 浏览器控制层
│ ├── custom_browser.py # 自定义浏览器封装
│ └── custom_context.py # 浏览器上下文管理
├── controller/ # 控制器层
│ └── custom_controller.py # 自定义控制器
├── webui/ # 前端展示层(Gradio)
│ ├── interface.py # UI 布局与主题管理
│ ├── webui_manager.py # UI 状态与组件管理
│ └── components/ # UI 组件(Agent设置、Browser设置、Agent执行等Tab)
└── utils/ # 工具函数
| 层级 | 技术 | 说明 |
|---|---|---|
| 前端 UI | Gradio 5.27.0 | 低代码 Web 界面框架 |
| 代理框架 | browser-use 0.1.48 | 核心 AI 浏览器自动化库 |
| Agent编排 | langgraph 0.3.34 | 基于图的代理工作流编排 |
| LLM集成 | langchain-community / langchain-mistralai / langchain-ibm | 多后端 LLM 统一接口 |
| 浏览器引擎 | Playwright | 跨浏览器自动化 |
| 配置管理 | python-dotenv | 环境变量驱动配置 |
以 BrowserUseAgent 为例,核心执行流程基于 browser-use 库的 Agent 基类构建:
function_calling、raw 或 NoneWebuiManager 是整个前端的核心调度器,负责:管理 Gradio 组件与内部状态的双向绑定;生命周期管理(初始化/销毁浏览器、代理实例);异步任务管理(启动/暂停/恢复 Agent 执行);配置的持久化(保存/加载 JSON 格式配置)。
深度研究代理是一个更高级的 Agent 子类,它不依赖外部搜索 API,而是通过多 Agent 协作——多个 AI 代理并行工作,协同搜集和综合信息源,最终输出结构化研究报告。支持参数调节:最大搜索迭代次数、每轮并行查询数等。官方推荐使用 gemini-2.0-flash-thinking-exp 或 deepseek-r1 等推理能力强的模型。
.env.example 暴露了超过 15 种 LLM 配置端点,覆盖国际主流(OpenAI GPT-4o、Anthropic Claude 3.5、Google Gemini、Mistral)、中国特供(DeepSeek、阿里通义、Moonshot Kimi、SiliconFlow、IBM WatsonX)、本地部署(Ollama、Unbound)以及 xAI Grok。每种 LLM 通过各自的 langchain-* 适配器集成到统一架构中,切换成本极低。
git clone https://github.com/browser-use/web-ui.git
cd web-ui
cp .env.example .env
# 填写 .env 中的 LLM API Key
docker compose up --build
启动后两个入口:
http://localhost:7788http://localhost:6080/vnc.html,密码 youvncpasswordARM64 架构(Apple Silicon Mac)需指定:TARGETPLATFORM=linux/arm64 docker compose up --build
uv venv --python 3.11 && source .venv/bin/activateuv pip install -r requirements.txtplaywright install chromium --with-depspython webui.py --ip 127.0.0.1 --port 7788| 指标 | 需求 |
|---|---|
| CPU | 任意主流处理器 |
| 内存 | 4 GB+ |
| GPU | 不需要(LLM 调用走 API,浏览器自动化在 CPU 上运行) |
| 磁盘 | 2 GB |
| 预估部署时间 | 10 分钟(Docker 方式) |
Browser Use 代表了 AI Agent 从"纯文本对话"向"具身行动"演进的关键一步。传统 LLM 只能处理文字,而浏览器是互联网信息的主要载体——能操作浏览器,AI 就能真正替代人类完成大量数字劳动:
从 Gradio Web UI 转向 Chrome 扩展 VibeSurf,是一次深刻的产品形态进化。Chrome 扩展天然解决了两个关键问题:
这次转型也标志着 browser-use 项目从"开源工具"向"产品化平台"的野心升级。
Browser Use Web UI 将 AI 浏览器自动化从专业编程领域带入普通用户的指尖。它以 Gradio 为载体,以 browser-use 核心引擎为大脑,以 Playwright 为双手,构建了一套完整的"AI 控制浏览器"解决方案。从 2025 年 1 月诞生到 v3.0 的 VibeSurf 转型,项目经历了快速迭代、安全淬炼和战略升级,已成为 AI Agent 落地实践的标杆案例。对于 AI 爱好者,它是了解 Agent 能力的绝佳入口;对于 AI 开发者,它是快速构建浏览器自动化应用的高效脚手架。