browser-use
让AI Agent像人一样操控浏览器的开源框架,GitHub超95K星
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让AI Agent像人一样操控浏览器的开源框架,GitHub超95K星
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景: 你对AI说"帮我把这份简历投递到Boss直聘上所有Python开发岗位",然后AI自动打开浏览器、搜索职位、填写表单、上传简历——整个过程你只需躺平喝咖啡。这不是科幻,而是 Browser Use 正在实现的事。
Browser Use 是一个开源的 AI Agent 浏览器自动化框架,GitHub 超过 95,000 颗星,Python AI 领域顶流。项目由瑞士苏黎世和美国旧金山的团队开发(Gregor Zunic 等核心贡献者),MIT 协议完全开源。
一句话概括: 给 AI Agent 装上"眼睛"和"手指",让大语言模型能够像人一样操控真实网页。
大语言模型天生有个致命短板——看不见网页。传统方案要么靠爬虫API抓静态数据(无法处理动态渲染),要么用规则脚本硬编码(换个网站就废了)。
Browser Use 的核心理念是:让AI通过视觉理解网页 DOM 结构,再用 Actions(点击、输入、滚动)操控网页。其 benchmark 显示,自研的 ChatBrowserUse 模型在 100 项真实浏览器任务中成功率比普通 GPT-4 高出 3-5 倍。
| 模块 | 职责 | 技术亮点 |
|---|---|---|
| Agent | 任务规划与决策 | LLM 驱动,支持 OpenAI/Google/Anthropic/Ollama |
| Browser | 浏览器生命周期 | 基于 Playwright/CDP,支持本地/远程/云端 |
| Controller | 动作执行器 | 将 LLM 决策翻译为具体操作 |
| DOM/Views | 页面结构解析 | 将网页转换为 LLM 可理解表示 |
| MCP | 扩展工具集 | 模型上下文协议支持 |
依赖生态: OpenAI、Google Generative AI、Anthropic、Groq、Ollama(本地)、Playwright、CDP、Pydantic v2、MCP。
自动填表 & 批量投递——只需描述任务,Agent 自动完成搜索→筛选→填写→提交。官方示例 apply_to_job.py 展示了完整实现。
购物 & 比价自动化——将购物清单交给 Agent,自动登录 Instacart 等平台完成采购。
信息聚合 & 研究辅助——让 Agent 浏览多个竞品官网,自动提取结构化信息,输出报告。比传统爬虫灵活得多。
个人助手——配合持久化存储,构建具备长期记忆的网页助手,处理重复性后台管理任务。
本地安装(推荐 uv):
uv init && uv add browser-use
uvx browser-use install
# 配置 .env: BROWSER_USE_API_KEY=你的密钥
Docker 一键部署:
git clone https://github.com/browser-use/browser-use.git
cd browser-use && docker build . -t browseruse && docker run browseruse
快速模板:
uvx browser-use init --template default # 最小化
uvx browser-use init --template advanced # 全功能
Claude Code 集成: 支持 AI 编程工具直接调用浏览器自动化能力。
95K ⭐ 背后反映了一个明确趋势:AI Agent 正从"纯文本对话"向"真实世界操作"演进。Browser Use 让 AI 真正接管"在网页上完成任务"这一高频场景,涵盖招聘投递、电商运营、市场研究、客服自动化等广阔市场。
随着多模态模型进一步提升(更强视觉理解 + 更长上下文窗口),Browser Use 类工具的能力上限还将继续突破。
Browser Use 核心团队,项目地址:github.com/browser-use/browser-use