browser-agent-py
用自然语言控制浏览器,AI 自动完成点击、填表、截图与数据提取
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用自然语言控制浏览器,AI 自动完成点击、填表、截图与数据提取
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你或许有过这样的经历:想要从某个电商网站提取商品价格列表,或者定期监控竞争对手的网页变化,但每次都要手动写 Puppeteer 脚本、调 XPath、处理反爬——光是环境配置就耗掉了半天。Browser Agent 正是为解决这个痛点而生:它让你用自然语言描述任务,AI 自动帮你完成点击、填表、滚动、截图、数据提取,全流程无需写一行代码。
传统的浏览器自动化工具(如 Puppeteer、Selenium)虽然强大,但存在几个根本性问题:门槛高——需要熟悉 DOM 操作、XPath 选择器、异步控制流;维护成本高——网页结构稍有变化,脚本就可能失效;难以规模化——多步骤、动态渲染、登录验证等场景实现复杂。
随着大语言模型的成熟,AI 驱动的浏览器自动化成为了新的方向。Oxylabs 是全球知名的代理和数据采集服务商,旗下的 AI Studio 推出的 Browser Agent 将 LLM 的自然语言理解能力与真实浏览器环境结合,实现了"说人话就能控制浏览器"的体验。
Browser Agent 的工作方式分为三步:接收自然语言指令 → LLM 拆解为浏览器操作序列 → 云端执行并返回结构化结果。用户无需在本地运行浏览器,所有任务在 Oxylabs 云端完成,支持渲染 JavaScript 动态内容、绕过基础反爬机制、模拟真实用户行为。
该工具通过 oxylabs-ai-studio Python SDK 封装,对外暴露简洁的 BrowserAgent.run() 接口,支持自然语言提示词和结构化操作步骤两种控制方式,可输出 JSON、Markdown、HTML、PNG 截图四种格式,并可通过 Schema 实现结构化数据提取。
多格式输出是 Browser Agent 的一大亮点。JSON 模式配合 Schema 可精确定义提取字段(如"游戏名称、平台、评分、价格"),返回完全结构化的数据,可直接接入下游数据管道;Markdown 模式输出易读的表格化内容,适合 AI 工作流;HTML 模式直接返回页面源码;截图模式则输出浏览器视觉内容。
Schema 智能生成功能允许用户用自然语言描述想要提取的字段,系统会自动生成对应的 OpenAPI Schema,无需手动编写 JSON Schema 定义。这一设计大幅降低了结构化提取的使用门槛。
多步骤任务编排通过自然语言提示词实现,例如"打开定价页面,接受 Cookie,提取所有产品名称和价格"。AI 会自动规划操作步骤,在每一步根据页面实际内容动态调整策略,处理弹窗、分页、动态加载等场景。
从 SDK 代码结构来看,Browser Agent 依托 Oxylabs AI Studio 云端平台运行,核心封装在 oxylabs-ai-studio 包中。项目本身不包含本地浏览器引擎或 Puppeteer/Selenium 等依赖,而是通过 RESTful API 与云端 AI 通信。这种架构带来的优势是:无需配置浏览器环境(chromedriver、geckodriver 统统不需要)、跨平台兼容(任何能运行 Python 3.10+ 的环境都可以)、支持全球地理定位(通过 geo_location 参数指定代理位置)。
依赖云端 API 是最显著的局限。所有任务都要经过 Oxylabs 服务器执行,这意味着网络延迟、对 API 可用性的依赖,以及潜在的数据隐私考量——如果你的目标网站含有敏感信息,需要确认 Oxylabs 的数据处理政策。免费额度有限,新用户注册赠送 1000 credits,但实际使用中每个任务消耗的 credits 取决于任务复杂度和输出格式。复杂交互场景受限,涉及验证码、多因素认证、滑动拼图等高级反爬机制时,AI 代理的成功率会明显下降。
Browser Agent 代表了 AI + 数据采集领域的一个趋势:从规则驱动转向意图驱动。过去我们告诉机器"怎么做"(click button #submit),现在我们告诉机器"要什么"(提取所有商品价格),由 AI 自己规划操作路径。这种范式转变将大幅降低自动化技术的使用门槛,让非技术用户也能享受 AI 带来的效率提升。同时,作为企业级数据服务商 Oxylabs 的产品,它也预示着传统爬虫工具正在加速 AI 化转型。
项目速览: Python SDK · 云端执行 · 无需本地浏览器 · 支持 Schema 结构化提取 · 多格式输出(JSON/MD/HTML/PNG) · API Key 认证