ai-scraper-py
LLM 自然语言驱动的网页结构化数据提取工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
LLM 自然语言驱动的网页结构化数据提取工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是一名数据分析师,公司要求你从某电商平台抓取 5000 个商品的名称、价格、评分和折扣信息。传统方案需要你打开浏览器开发者工具,分析网页 DOM 结构,找出每个字段对应的 CSS 选择器或 XPath——然后祈祷网站不改版,因为一旦改版,你的爬虫就变成一堆废铜烂铁。
更让人头疼的是,如今大量网站采用 React、Vue 等前端框架构建,数据由 JavaScript 动态渲染,传统 HTTP 请求根本拿不到内容。你不得不引入 Selenium 或 Playwright,配置浏览器驱动,处理各种反爬机制,整个过程可能需要花上几天时间。
Oxylabs AI-Scraper 正是为解决这个痛点而生的。
Oxylabs 是一家成立于 2015 年的企业级网页数据采集服务商,总部位于立陶宛,专注于提供住宅代理、数据中心代理以及各类网页抓取 API。其客户覆盖电子商务、市场研究、金融分析等多个行业领域。公司在行业内的定位属于中高端商业数据服务提供商,与 Bright Data、ScrapingBee 等并列为主流爬虫 API 服务商。
AI-Scraper 是 Oxylabs 在 2024 年推出的一项实验性功能,依托 Oxylabs AI Studio 平台对外提供。其核心思路是:将 LLM 的自然语言理解能力融入网页抓取流程,让用户用"人话"描述需求,由 AI 自动完成页面理解和数据提取。
AI-Scraper 的使用流程极度简化,仅需四步:
底层逻辑方面,AI-Scraper 并不在本机运行爬虫代码。用户通过 pip 安装 oxylabs-ai-studio SDK 后,所有请求实际发送至 Oxylabs 云端服务器。云端服务使用 LLM 解析页面 DOM,理解语义后按用户描述提取数据,最后将结构化结果返回本地。整个过程对用户屏蔽了 CSS 选择器、XPath、JavaScript 渲染等底层细节。
AI-Scraper 提供一个独特的 generate_schema() 方法,可以根据用户的自然语言 prompt 自动推断生成 OpenAPI Schema。例如:
schema = scraper.generate_schema(prompt="提取游戏标题、平台、开发商、价格和类型(数组)")
生成的 Schema 可直接用于后续的 scrape() 调用,确保输出 JSON 结构完全符合预期。
通过 render_javascript=True,AI-Scraper 可以处理 SPA(单页应用)等需要 JavaScript 渲染的内容。geo_location 参数支持指定代理地理位置(如 geo_location="US"),对于需要特定地区内容的场景非常实用。
pip install oxylabs-ai-studio
要求 Python 3.10 及以上版本。
Python SDK 提供了 AiScraper 类,封装了所有 API 调用逻辑:
AiScraper(api_key="..."):初始化,传入 Oxylabs AI Studio API Key。scraper.generate_schema(prompt="..."):根据 prompt 生成 OpenAPI Schema。scraper.scrape(url, output_format, schema, render_javascript, geo_location):执行抓取。值得注意的是,本 GitHub 仓库(oxylabs/ai-scraper-py)本身不包含任何代码文件,仅有 README.md 作为文档入口。实际的 SDK 实现封装在 PyPI 包 oxylabs-ai-studio 中。因此,仓库本身更像是一个产品入口页,而非一个可独立部署的开源项目。
| 格式 | 适用场景 | 特点 |
|---|---|---|
| JSON | 程序自动化、数据管道 | 结构化、可直接 JSON.parse |
| Markdown | 人工阅读、AI workflow | 可读性强,便于嵌入 LLM Prompt |
AI-Scraper 的上手门槛极低,具备 Python 基础即可使用。不需要了解爬虫原理、CSS 选择器、代理配置或浏览器自动化工具。
定价方面,Oxylabs AI Studio 提供免费试用额度(注册送 1000 Credits),后续按量付费。付费计划从 $12/月起(约 3000 Credits),支持每秒 1 个请求。对于个人开发者和小型项目而言,试水成本几乎为零。
但需要注意,AI-Scraper 是一个完全闭源的商业云服务。所有抓取逻辑、数据处理和 LLM 推理都在 Oxylabs 服务器端进行,用户无法查看模型如何理解页面,也没有办法私有化部署。这对于有数据安全合规要求(如 GDPR、CCPA)或需要完全控制抓取逻辑的企业而言,是一个不可忽视的限制。
AI-Scraper 所在的赛道是"AI + 网页抓取",同类产品包括:
与这些竞品相比,AI-Scraper 的差异化在于:它背靠 Oxylabs 的企业级代理网络,在大规模、高频率、地理分布广泛的抓取场景下具有优势。但其定价模型和闭源属性,限制了它在开源社区的吸引力。
Oxylabs AI-Scraper 是一个定位清晰的产品:面向需要快速从网页提取结构化数据、但不想深入爬虫技术的开发者。它用 LLM 大幅降低了数据采集的门槛,同时依托 Oxylabs 的商业基础设施保证了稳定性和可扩展性。
然而,这个项目在开源维度上存在明显局限性——仓库本身仅包含 README,无任何代码贡献;对云服务的完全依赖也意味着用户缺乏透明度和自主控制权。其 905 个 GitHub Stars 更多反映的是产品推广和 SEO 引流效果,而非开源社区的技术认可。对于寻求真正开源、离线可部署方案的开发者而言,这个项目并非理想选择。