scrapecraft
对话式AI爬虫编辑器,用自然语言描述需求即可自动构建爬取流程,支持多URL批量采集和实时流式输出。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
对话式AI爬虫编辑器,用自然语言描述需求即可自动构建爬取流程,支持多URL批量采集和实时流式输出。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你要采集某竞品网站的价格数据,传统方案需要花数小时分析 HTML 结构、编写 XPath 表达式、处理反爬机制——而现在,你只需要告诉 AI「把每件商品的名字、价格和折扣信息抓下来」,它就能自动完成所有复杂操作。ScrapeCraft 正是这样一个将网页爬虫带入「对话即爬取」时代的产品。
网页数据采集一直是程序员和数据分析师的核心痛点之一。随着 AI 大模型能力的爆发,2024 年开始出现了一批「AI + 爬虫」的创新项目,其中最具代表性的便是 ScrapeGraphAI。该项目的核心思路是:用 LLM 自动理解网页结构,生成对应的爬取逻辑,用户无需手工分析 HTML。
ScrapeCraft 则是 ScrapeGraphAI 生态中的重要一环——它将 AI 爬虫能力包装成一套完整的可视化 Web 编辑器,让用户通过图形界面管理爬取流程,同时保留了 AI 辅助的自然语言交互能力。项目采用 MIT 许可证,由 ScrapeGraphAI 团队维护。
ScrapeCraft 不仅仅是一个爬虫工具,更是一套完整的数据采集平台:
ScrapeCraft 的技术架构分为前后端两部分,设计思路清晰,模块边界明确。
后端基于 FastAPI + LangGraph 构建,采用了多智能体(Multi-Agent)架构。app/agents/ 目录下包含 6 种不同的 Agent 实现:
| Agent | 用途 |
|---|---|
simple_agent.py | 简单请求处理 |
scraping_agent.py | 核心爬取逻辑编排 |
openrouter_agent.py | OpenRouter LLM 调用封装 |
kimi_agent.py | Kimi 模型专用代理 |
langgraph_agent.py | LangGraph 状态机编排(核心,34KB) |
unified_agent.py | 统一入口,整合所有 Agent(41KB,最大) |
app/services/ 中最值得关注的是 pattern_learner.py(22KB),负责从历史爬取记录中学习页面模式,提升同类站点的爬取成功率。workflow_manager_v2.py 和 workflow_manager.py 则分别管理爬取工作流的生命周期。
后端依赖的核心技术栈:
前端采用 React + TypeScript + Tailwind CSS,这是一个典型的现代 React SPA。前端 src/components/ 下按照功能分为 Chat、Common、Layout、Pipeline、Settings、Workflow 六大模块。构建使用 npm run build 输出静态文件,通过 Nginx Alpine 镜像托管。
整体部署通过 docker-compose.yml 一键编排 5 个服务:backend(FastAPI)、frontend(Nginx)、db(PostgreSQL)、redis(Redis)、watchtower(自动更新)。
部署 ScrapeCraft 只需要三步(假设已安装 Docker):
git clone https://github.com/ScrapeGraphAI/scrapecraft.git
cd scrapecraft
cp .env.example .env
# 编辑 .env,填入 OPENROUTER_API_KEY 和 SCRAPEGRAPH_API_KEY
docker compose up -d
# 访问 http://localhost:3000
启动后,用户首先创建 Pipeline,添加目标 URL,然后定义数据 Schema(比如:产品名(string)、价格(number)、评分(number)),最后向 AI 助手发送指令「提取每件商品的名字、价格和评分」。AI 会自动生成爬取代码并执行,结果实时流式展示。
注意:项目依赖 OpenRouter API 和 ScrapeGraphAI 官方 API,需要自备密钥,会产生调用费用。
没有任何工具是银弹,ScrapeCraft 也存在以下局限:
ScrapeCraft 代表了网页爬虫领域的范式转变:从规则驱动到意图驱动。随着 LLM 理解网页结构的能力持续提升,「描述需求 → AI 自动爬取」将成为数据采集体感最友好的交互模式。
从 GitHub 数据看,该项目获得了 678 颗星(作为对比,同门兄弟 ScrapeGraphAI 主项目超过 15,000 星),说明市场对 AI 爬虫工具的需求正快速增长。LangGraph 的引入也反映了复杂 AI 工作流在生产环境中的成熟度在提升。
对于需要频繁采集竞品数据、监控市场价格、或做舆情分析的数据团队,ScrapeCraft 提供了一条低门槛的入场路径——即使不懂 HTML、不写 XPath,也能完成专业级的网页数据采集。

ScrapeGraphAI 官方 API 能力概览