brightdata-mcp
让任何 AI 助手直接上网搜索、抓取网页数据,通过 MCP 协议绕过反爬虫和 IP 封禁
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让任何 AI 助手直接上网搜索、抓取网页数据,通过 MCP 协议绕过反爬虫和 IP 封禁
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你问 AI:「今天英伟达的股价是多少?」它支支吾吾给出一个上周的数据。你再问:「帮我查一下亚马逊上这款耳机的评价。」它礼貌地拒绝了——"我没有联网能力"。
这是 2025 年 AI 应用最大的讽刺:最聪明的大语言模型,却活在信息的孤岛上。然而有一家公司说——这不应该是一个难题。
The Web MCP(由全球最大网页数据平台 Bright Data 出品)将 AI 从这个困境中解救出来。它不是又一个 API 封装,而是一个完整的 Model Context Protocol(MCP)服务器,让任何 MCP 兼容的 AI 助手(Claude、GPT、Gemini、Llama……)直接接入真实互联网,绕过反爬虫、绕过 CAPTCHA、绕过 IP 封禁——用自然语言就能获取实时网页数据。
Bright Data 并非初创公司。它是网页数据行业的老牌巨头,积累了超过 10 年的代理网络、爬虫基础设施和数据中心。与其说 The Web MCP 是一款新产品,不如说是 Bright Data 在 AI 时代交出的一份答卷——"我们已有的能力,AI 也能用了"。
该项目于 2025 年 8 月正式公开发布,是最早一批将 MCP 协议应用于网页数据采集的工具之一。随着 MCP 生态的快速扩张,The Web MCP 迅速获得关注,目前 GitHub 星标数超过 2400,成为 MCP 领域数据采集方向的标杆项目。
The Web MCP 不是单一工具,而是一整套工具组,按场景分为多个模块:
| 工具组 | 包含工具数量 | 典型场景 |
|---|---|---|
| 基础工具 | 3 | 搜索引擎、Markdown 抓取、网站发现 |
| E-commerce | 12 | 竞品监控、价格追踪、商品搜索 |
| Social Media | 24 | 社媒帖子、评论、创作者数据 |
| Browser Automation | 14 | 浏览器自动化操作 |
| Finance | 1 | Yahoo Finance 商业数据 |
| Business | 7 | 公司信息、Google Maps、房产、酒店 |
| Research | 2 | GitHub 仓库文件、路透社新闻 |
| Code | 2 | npm/PyPI 包信息查询(面向编程 Agent) |
最具创新性的功能是 GEO 工具组——它让 AI Agent 去查询 ChatGPT、Perplexity 等 LLM 本身对某个品牌的认知,然后以结构化方式返回。想象一下:你是品牌经理,5 分钟内就能完成一份"AI 搜索引擎中的品牌声量报告"。这在以前需要大量人工调研。
另一个亮点是 Code 工具组:编程 Agent 现在可以直接查询 npm 和 PyPI 的包版本、README 和依赖信息,无需再去爬网页或依赖过时缓存。
从代码结构来看,The Web MCP 的架构非常清晰:
server.js — 使用 fastmcp 框架注册所有工具@modelcontextprotocol/sdk — MCP 协议标准实现fastmcp — 工具注册与生命周期管理playwright — 浏览器自动化核心axios — HTTP 请求zod — 运行时参数校验tool_groups.js — 工具组定义(按场景分组)browser_tools.js — 浏览器自动化工具(Playwright CDP)browser_session.js — 浏览器会话管理search_utils.js — 搜索引擎解析工具prompts.js — MCP prompt 模板服务器通过环境变量(API_TOKEN、GROUPS、TOOLS 等)控制启用的工具集,支持三种定价模式的切换:
The Web MCP 提供了业界最灵活的部署选项:
只需在 MCP 客户端中添加一行 URL:
https://mcp.brightdata.com/mcp?token=你的token
无需安装,零配置,Claude Desktop 等主流 MCP 客户端均支持。这是该项目最杀手级的体验设计。
npx @brightdata/mcp
配合 Claude Desktop 的 mcpServers 配置,两分钟完成本地部署。
仓库提供完整的多阶段 Dockerfile:
FROM node:22.12-alpine AS builder
RUN npm install
FROM node:22-alpine AS release
ENTRYPOINT ["node", "server.js"]
镜像体积控制在合理范围内(Alpine 基础镜像)。
所有部署方式的核心前提只有一个:需要一个 Bright Data API Token(免费注册即送每月 5000 次请求配额)。
The Web MCP 本身是一个纯数据转发工具,不在本地存储任何抓取数据。每次网页请求都通过 Bright Data 的代理网络路由,数据流经 Bright Data 的基础设施。对于企业用户,Bright Data 提供合规的 GDPR 数据处理框架(SOC 2 认证)。
需要注意的是:工具使用 Bright Data 的代理基础设施,这意味着所有网页请求的 IP 归属 Bright Data 的数据中心。企业内网环境需要开放对 api.brightdata.com 和 brd.superproxy.io 的访问权限。
尽管功能强大,The Web MCP 并非完美解决方案:
API Token 是硬性依赖:无法完全本地化部署,必须注册 Bright Data 账户并使用其基础设施。对于数据合规要求极高的场景(如金融监管行业),这可能构成障碍。
免费额度有限:5000 次/月对于个人用户足够,但对高频自动化场景(如实时价格监控)很快就会触及上限。Pro 模式采用按量计费,成本透明度需要用户自行评估。
Playwright 浏览器模式资源消耗大:开启 Browser Automation 工具组后,需要维护 Chrome 实例,内存占用显著增加,不适合资源受限环境。
MCP 协议生态仍在成熟期:MCP 协议本身仍在快速迭代,The Web MCP 的 API 稳定性有保障,但作为协议层面的依赖,其演进方向需要持续跟踪。
The Web MCP 代表的趋势远不止一个产品。它标志着网页数据采集从技术活儿变成了 AI 的标配能力。
过去,抓取一个受保护的电商页面需要:代理池 → 反爬绕过 → 渲染引擎 → 数据清洗,一整条技术链路。现在,这一切都封装在 MCP 服务器里,AI Agent 用一句自然语言就能调用。
这种范式转移正在催生新的应用类别:AI 原生的数据工作流。无论是竞品分析、品牌舆情监控、学术研究还是编程 Agent 的实时依赖查询——以前需要专业爬虫工程师完成的工作,现在 AI Agent 就能搞定。
The Web MCP 在这个趋势中占据了有利位置:它背靠 Bright Data 的基础设施积累,踩中了 MCP 生态的早期红利,又通过极低的上手门槛(云端 URL 配置)实现了快速扩散。
项目信息