ai.robots.txt
一键屏蔽1500+AI爬虫的robots.txt配置合集
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一键屏蔽1500+AI爬虫的robots.txt配置合集
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:ai.robots.txt 项目 Logo — NoAI
想象一下:你辛辛苦苦写了三年的技术博客,突然发现 ChatGPT 的训练语料里躺着你的文章——没有通知,没有署名,更没有一分钱。这就是无数内容创作者在 2023-2024 年真实面临的处境。当 AI 公司大规模抓取网页训练大模型时,大多数网站管理员甚至毫不知情。
有没有一种方式,能像对付传统搜索引擎一样,用 robots.txt 把 AI 爬虫挡在门外?
ai.robots.txt 就是这个答案。这是一个维护 AI 爬虫黑名单的开源项目,收集了截至 2026 年已有超过 1500 个 AI 机器人的 User-Agent 信息,生成可直接复用的配置文件,让网站运营者无需写代码,只需把配置文件内容粘到服务器里,就能一键屏蔽所有已知的 AI 爬虫。
ai.robots.txt 项目诞生于 2024 年 AI 爬虫争议最激烈的时期。随着 GPT-4、Claude、Gemini 等大模型相继发布,几乎所有主流 AI 公司都开始抓取互联网训练模型,却缺乏透明度和选择退出机制。内容创作者发现自己的文章被用于训练,却既无感知也无收益。
这个项目的发起者并没有发明新技术,而是做了一个非常务实的工作:把已知的 AI 爬虫 User-Agent 全部收集起来,生成各种服务器能直接使用的配置文件格式。项目名称直接对标 robots.txt 协议本身——这个自 1994 年就存在的互联网规范,终于在 AI 时代被重新激活。
数据来源主要依赖 Dark Visitors(一个专门追踪 AI 爬虫的第三方平台),项目通过 GitHub Action 实现自动化更新:维护者只需往 robots.json 添加一条记录,自动触发脚本生成 robots.txt、Nginx 配置、Apache .htaccess、Caddyfile、HAProxy 规则等全系列文件。
别被名字骗了——这个项目提供的远不止一个 robots.txt 文件。它生成了覆盖主流 Web 服务器的配置格式:
| 输出文件 | 适用服务器 | 作用机制 |
|---|---|---|
| robots.txt | 所有服务器 | 标准 Robots Exclusion Protocol(RFC 9309)协议 |
| .htaccess | Apache | 返回 403 拒绝页面 |
| nginx-block-ai-bots.conf | Nginx | 返回 403 |
| Caddyfile | Caddy | Header Regex 匹配拒绝 |
| haproxy-block-ai-bots.txt | HAProxy | ACL 规则拒绝 |
| lighttpd-block-ai-bots.conf | Lighttpd | 条件配置拒绝 |
这种「一个数据源、多端输出」的架构设计非常聪明:robots.json 是唯一的真相来源,所有配置文件均由代码自动生成,确保各服务器规则完全一致,不会因为手动维护多份而产生遗漏或不同步。
项目还维护一份详细的 机器人指标表(table-of-bot-metrics.md),记录每个爬虫的运营商(Operator)、是否遵守 robots.txt 协议(Respect)、功能类型(AI Search / AI Assistants / Data Scrapers 等)、抓取频率,以及详细描述。这份数据本身就是一份 AI 爬虫百科,对 SEO 从业者和安全研究人员极有价值。
项目代码非常精简,核心逻辑在 code/robots.py 中,约 400 行 Python 代码。代码通过 json_to_txt()、json_to_nginx()、json_to_htaccess() 等函数,将 JSON 数据转换为对应服务器的配置格式。自动化数据更新则通过抓取 Dark Visitors 的页面解析实现,新增的 AI 机器人会自动纳入生成管线。
项目使用 unittest 做单元测试,测试文件验证每种格式的生成结果是否与预期完全一致,确保每次更新不会破坏已有配置。依赖极简(beautifulsoup4 + lxml + requests),运行无需 GPU,不依赖任何 AI/ML 框架。
它能做什么:根据 arxiv 学术研究(Is Misinformation More Open?),截至 2025 年 5 月,60% 的权威新闻网站已在 robots.txt 中屏蔽了至少一个 AI 爬虫,这一比例从 2023 年 9 月的 23% 大幅增长。ai.robots.txt 项目正是推动这一趋势的工具之一。
它不能做什么:robots.txt 只是一个「君子协议」。遵守 robots.txt 是 AI 公司的自觉行为,不遵守也不违法(robots.txt 在法律上无约束力)。像 Bytespider 这类明确不遵守 robots.txt 的爬虫,屏蔽它们需要依赖 IP 层或应用层防火墙。项目本身也明确标注:对于不遵守 robots.txt 的爬虫,只能在服务器层面拦截。
目标用户:
上手方式:
全程无需编程,零运维复杂度。
ai.robots.txt 折射出 AI 时代一个深层矛盾:数据是 AI 的燃料,但数据的主权归属并未被明确界定。 robots.txt 在传统搜索引擎时代运作良好,是因为 Google 等巨头有商业动机维护这一协议(不遵守会导致搜索排名下降)。但 AI 公司的商业模式并不直接依赖 robots.txt 的遵守情况,动力缺失导致协议效力大打折扣。
项目本身也面临维护压力:AI 爬虫每天都在新增,维护者需要持续追踪 Dark Visitors 的更新。虽然 GitHub 社区可以贡献 PR,但审核质量、响应速度都依赖志愿者投入。
ai.robots.txt 项目的 3900+ Stars 背后,是整个互联网内容生态对 AI 数据抓取焦虑的集中体现。它不是第一个 robots.txt 相关的项目,但它是目前覆盖最广、格式最全、维护最活跃的 AI 爬虫屏蔽方案。
从更宏观的视角看,随着 AI 训练数据法规(如 EU AI Act)逐步完善,数据使用透明度将成为强制性要求。ai.robots.txt 所代表的「内容所有者主动声明边界」的实践,可能成为未来人机协作规范的一部分——就像 30 年前 robots.txt 开创了搜索引擎与网站之间的数据协议一样。
对于内容创作者而言,这或许是目前成本最低的「AI 训练拒绝方案」:不用签法律协议,不用联系每家公司,只需一条配置,把门关上。