llms-txt-hub
AI 编程工具的「黄页」:收录 1400+ 支持 llms.txt 标准的网站,配套 CLI 和生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI 编程工具的「黄页」:收录 1400+ 支持 llms.txt 标准的网站,配套 CLI 和生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否有过这样的经历:让 Claude、Cursor 或 Copilot 去处理一个陌生的项目,结果 AI 完全「抓瞎」,对着一个空文档反复追问需求细节?你并不是一个人。当大语言模型(LLM)开始成为程序员的主力工具时,一个核心矛盾也随之浮现——AI 读不懂你的代码库、不知道你的技术栈、无法理解你的业务逻辑。
llms.txt-hub 正是为解决这一痛点而生。它是目前收录规模最大的 llms.txt 标准网站目录库,收录了超过 1400 个已支持 llms.txt 标准的网站/项目,覆盖 AI 与机器学习、数据分析、安全身份、开发工具、基础设施与云服务五大领域。它不仅是一个目录,更是一套完整的工具链,让开发者能够为自己的项目快速生成 AI 可读的文档,同时为 AI 编程工具提供标准化的知识输入。
要理解这个项目,先要了解什么是 llms.txt。
传统的 robots.txt 是给搜索引擎爬虫看的,告诉它们哪些页面可以抓取、哪些不能。而 llms.txt 则是一个新兴的 web 标准——它的作用是给大语言模型(LLM)提供一份结构化的「网站地图」,让 AI 能够高效理解一个网站的核心内容、API 接口和关键概念。
打个比方:如果说 robots.txt 是网站的「交警」,负责指挥搜索引擎的访问权限;那么 llms.txt 就是网站的「AI 秘书」,负责把网站的关键信息翻译成 AI 能理解的格式。当 AI 工具(如 Cursor、Copilot)接入一个网站时,读取 llms.txt 就能快速获取该网站的服务范围、端点说明、使用方式,而无需遍历整个网站。
这个标准最早由 WPZOOM 创始人 LOC CY 提议提出,随后在开源社区中得到广泛讨论和推广。llms-txt-hub 项目正是这一标准的重要推动者和实践者。

图1:llms-txt-hub 网站主界面,展示已收录的 llms.txt 兼容网站目录
llms-txt-hub 采用 pnpm monorepo 结构,由主仓库统一管理多个子包,架构清晰、分工明确:
packages/cli(llmstxt-cli v0.4.1):这是面向开发者的命令行工具,提供了完整的 llms.txt 安装与管理能力。开发者可以通过 llmstxt init 自动检测项目依赖并安装匹配的 llms.txt 文件;llmstxt install <name> 按名称安装指定网站的文档;llmstxt list 查看已安装列表;llmstxt search 搜索目录库中的内容。底层依赖 @clack/prompts(优雅的交互式 CLI 框架)、commander(命令行解析)、fuse.js(模糊搜索)。
packages/generator:一个 NPX 可执行的 llms.txt 生成器,使用 Firecrawl API 对任意网站进行抓取,自动生成 llms.txt 和 llms-full.txt 文件。它支持自定义 URL、最大抓取页面数,并通过交互式命令行引导用户完成整个生成过程。这对于那些尚未原生支持 llms.txt 标准的网站尤其有价值——社区成员可以用它来创建「非官方」的 llms.txt 并提交到 hub 中。
packages/content:内容处理核心包,负责 llms.txt 内容的解析与处理。
apps/web:项目的官方网站,基于 Next.js 16 构建,采用 Next.js App Router 架构。这是一个功能丰富的 Web 应用,包含用户认证(@clerk/nextjs)、博客系统(MDX)、搜索功能、提交入口、社区页面、RSS 订阅等模块。网站数据存储在 data/websites.json 中,包含每个收录网站的名称、域名、描述、llms.txt URL、分类和 favicon。
packages/auth:基于 Supabase Auth 的认证封装包。
packages/analytics、packages/observability:用于站点分析和可观测性。
packages/design-system:共享设计系统组件库。
整个项目通过 Turborepo 管理任务调度和构建缓存,@t3-oss/env-nextjs 管理环境变量,确保 monorepo 中各模块的构建依赖正确触发缓存失效。
从 package.json 的依赖分析来看,这是一个典型的现代全栈 TypeScript 项目:
前端:Next.js 16 + React 19 + TypeScript,使用 MDX 处理内容,Shadcn/ui 组件库,@clerk/nextjs 做用户认证,@content-collections 做内容编译时优化,@mendable/firecrawl-js 调用网站抓取 API。
后端:Next.js API Routes + Server Actions,项目本身即为全栈应用,无独立后端服务。
数据库:从 Supabase Auth 的使用来看,数据存储很可能借助 Supabase(PostgreSQL + Auth)。
部署:Vercel 友好(Next.js 官方推荐),项目已配置 instrumentation.ts 用于 OpenTelemetry 集成,无 Docker 容器化配置。
AI 组件:项目本身是 llms.txt 标准的工具链,但核心业务不涉及 LLM 模型训练或推理,主要依赖 Firecrawl API 进行网站内容抓取。
data/websites.json 中的 1405 个收录网站按分类分布如下:
这个分布清晰地勾勒出了 llms.txt 标准的落地生态——它首先在开发者工具和 AI/ML 领域获得了广泛采用,这两个领域的从业者恰好也是 AI 编程工具的最高频用户,形成了良好的正循环。
安装方式:项目本身是 monorepo,需要 pnpm 8+ 和 Node.js 18+。克隆后执行 pnpm install 安装所有 workspace 依赖(因为有 nodeLinker: hoisted 配置,所有包会被提升到根目录)。启动网站开发服务器:pnpm --filter=web dev。
CLI 使用:安装 packages/cli 后,可以直接通过 llmstxt install <name> 为 AI 编程工具(如 Cursor 的 rules)安装 llms.txt 文件,让 AI 在处理特定网站/API 时具备背景知识。
生成工具:npx generate-llmstxt 启动交互式生成器,输入目标 URL 和 Firecrawl API key,即可为任意网站生成 llms.txt 文件。生成的文档可以提交 PR 到 hub 中,成为社区资源的一部分。
门槛评估:对普通用户来说,直接运行 monorepo 需要一定的 Node.js 生态经验。但对于使用 Cursor/Copilot 的开发者,通过 CLI 工具安装 llms.txt 文件是非常低门槛的操作——只需一条命令,AI 工具就能立刻获得关于特定网站的背景知识。
llms.txt 标准目前仍处于发展早期,生态覆盖还不完整。许多知名网站尚未支持 llms.txt,且标准的具体格式和字段规范仍在社区讨论中。这意味着 llms-txt-hub 需要持续维护和更新收录列表,同时跟踪标准演进。
此外,项目依赖 Firecrawl API 进行网站抓取(免费额度有限),CLI 工具本身功能相对简单,主要聚焦于「安装已收录网站的 llms.txt」,生成新文档的能力完全依赖 Firecrawl 服务。
llms-txt-hub 的出现折射出一个更大的趋势:AI 编程工具正在从「通用代码补全」进化为「具备领域知识的智能助手」。要让 AI 在特定项目中发挥最大价值,需要给它足够的上下文——llms.txt 正是这个上下文的标准化格式。
随着 Cursor、Copilot、Gemini Code Assist 等 AI 编程工具的普及,支持 llms.txt 的网站数量正在快速增长。llms-txt-hub 作为目前最大的收录目录,既是这一趋势的受益者,也是推动者——它降低了开发者为项目添加 llms.txt 的门槛(通过 generator 工具),同时通过目录库让其他 AI 工具能够轻松接入这些资源。
如果你在日常开发中重度依赖 AI 编程工具,强烈建议关注这个项目——无论是为你的开源项目添加 llms.txt 支持,还是通过 CLI 为 Cursor/Copilot 装备更丰富的知识库,llms-txt-hub 都值得一试。