DevDocs
将任意技术文档转化为AI可查询的本地知识库,支持MCP协议直连Claude/Cursor/Cline
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将任意技术文档转化为AI可查询的本地知识库,支持MCP协议直连Claude/Cursor/Cline
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
作为软件开发者,你是否有过这样的经历:接手一个陌生的技术栈,光是读懂官方文档就花了一整周?集成第三方API时,文档分散在十几个页面,找一个参数说明比coding本身还耗时?更别提那些需要翻墙、加载极慢、或者根本没有完整文档的技术——光是搞清楚"这玩意儿怎么用",就耗尽了你的热情。
DevDocs 正是为解决这一痛点而生。它是一个完全免费的、私密的、基于Web-UI的文档抓取MCP服务器,核心理念很简单:把文档还给开发者。只需给一个文档URL,它就能自动发现该技术相关的所有子页面(最深5层),并行抓取、去噪、提取结构化内容,并最终以Markdown或JSON格式输出——或者直接通过MCP协议,让Claude Desktop、Cline、Cursor等AI编码工具实时查询你的本地知识库。
图1:DevDocs Web界面,支持输入URL、配置抓取深度和并发参数
DevDocs由CyberAGI团队创建,创始人Shubham Khichi曾在LinkedIn上分享过他们的动机:传统文档阅读方式在LLM时代已经严重过时。即使是资深工程师,面对一个陌生技术栈的完整文档,从阅读到理解再到实现,往往需要数周时间。DevDocs的目标是将这个周期压缩到几小时。
该项目直接对标FireCrawl等商业爬虫服务,但采取了完全不同的策略:开源、免费、自托管、无限使用。没有免费额度限制,没有每分钟请求上限,企业可以完全在本地部署,数据永不离开防火墙。对比FireCrawl每月$16起的订阅费和$333/月的企业版,DevDocs在价格上具有碾压性优势。
项目发布后在GitHub迅速获得2089 stars,192 forks,20个活跃issue,表明其确实解决了真实需求,而非概念型项目。
DevDocs的核心爬取能力建立在Crawl4AI之上。Crawl4AI是一个专为AI应用设计的网页爬虫,能够处理动态内容(JavaScript渲染)、懒加载图片、登录墙等现代网页特性。DevDocs在此基础上封装了更友好的用户界面和API层。
爬取流程的核心参数包括:
DevDocs提供了完整的Web界面,无需命令行即可完成所有操作。界面分为三个主要区域:
Web界面基于Next.js 15构建,使用Material UI组件库,Tailwind CSS做样式,风格现代、响应迅速。
图2:抓取结果展示,支持多页面管理
DevDocs最有价值的特性是内置的Model Context Protocol(MCP)服务器。MCP是Anthropic提出的标准协议,让AI模型能够调用外部工具和数据源。DevDocs的MCP服务器将抓取好的文档转换为AI可查询的本地知识库。
用户只需在Claude Desktop App或Cline/Roo Code中配置JSON文件指向DevDocs MCP服务,之后就可以直接用自然语言向AI提问:
"这个API的认证流程是什么?" "这个库的Error Handling最佳实践有哪些?" "这个框架的Middleware怎么配置?"
AI会通过DevDocs MCP服务器实时查询本地文档,返回精准答案,而不是给你一个ChatGPT编造的假文档。
README中详细描述了如何在Roo Code中配置Mode-Specific Prompts,让AI在处理技术查询时强制使用MCP工具——先查目录索引,再检索具体内容,最后综合回答,确保答案的可追溯性。
图3:支持深度5层的递归页面发现
DevDocs支持两种导出格式:
导出的内容经过智能去噪处理,自动移除页眉、页脚、广告、导航栏,只保留正文内容,同时保留代码块、表格、标题层级等结构信息。
DevDocs采用4个独立Docker容器通过docker-compose协同工作:
| 服务 | 端口 | 技术栈 | 职责 |
|---|---|---|---|
| frontend | 3001 | Next.js 15 + MUI + Tailwind | Web界面,React 19驱动 |
| backend | 24125 | Python 3.11 + FastAPI + Uvicorn | 爬取API、任务调度、状态管理 |
| mcp | stdin/stdout | Python + FastMCP | MCP协议服务,供AI工具调用 |
| crawl4ai | 11235 | Crawl4AI官方镜像 | 底层爬取引擎,处理动态页面 |
Backend层使用FastAPI构建,提供RESTful API,核心模块包括:
crawler.py:封装Crawl4AI客户端,实现页面发现和内容抓取status_manager.py:任务状态管理(pending/running/completed/failed/cancelled)config.py:DISCOVERY_POLLING_TIMEOUT_SECONDS等环境变量配置main.py:FastAPI应用入口,CORS中间件配置MCP服务位于fast-markdown-mcp/子目录,使用FastMCP框架开发,核心文件:
server.py:MCP协议服务端,处理get_table_of_contents和get_section_content两个核心工具document_structure.py:文档结构化处理__init__.py:包初始化每个容器通过devdocs-network桥接网络互通,frontend通过NEXT_PUBLIC_BACKEND_URL环境变量连接backend。MCP服务不暴露端口,通过Docker stdin/stdout直接与宿主通信。
图4:DevDocs MCP服务与Claude等AI工具的集成架构
DevDocs官方推荐的部署方式是Docker Compose。克隆仓库后:
git clone https://github.com/cyberagiinc/DevDocs.git
cd DevDocs
cp .env.template .env
./docker-start.sh
脚本会自动创建必要目录、设置权限、构建并启动4个容器。整个过程约10-15分钟(含镜像拉取),配置正确的机器首次启动约5分钟。
对于需要修改源码的开发者,DevDocs也提供了本地开发脚本:
start.sh/start.ps1:非容器化启动,需要手动安装Node.js 18+和Python 3.11环境uvicorn app.main:app启动,frontend通过next dev启动DevDocs的硬件需求适中:
DevDocs官方在README中注明:项目已停止公开维护。CyberAGI将内部版本增强后不再开源,公开版本可能存在未修复的问题。不过GitHub仓库仍然活跃,issue和PR仍在处理中。
此外,Windows支持仍属实验性质,虽然提供了docker-start.bat,但官方明确表示"未测试",生产环境建议使用Linux/macOS。
DevDocs的出现代表了AI开发工具链的一个新趋势:将AI能力下沉到开发者的本地工作流。传统上,开发者依赖搜索引擎、AI聊天机器人或付费文档服务来获取技术信息。这些方式要么信息陈旧(LLM知识截止日期),要么需要额外订阅,要么数据安全无法保证。
DevDocs通过"自托管文档知识库+MCP协议"的组合,创造了一种新的范式:开发者可以构建自己团队的私有文档库,AI编码工具可以在这个知识库上提供真正基于实际文档的答案,而非幻觉式的通用回答。
从数据看,该项目获得了来自Anthropic和OpenAI的官方合作认可(README中展示了两家公司的logo),说明其技术方向与主流AI厂商的发展路线高度一致。随着MCP协议的生态扩大,DevDocs这类文档知识库工具的价值将进一步凸显。
目前CyberAGI正在开发下一代版本,包括PDF上传解析、持久化存储、团队协作功能。如果这些功能开源,将进一步巩固其在文档抓取+AI知识库领域的开源领导者地位。