arkon
MRP Pipeline 六阶段知识编译 + MCP Server,让 Claude 原生理解企业知识
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
MRP Pipeline 六阶段知识编译 + MCP Server,让 Claude 原生理解企业知识
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
nduckmink/arkon · ⭐ 990 · 🍴 233 · Python · GitHub
想象这样一个场景:某天,公司的新员工问 HR 同事「试用期考核标准是什么?」,HR 翻遍了公司网盘、邮件、飞书文档,给出了一个模糊的答案。而这位新员工转头又去问 Claude,Claude 却只能凭「通用认知」回答——因为它根本不知道这家公司还有试用期这回事。这就是企业 AI 落地的核心困境:AI 和企业知识之间隔着一道墙。Arkon 要做的,就是把这堵墙拆掉。
Arkon 是一款自托管的企业级 AI 知识中心,通过 MCP(Model Context Protocol) 协议,让 Claude 和其他大模型能够实时、权限受控地访问企业内部知识库。它不是一个简单的 RAG 工具,而是一套完整的企业知识编译、治理与分发系统。
Arkon 由越南 BITSNESS TECHNOLOGY AND SOLUTIONS 公司开发和维护,核心作者是 Minh Nguyen。项目发布于 2024 年末,目前处于快速迭代阶段(v0.9.x),最新版本为 2026 年 6 月 2 日。短短半年多时间,它在 GitHub 上积累了接近 1000 颗星,fork 数超过 230,说明企业 AI 知识管理这个赛道确实有真实需求。
Arkon 的定位很清晰:不是给个人用的,README 开篇就写道「Arkon is built for teams, not individuals」,并推荐个人用户使用 Obsidian + Claude Skills 的组合。项目明确面向中大型企业——团队版建议 4 核 CPU / 8GB 内存,企业版建议 8+ 核 CPU / 16GB+ 内存。
大多数 RAG 方案的做法是:把文档切块 → 向量化 → 存入向量数据库 → 用户提问时检索 Top-K 片段。这种方式有两个根本性问题:
信息碎片化:一份完整的 SOP 被切成 N 块后,各自独立,没有上下文关联。
没有质量控制:原始文档中的错误、过时信息也会原封不动地被检索出来。
Arkon 提出了 MRP Pipeline(Map → Reduce → Plan-review → Refine → Verify → Commit),这是一套六阶段知识编译流程,目标是「编译」而非「检索」:
Map 阶段:解析源文档(PDF、DOCX、纯文本、URL),提取文本内容、标题层级和图片caption。图片通过视觉模型生成描述,嵌入文本流。
Reduce 阶段:对 Map 输出进行语义聚合,识别核心实体和主题。
Plan-review 阶段:LLM 生成一份「编辑计划」,列出将要创建或更新的 Wiki 页面清单——人工可审核、可修改、可驳回。这是 MRP 最独特的设计:AI 编译知识前,先让人审批编译计划。
Refine 阶段:根据证据片段,为每个 Wiki 页面生成正文。大型页面使用 mini-agent 循环(最多 10 步),小型页面单次 LLM 调用,并行处理(最多 4 个并发)。
Verify 阶段:验证生成内容的准确性和可溯源性。
Commit 阶段:原子性写入数据库,更新向量嵌入(pgvector)。
MRP 管道还有两个关键特性:页面合并(新文档更新旧 Wiki 时,LLM 做内容融合而非简单覆盖,历史知识永不丢失)和断点续传(崩溃后重启,draft 持久化,昂贵的 LLM 调用不会浪费)。
Arkon 提供了一个类 Notion 的三窗 Wiki 界面:左侧页面树、中间正文、右侧反向链接与出链视图。每个页面都支持版本历史和回滚,保证知识演进可追溯。
更关键的是知识图谱可视化——可以按部门 Scope 或全局 Scope 查看页面之间的关联关系。这对梳理复杂业务流程、发现信息孤岛非常有价值。
文档版本管理也很有意思:支持 Draft → Review → Approve → Publish 的编辑工作流,不是所有员工都能直接发布内容,需要 Editor 或 Admin 角色审批。这套机制解决了「谁来审核 AI 生成内容」的问题。

图1:Arkon Wiki 浏览器界面
这是 Arkon 最具差异化的能力。项目实现了完整的 MCP Server(基于 FastMCP),通过 OAuth 2.1 + PKCE 实现无感登录——员工在 Claude Desktop 或 Claude.ai 的 Connectors 设置中添加 Arkon URL,浏览器弹出登录窗口,完成授权后 Claude 即可调用 Arkon 提供的工具。
MCP Server 暴露的工具集非常完整:
search_wiki、read_wiki_page、list_wiki_pages、read_wiki_indexget_source、get_source_outline、get_source_pages、list_sourcespropose_wiki_edit、edit_wiki_page、list_pending_drafts、review_draft、approve_draft、reject_draftlist_knowledge_types、get_knowledge_type_docs所有工具都强制执行 Scope 隔离:员工的 token 只能访问自己所属部门或全局级别的知识和工具,绝不会跨部门泄露。

图2:Arkon MCP Server 与 Claude Desktop 集成示意
Arkon 内置了完整的 RBAC 体系:
角色层级:Viewer · Contributor · Editor · Admin
权限粒度:精确到 doc:read:own_dept、wiki:edit:all、org:settings:manage 等细分操作
部门级隔离:HR、Legal、Engineering 等部门各自有独立的文档集合和 Wiki,成员只能看到自己部门的内容
全局 Scope:公司级 SOP、政策、通识知识对所有员工可见
审计日志:所有特权操作(设置变更、计划审批、角色调整)都有完整记录
对于金融、医疗、法律等对数据安全有严格合规要求的行业,这套权限体系是刚需。
Arkon 的技术选型务实且成熟:
| 层级 | 技术栈 |
|---|---|
| 后端 | FastAPI + Uvicorn + SQLAlchemy (async) + PostgreSQL + pgvector |
| 异步任务 | ARQ (Redis) — 两个独立 worker,分别处理 MRP 管道和 Skills |
| 对象存储 | MinIO(S3 兼容)— 存储原始文档和图片 |
| 前端 | Next.js (App Router) + Tailwind CSS + TypeScript |
| AI 集成 | FastMCP(Model Context Protocol) |
| 文档解析 | PyMuPDF + python-docx + mammoth(支持 PDF、DOCX、DOC、纯文本、URL) |
| AI 模型 | Anthropic Claude、Google Gemini、OpenAI GPT 系列(可插拔) |
| 嵌入模型 | Google gemini-embedding-*、OpenAI text-embedding-3-*(支持在线切换和原子迁移) |
| 权限认证 | bcrypt + JWT + OAuth 2.1 + PKCE |
架构亮点:LLM/嵌入/视觉模型通过 Provider 注册表动态选择,管理员在后台界面配置 API Key 和模型参数,终端用户完全无感。嵌入模型切换时支持在线迁移——新索引完成后原子切换,不存在零结果的搜索窗口期。

图3:Arkon 技术架构 — FastAPI 后端、Next.js 前端、pgvector 向量数据库、ARQ 异步任务队列
Arkon 还支持 AI Skills 分发——管理员上传版本化的 Skill 包(.zip 包含 SKILL.md),分发到全公司。员工在 Claude 中调用这些 Skills,相当于拥有了一整套企业专属的 Agent 能力。
Arkon 通过 docker compose --env-file .env.docker up -d --build 一键部署,自动启动 7 个容器:PostgreSQL + pgvector、Redis、MinIO、FastAPI API、2 个 ARQ worker、Next.js 前端。
启动后访问 http://localhost:3119,以管理员身份登录,在 Settings 中配置 AI API Key 即可。不需要 GPU,所有 AI 推理走外部 API(Anthropic/Google/OpenAI)。
部署的真正门槛不是 Docker,而是:
内存需求较高:MRP 管道的 worker 需要把大文档的全部 LLM 上下文加载到内存,Starter 最低 4GB,企业版建议 16GB+
需要外部 AI API Key:必须拥有 Anthropic/Google/OpenAI 的 API 访问权限,API 费用另算
多人使用建议反向代理 + SSL:生产环境需要 Nginx/Caddy 配 HTTPS
Dockerfile 采用了多阶段构建(python:3.12-slim),前端独立 Dockerfile,API 以非 root 用户(appuser)运行——安全加固做得不错。
Arkon 也有一些明显的不足:
Arkon 代表了一个趋势:企业 AI 知识管理基础设施化。过去企业的 AI 落地通常是「买了 ChatGPT 企业版,员工自己摸索怎么用」。Arkon 的思路是:先把企业知识结构化编译,再让 AI 去访问——而不是让 AI 每次都从零理解企业的背景信息。
MRP Pipeline 的 Plan-review 设计尤其值得关注:它承认 AI 会犯错,所以让人类在编译阶段介入审批,而不是等 AI 答错了再去追责。这种「AI 生成 + 人工审核」的工作流,可能是未来企业级 AI 应用的主流形态。
当前项目仍处于快速迭代期(v0.9.x),API 和数据模型可能随版本变化,生产环境部署前需要评估版本稳定性。建议关注 Roadmap 中的富媒体摄入和外部数据源连接器——这两项落地后,Arkon 的实用价值会大幅提升。