llm_wiki
让 AI 增量构建持久化个人知识库,从每次临时检索升级为档案馆馆长模式
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 AI 增量构建持久化个人知识库,从每次临时检索升级为档案馆馆长模式
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你花了三个月读完了 200 篇论文,AI 却每次都要从零开始理解你的资料——这不是真正的助手,更像是"每问必忘"的临时工。LLM Wiki 解决的就是这个问题:它不是让 AI 每次查询时临时检索,而是让 AI 增量构建一座持久化的个人知识库,知识只编译一次,之后持续更新,随用随取。
这个项目的灵感来自 AI 大牛 Andrej Karpathy(特斯拉前 AI 总监、OpenAI 创始成员)提出的 LLM Wiki 方法论。Karpathy 认为,传统 RAG 系统(上传文件→查询时检索→回答)本质上是让 AI 每一次都从零发现知识,没有积累和演进。他的设计理念是:让 AI 像馆长一样工作——先系统地阅读理解资料,构建结构化 Wiki,之后只需维护和更新,而不必重复阅读。
nashsu 在此基础上,将这个抽象方法论工程化为完整的桌面应用,并大幅扩展功能。
如果把 LLM Wiki 比作一个系统,它就像一位永不疲倦的知识建筑师:你把 PDF、文档扔给它,它会先用两步思维链(分析+生成)系统地理解内容,自动构建 Wiki 页面,用 [[wikilink]] 把相关概念相互关联,持续追踪知识空白。这比传统 RAG 的"每次现找现答"效率高得多——相当于从"临时工模式"升级到"专家模式"。
文档摄入层:支持 PDF(含多模态图片提取 + 视觉模型描述)、Markdown、Word、Excel、HTML,文件夹递归导入,目录结构作为 LLM 分类上下文。持久化队列支持崩溃恢复、取消/重试、逐文件进度可视化。
知识组织层:LLM 增量构建 Wiki 页面,每个页面含 YAML frontmatter + wikilink 交叉引用。与 Obsidian 完全兼容——Wiki 目录直接作为 Obsidian 仓库打开,享受 Obsidian 的所有生态插件。内置 purpose.md(定义 Wiki 存在意义)、schema.md(Wiki 运作规则)、index.md(内容目录和 LLM 导航入口),三层架构清晰。
知识图谱层:基于 graphology 图库 + Sigma.js 渲染,四维关联度模型(直接链接、来源重叠、Adamic-Adar、类型亲和),Louvain 社区检测自动发现知识聚类,图谱洞察功能(惊奇连接 + 知识空白检测),一键触发 Deep Research 补全空白。
AI 交互层:向量语义搜索(基于 LanceDB,支持任意 OpenAI 兼容端点),Deep Research(LLM 生成搜索主题,通过 Tavily/SerpApi/SearXNG 多查询网络搜索,结果自动摄入 Wiki),异步审核系统(LLM 标记需人工判断项),本地 HTTP API(127.0.0.1:19828,Token 鉴权,支持 Hybrid 检索、文件读取、图谱遍历),Agent Skill 可一行命令接入 Claude Code/Codex。

图1:知识图谱界面——节点代表 Wiki 页面,边代表概念间的关联强度,颜色分区代表 Louvain 社区聚类
内置 Chrome 扩展(Turndown.js + Readability.js),浏览任何网页时点击扩展图标即可一键剪藏,自动提取正文内容并摄入知识库,配合 Deep Research 实现"阅读→研究→入库→关联"的闭环。
项目采用 Tauri 2(Rust 后端 + WebView 前端)的双引擎架构:
src-tauri/):处理 PDF 渲染(pdfium-render)、文档解析(calamine/Excel、docx-rs/Word、office-oxide)、PDF 图片多模态提取(image + base64)、向量数据库(lancedb)、文件监听(notify)、HTTP 服务(tiny_http + reqwest)、Claude Code 子进程管理(tokio + which)src/):三栏布局,状态管理(Zustand),富文本编辑(Milkdown),图谱渲染(Sigma.js + graphology),i18n 国际化(i18next),组件库(shadcn/ui + Base UI),样式(Tailwind CSS 4)这是一个典型的**本地优先(Local-First)**应用——所有数据存储在本地(.llm-wiki/ 目录),无需云端,不上传任何数据到第三方。
对于普通用户,安装 Tauri + Node.js + Rust 环境后即可运行,图形界面友好,支持多语言(含中文)。对于 AI 开发者,本地 HTTP API + Agent Skill 是核心价值——通过 API 让 Claude Code/Codex 直接读取和操作知识库,实现"边写代码边构建知识库"的体验。
LLM Wiki 本质上依赖 LLM 的理解和总结能力——如果底层模型对某个专业领域理解有误,生成的 Wiki 页面也会"以讹传讹"。此外,LanceDB 向量搜索是可选的,非向量模式在跨文档综合查询时精度有限。图谱质量高度依赖摄入文档的数量和质量,冷启动阶段效果不明显。
LLM Wiki 代表了一个重要趋势:从"检索增强"到"知识积累"的范式转变。随着 Claude Code、Codex 等 AI Coding Agent 越来越普及,让 AI Agent 能够维护一个持久化的知识库将成为刚需——LLM Wiki 正是这一方向的早期探索者,增长曲线值得关注。
总结:LLM Wiki 是 Karpathy 方法论的完整工程实现,将"让 AI 构建和管理个人知识库"的理念落地为可用的桌面应用。对于需要系统整理大量资料(论文、技术文档、研究笔记)的用户,它是传统 RAG 的有力替代方案;对于 AI 开发者,它的本地 HTTP API + Agent Skill 设计尤其值得借鉴。