khoj
开源 AI 第二大脑,让大模型真正读懂你的个人文档,支持本地部署保障隐私
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源 AI 第二大脑,让大模型真正读懂你的个人文档,支持本地部署保障隐私
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象一个场景: 你正在准备一场重要汇报,翻遍了三年的笔记和几百篇 PDF,仍找不到那份关键数据——但你的 AI 助手早已记住了所有内容,用 3 秒就定位到了答案。这不是科幻,是 Khoj 正在做的事。
Khoj 是一个开源的个人 AI 助手,中文译名可以叫「知识之海」——它扮演的是你数字记忆的「第二大脑」角色。与 ChatGPT、Claude 等通用大模型不同,Khoj 专注解决一个核心问题:让 AI 真正理解你的个人知识库,而不只是泛泛聊天。
项目由 Debanjum Singh Solanky 和 Saba Imran 两位核心贡献者发起,采用 AGPL-3.0 开源协议,目前在 GitHub 拥有超过 34,000 颗星,Discord 社区活跃,被 Trendshift 评为 AI 生产力工具领域的头部项目。它既可以完全本地部署(数据不出本地),也可以使用官方托管的云端版本。

图1:Khoj Web 界面实时问答演示
Khoj 最打动人的场景,是它对个人文档的深度理解能力。它支持索引以下数据类型:
当你在 Khoj 中上传一份 PDF 论文后,它会:
这种基于 RAG(检索增强生成)的架构,让 Khoj 在回答涉及个人文档的问题时,显著优于通用大模型——后者只能在训练数据范围内回答,而 Khoj 可以「看见」你自己的资料。
Khoj 的另一个哲学是开放。它支持同时接入多个 AI 模型,包括:
这种灵活性让用户可以根据任务类型选择最优模型:简单问答用免费开源模型节省成本,复杂推理用 GPT-4 保证质量。Khoj 的架构设计天然支持模型热插拔,新增一个模型只需要改配置,无需改代码。
从源码来看,Khoj 的技术选型偏向「成熟稳定」而非「追新」:
代码组织遵循 Django 的 app 模式,将功能模块化为 processor(处理器)、search_type(搜索类型)、database(数据库层)、routers(API 路由)等子包,职责清晰。
Khoj 并没有把自己局限为一个 Web 应用。它提供了极为丰富的客户端:
这种「全平台覆盖」的战略,让 Khoj 成为真正融入日常工作流的工具,而不是又一个需要专门打开的网站。
对于开发者来说,最担心的是「开源项目文档写得好,部署一团糟」。Khoj 在部署体验上下了大功夫:
官方提供完整的 docker-compose.yml,一键启动包含以下服务的完整栈:
硬件需求上,不带 GPU 也可以运行(官方提供 PyTorch CPU wheel),但有 NVIDIA GPU 会显著加速 embedding 过程。内存建议 8GB 以上,磁盘 5GB。
没有任何工具是完美的,Khoj 也面临一些挑战:
Khoj 代表了一个重要趋势:AI 助手正在从「通用问答」向「个人知识增强」演进。当大模型能力趋于同质化,谁能更好地理解用户的私域数据,谁就能创造差异化价值。
类似的工具还有 Notion AI、Obsidian Copilot、Mem 等,但 Khoj 的优势在于:完全开源、完全自托管、数据完全私有——这是企业级用户和隐私敏感型用户的核心诉求。
图2:Khoj 开源社区贡献者
总结:Khoj 是一款面向知识工作者的开源 AI 第二大脑,通过 RAG 技术让大模型真正「读懂」你的个人文档。它支持多模型、多数据源、多端入口,部署体验成熟,社区活跃。如果你厌倦了在海量笔记中手动搜索,Khoj 值得一试。