local-deep-research
首个消费级显卡运行的本地深度研究工具,95% SimpleQA 准确率,支持私有知识库加密存储
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个消费级显卡运行的本地深度研究工具,95% SimpleQA 准确率,支持私有知识库加密存储
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年末,一位医学研究者在 Reddit 上分享了他的困扰:他在研究罕见病文献时,需要反复向 ChatGPT 发送患者病历描述。医院数据安全政策明令禁止将患者信息上传至第三方云端,但传统搜索引擎返回的摘要质量远不能满足深入分析的需求。同样的困境在学术圈、律所、科技公司内部知识库管理者中反复出现。OpenAI、Google 的 Deep Research 功能强大,但数据必须离开本地设备。当研究内容涉及内部文档、专利草案、未公开论文时,这成了一道无法逾越的红线。
Local Deep Research(LDR) 正是在这样的背景下诞生的。它是目前第一个仅凭单张消费级 RTX 3090 显卡就能跑出 95% SimpleQA 准确率的开源研究工具,支持 llama.cpp、Ollama、Google、OpenAI 等所有主流本地和云端 LLM 接口,让用户在不离开私有网络的前提下,获得与商业 Deep Research 产品相当的深度研究能力。
LDR 由 GitHub 用户 LearningCircuit 主导开发,联合 HashedViking 和 djpetti 两位贡献者共同推进。项目最早于 2024 年下半年进入公众视野,在 r/LocalLLaMA 社区发布后迅速引发关注——因为它打破了"本地 LLM 无法做深度研究"的刻板印象。
传统的本地 LLM 应用多聚焦于对话、代码补全等轻量场景。而深度研究要求模型能够自主规划搜索路径、在多个信息源之间迭代整合、生成带引用的结构化报告。LDR 的核心创新在于:通过 LangGraph Agent 策略,让模型自主决定搜索策略、自适应切换不同专业搜索引擎(arXiv、PubMed、Semantic Scholar 等),收集的参考资料数量远超传统流水线方案。2025年初,项目在 HuggingFace 上开源了完整的评测数据集,公开了 SimpleQA(500题)达到 95% 准确率、xbench-DeepSearch(100题)达到 77% 的评测结果,这是本地 LLM 领域首次有项目公开展示如此规模的基准测试数据。
LDR 的架构设计非常模块化:将研究任务拆解为「搜索 → 抓取 → 索引 → 推理 → 报告」的可插拔流水线。
从架构文档可以看出,系统分为以下核心层:
入口层:同时支持 Web UI(Flask + SocketIO 实时推送)、CLI 终端和 REST API 三种交互方式。SocketIO 确保长时研究任务的进度能实时在浏览器中显示。
研究引擎层:SearchSystem 是核心调度器,通过 StrategyFactory 动态选择研究策略(目前有 32 种策略可选)。ReportGenerator 负责将研究结果合成为结构化报告并自动标注引用来源。
搜索层:集成了 30+ 个专业搜索引擎,覆盖网页搜索、学术搜索(arXiv、PubMed、Semantic Scholar)、私有文档检索等场景。内置速率限制器防止被封禁。
数据层:使用 SQLCipher 加密的 SQLite 数据库,每个用户数据独立加密存储。即使服务器被物理访问,数据也无法被直接读取。这一安全设计在医疗、法律等敏感场景下尤为重要。
LLM 层:通过统一接口对接多种 LLM 提供商(Ollama、OpenAI、Anthropic、Google、Mistral 等),内置 Embedding 和 Reranker 模块用于语义检索优化。
用户只需输入一个研究问题,LDR 会自动完成以下流程:自主规划搜索路径 → 调用多个专业引擎搜索 → 抓取并解析网页内容 → 迭代推理整合信息 → 生成带引用的完整报告。在 Settings 中选择 langgraph-agent 策略,即启用自主 Agent 模式——模型会根据搜索结果动态调整下一步行动,这正是 95% SimpleQA 准确率背后的核心技术。目前提供 20+ 种研究策略,涵盖快速事实查询、深度分析、学术研究等不同场景。
LDR 的另一大亮点是个人知识库积累能力。每次研究过程中发现的有价值资料(arXiv 论文、PubMed 文章、网页内容),可以直接下载并存储到本地加密知识库中。系统会自动提取文本、建立语义索引,下次研究时即可同时检索本地文档和实时网络结果。长期使用后,个人的研究积累会形成独特的知识网络。
LDR 不绑定任何特定模型。通过 Ollama 可以本地部署任意开源模型(Qwen、LLaMA、Mistral 等),也支持连接 OpenAI、Google 等云端 API。这种灵活性意味着用户可以根据硬件条件选择合适的模型——RTX 3090 上跑 Qwen3.6-27B、MacBook 上跑 7B 参数小模型,或者直接用 GPT-4o 云端推理。
项目在安全方面下了相当功夫:CodeQL、Semgrep、Gitleaks、Trivy 等自动化安全扫描全部集成到 CI/CD 流程中;数据库默认使用 SQLCipher 加密;OpenSSF Scorecard 公开可查。对于企业内网部署,数据从不离开本地这一特性天然满足数据合规要求。
LDR 提供了非常友好的部署体验。最简单的方式是 Docker Compose 一行命令:
curl -O https://raw.githubusercontent.com/LearningCircuit/local-deep-research/main/docker-compose.yml && docker compose up -d
这套编排会自动启动三个容器:Ollama(LLM 推理服务)、SearXNG(搜索代理服务)和 LDR 主应用。启动后访问 http://localhost:5000 即可看到 Web UI。整个过程在有网络连接的情况下约 5-10 分钟完成。
如果想利用 GPU 加速推理,只需额外叠加一个 GPU override 文件:
docker compose -f docker-compose.yml -f docker-compose.gpu.override.yml up -d
GPU 模式需要 Linux 系统配合 NVIDIA 显卡和 nvidia-container-toolkit 运行环境。对于 Windows/macOS 用户,官方提供了 Unraid 部署指南,社区还贡献了 cookiecutter-docker 模板。pip 安装方式也受支持:pip install local-deep-research,但需要自行管理 Ollama 和 SearXNG 的依赖。
坦诚地说,LDR 并非完美解决方案。首先,研究质量高度依赖底层 LLM 的能力——小参数模型(7B)在复杂推理任务上与 GPT-4 差距明显。其次,搜索速度受网络质量影响较大——学术数据库的 API 限流机制可能导致部分长任务中途降速。再次,知识库规模增长后检索性能会下降——文档量超过数千篇时需要配置 Elasticsearch 等专业搜索引擎才能保持响应速度。项目对 Python 版本有严格要求(3.12-3.14),依赖链较深(LangChain 生态),非 Python 开发者定制二次开发的门槛不低。
LDR 的出现证明了三个趋势:本地 LLM 的工具化能力正在快速逼近云端商业产品;隐私优先的 AI 应用在特定垂直领域(医疗、法律、学术)有真实且迫切的市场需求;开源社区通过分工协作(Security scanner + CI/CD + 基准测试公开)能够构建出达到生产级质量的 AI 应用。
从 8000+ GitHub Stars 和持续活跃的 Discord 社区可以看出,这款工具已经找到了它的目标用户——那些需要在保护数据隐私的前提下获得高质量研究能力的专业人士。