sirchmunk
modelscope/sirchmunk加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,你接手了一个新项目。面对的是:上百 GB 的 PDF 文档、Word 报告、CSV 数据表、代码仓库——全都是"有用的信息",但散落在硬盘的各个角落里。你知道自己需要的答案就在里面,可就是找不到入口。
这就是传统 RAG 系统想要解决的问题:让文件自己开口说话。
但传统 RAG 有一个根本性缺陷——它依赖向量数据库来索引你的文件。这意味着什么?每次新增或修改文件,都需要重新跑一遍向量索引。索引过程耗时数小时,消耗大量算力,而且向量一旦生成,数据变了,索引就"过时"了。你不是在实时获取知识,而是在不断追赶数据的快照。
Sirchmunk 提出了一个截然不同的思路:不做向量索引,直接在原始文件上检索。
Sirchmunk 这个名字来自松鼠(squirrel)的变体——松鼠会不断囤积、分类、复用自己收集的橡果。项目的核心理念也是如此:知识不是一次性的查询结果,而是可以被积累、复用、持续进化的资产。
该项目由 ModelScope(魔搭)团队 开发,2025 年 12 月底发布首个版本,目前已有超过 1330 颗 GitHub Stars,是一个活跃在 Apache-2.0 协议下的开源项目。
传统 RAG 的工作流程是:文件 → 切块 → 向量化 → 存入向量数据库 → 查询时做相似度匹配。这整套流程的每一个环节都有开销。
Sirchmunk 采用了**多层级关键词递进检索(Multi-level Keyword Cascade)**策略:
整个过程只需 2-5 次 LLM 调用,耗时 2-5 秒,比传统 RAG 的 10-30 秒快了一个数量级。
Sirchmunk 最具创新性的设计是自进化知识集群(Self-Evolving Knowledge Clusters)。
每次搜索都会生成一个结构化的知识单元(KnowledgeCluster),这个集群包含:提取的证据、相关的查询、置信度评分(hotness)等元数据。下次搜索时,系统会先检查已有的知识集群:
这就形成了一个正向飞轮:搜索越多,知识越丰富,后续搜索越快越准。
v0.0.9(2026 年 7 月) 还引入了知识进化框架(Knowledge Evolution Framework):搜索后自动对知识图谱进行组织、合并和精炼,支持基于社区的元集群路由优化,显著降低每次查询的计算开销。
Sirchmunk 支持超过 100 种文件格式,通过以下模块处理不同类型的数据:
搜索范围可以覆盖本地文件系统、Web 以及通过 MCP 协议接入的外部数据源。
Sirchmunk 提供了 5 种使用方式,满足不同场景:
| 接口 | 说明 |
|---|---|
| Web UI | Next.js + Tailwind CSS 构建的图形界面,部署后访问 localhost:8584 |
| CLI | sirchmunk init / serve / search / web / mcp 等命令 |
| REST API | FastAPI 提供 POST /api/v1/search/stream SSE 流式搜索接口 |
| WebSocket | 支持实时双向通信 |
| MCP Server | Model Context Protocol 服务端,可与 Claude Desktop、Cursor IDE 集成 |
如果你选择 Docker 方式,只需要三步:
# 方式一:推荐(自动构建镜像)
python docker/build_image.py
docker compose -f docker/docker-compose.yml up -d
# 方式二:手动构建
python docker/build_image.py --dry_run 1
docker compose up -d --build
纯 pip 安装同样简洁:
pip install sirchmunk[all]
sirchmunk init
sirchmunk serve
硬件需求非常友好:CPU 为主,推荐 2 核 4GB RAM,无需 GPU。相比动不动就要 24GB 显存的向量数据库方案,这个门槛几乎为零。
Sirchmunk 并非银弹,以下场景需要谨慎评估:
Sirchmunk 带来的是一个范式级别的变化:从"预先索引、再查询"的批处理模式,走向"直接在原始数据上实时检索"的无索引模式。知识集群机制让系统具备了真正的"学习"能力——不是存储更多数据,而是通过复用让已有知识的价值不断叠加。
对于个人知识管理、本地代码库问答、小团队文档助手等场景,Sirchmunk 提供了一个零基础设施、低硬件门槛、快速上手的优质选择。随着知识集群的积累,它会变得越来越懂你的数据。
📦 GitHub: https://github.com/modelscope/sirchmunk
🌐 文档: https://modelscope.github.io/sirchmunk-web/
📄 论文: https://arxiv.org/pdf/2608.16185