MemOS
面向AI Agent的自进化记忆操作系统,让大模型跨对话持久记忆、精准检索
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
面向AI Agent的自进化记忆操作系统,让大模型跨对话持久记忆、精准检索
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你跟一个AI助手聊了两个月的项目需求,每次打开对话它都能精准记住你的编码风格、业务术语、甚至那个绕口的变量命名习惯——不用你反复解释,也不用粘贴一大段上下文。这不是科幻,MemOS正在把这件事变成现实。
MemOS(Memory Operating System)是MemTensor团队开源的大模型记忆操作系统,定位为AI Agent的"记忆层"。它不是简单的向量数据库,而是一套类OS的记忆抽象——统一管理LLM的存储、检索、反馈和跨任务技能复用。2025年7月正式开源,2026年5月发布memos-local-plugin 2.0,GitHub已斩获9,450 Stars,是当前AI Agent记忆基础设施领域的标杆项目。
图1:MemOS 2.0 Stardust(星尘)版本 Banner
当前主流LLM(GPT-4o、Claude 4、Qwen等)均为无状态设计:每次对话都是独立的token序列,历史信息全靠上下文窗口携带。这带来了三个根本矛盾:
矛盾一:上下文有限 vs. 长期知识需求。128K的上下文窗口看似宽裕,但当AI Agent连续运行数周处理上百个任务时,窗口很快就被塞满。更关键的是,有价值的历史交互被淹没在噪音中,检索效率极低。
矛盾二:通用模型 vs. 个性化需求。通用LLM回答泛泛,用户每次都要花大量时间"教"它理解特定场景。但这些个性化信息无法持久保存,换一个对话就得重来——就像每天给新员工发同一份onboarding文档。
矛盾三:向量检索 vs. 结构化推理。现有RAG方案把记忆当文档处理,用向量相似度搜索。但用户偏好、任务规划、技能知识等高价值信息有其内在结构,粗暴的embedding无法捕捉这些语义关联。
MemOS的答案是:给LLM装一个"记忆操作系统"——像人类大脑一样,分层存储、按需检索、自进化生长。
MemOS的核心架构分为三层记忆抽象,配合统一的API层:
L1轨迹记忆(Trace Memory):记录AI与用户的原始交互序列——每轮对话的输入、输出、工具调用结果。这是最低层的原始记忆,用于后续分析和抽象。
L2策略记忆(Policy Memory):从轨迹中提炼出可复用的行为模式。比如:"这个用户喜欢在代码审查前先跑一遍lint"、"处理支付类请求需要双重确认"。策略记忆是可执行的"经验",让Agent学会举一反三。
L3世界模型(World Model):最高层的结构化知识图谱,存储实体、概念及其关系。配合Neo4j图数据库,MemOS可以做多跳推理——"谁提过这个需求?他之前同意过类似的方案吗?"
同时,MemOS引入了MemCube(记忆立方)概念,作为多用户、多项目记忆隔离的基本单元。每个MemCube可独立管理,并通过Skill(技能结晶)实现跨任务复用。
统一API层则封装了add(写入)、search(检索)、feedback(反馈修正)三大核心操作,开发者无需关心底层存储细节。
图2:MemOS官方Logo
MemOS采用典型的微服务架构,核心技术选型清晰务实:
| 组件 | 技术选型 | 作用 |
|---|---|---|
| API层 | FastAPI (Python) | RESTful接口,异步支持,高性能 |
| 图数据库 | Neo4j | L3世界模型存储,多跳关系推理 |
| 向量数据库 | Qdrant | 高维向量检索,支持混合搜索 |
| 全文检索 | SQLite FTS5 | 关键词精确匹配,与向量互补 |
| 任务调度 | Redis Streams | 异步摄入,高并发限流 |
| 插件生态 | MCP (Model Context Protocol) | 标准化工具/记忆扩展协议 |
值得注意的是,MemOS支持多种LLM后端:OpenAI、Azure OpenAI、阿里通义千问、DeepSeek、MiniMax、Ollama、HuggingFace、vLLM,通过MOS_CHAT_MODEL_PROVIDER环境变量一键切换。这大大降低了企业部署的门槛。
项目采用monorepo结构:
MemOS团队在多个权威基准上做了系统性评测,数据相当亮眼:
| 基准 | 成绩 | 说明 |
|---|---|---|
| LoCoMo | 75.80 | 长程对话上下文一致性 |
| LongMemEval | +40.43% | 长期记忆检索准确率提升 |
| PrefEval-10 | +2568% | 个性化偏好记忆任务提升 |
| PersonaMem | +40.75% | 人格化记忆效果提升 |
| vs. OpenAI Memory | +43.70% | 准确率综合提升 |
其中PrefEval-10提升25倍尤为惊人——说明MemOS在个性化偏好记忆任务上,相比OpenAI原生Memory方案有着质的飞跃。Token节省方面,可节省35.24%的上下文token,降低推理成本。
MemOS对部署体验下了功夫,提供三条入场路径:
方式一(推荐):Docker Compose一键部署
git clone https://github.com/MemTensor/MemOS.git && cd MemOS
pip install -r ./docker/requirements.txt
# 配置.env(OPENAI_API_KEY等)
cd docker && docker compose up
一条命令拉起MemOS API + Neo4j + Qdrant。
方式二:原生uvicorn(需要Neo4j + Qdrant预先运行)
cd src && uvicorn memos.api.server_api:app --host 0.0.0.0 --port 8001
方式三:Helm Chart(K8s生产部署)
cd deploy/helm && helm install memos . -f values.yaml
硬件要求方面,MemOS属于轻量级服务:无需GPU,4GB RAM + 2GB磁盘即可运行。这对企业内网部署非常友好。
MemOS的差异化优势之一是插件生态:
memos-local-plugin(v2.0,2026-05-09):面向Hermes Agent和OpenClaw的本地记忆插件,100%本地运行,数据不出本机。通过Hybrid Retrieval(FTS5 + Vector)实现精准检索,支持多Agent协作记忆共享。
OpenClaw Cloud Plugin:云端托管方案,Token节省率达72%,支持按user_id跨Agent共享记忆。
这些插件让MemOS不只是后端API,而是真正嵌入AI Agent工作流的记忆基础设施。
依赖Neo4j + Qdrant:生产部署至少需要两个额外存储服务,增加了运维复杂度。对于只想简单试用的用户,有一定的学习成本。
多模态记忆仍在完善:当前版本对图片/图表的记忆支持相对初级,文档解析功能刚加入,复杂PDF的信息抽取效果有待验证。
MemOS的出现标志着AI Agent领域开始从"通用模型"走向"个性化智能体"的范式转变。如果说2023-2024年的主旋律是模型能力提升,那么2025年后的趋势将是记忆与个性化。
MemOS提出的"记忆操作系统"概念已被写入多篇学术论文,其arXiv论文(arXiv:2507.03724)在发布后迅速获得学界关注。MemTensor团队与上海AI研究院共建的Awesome-AI-Memory资源库,进一步奠定了MemOS在该领域的学术影响力。
随着多Agent协作(Multi-Agent)场景的爆发,对共享记忆、跨Agent知识复用的需求将持续增长。MemOS踩在了这个趋势的浪尖上。
本文基于MemOS v2.0 Stardust版本分析,数据来源:GitHub README、ArXiv论文、官方文档。