argus
证据门控认知运行时:让 AI agent 真正记住一切、支持三层记忆与自我纠正检索的本地运行时框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
证据门控认知运行时:让 AI agent 真正记住一切、支持三层记忆与自我纠正检索的本地运行时框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,你在赶一个重要项目,忽然想起上周和同事讨论过某个技术选型的结论,但怎么也想不起来细节——翻遍了聊天记录,关键词对不上。那一刻你深刻体会到:当前的 AI 助手,本质上是一个严重的"健忘症患者"。每次对话结束,它就把一切都忘了。
Argus Agent 正是为了解决这个根本问题而诞生的。它不仅仅是一个聊天机器人,而是一个真正具备持久记忆能力的认知运行时——能够理解记忆的含义、知道记忆发生的时间、理解数字属于哪个实体、在证据不足时主动承认"不知道"而非胡编乱造。

图1:Quarq Labs — Argus Agent 的开发组织
当前的 AI Agent 生态中,记忆能力普遍薄弱。大多数 Agent 依赖向量数据库做简单的语义检索——把用户说的话转成 embedding,存起来,下次问类似问题时做相似度搜索。这种方案有三个致命缺陷:
第一,语义检索无法区分事实与背景。 用户说"我想要红色",可能是指衣服偏好,也可能是指项目主题,取决于上下文。单纯的向量相似度会把所有包含"红色"的记忆都召回来,淹没真正相关的那条。
第二,无法处理时间敏感性。 三个月前的偏好可能已经变了,但如果检索系统不知道时间维度,就会把过时的记忆当成权威信息。
第三,没有证据链的概念。 当用户问"这个月花了多少钱",Agent 需要知道每笔支出的来源、数值、时间——而不是返回一个笼统的概述。
Argus 由 Quarq Labs 开发(2026年5月24日首次提交),定位是 Hermes、OpenClaw 等记忆 Agent 的"开源、可审查"的替代品,特别强调本地持久记忆、严格归因和自我纠正检索能力。
Argus 的架构设计围绕一个核心洞察:记忆不是向量搜索的副产品,而是 Agent 认知的首要基础设施。 整个系统构建在 LangGraph 状态图之上,采用了精心设计的分层架构。
Argus 将 Agent 记忆分为三个正交层次,每层存储不同类型的信息:
语义记忆(Semantic Memory) 存储用户的持久事实:身份信息、偏好、关系、日常习惯、长期项目、拥有的物品、稳定特质等。例如:"用户拥有一盏水晶吊灯,是曾祖母留下的,由姨母赠送"。这类记忆具有高度稳定性,是用户画像的核心。
情景记忆(Episodic Memory) 存储具体事件和交互历史:发生了什么、何时发生、涉及谁、做出了什么决定、用户要求了什么、发生了什么变化。例如:"2023年3月4日,用户从姨母那里收到了一盏水晶吊灯"。这类记忆具有时间标记,支持时间推理。
程序记忆(Procedural Memory) 存储行为规则:语气偏好、格式偏好、项目级指令、禁用措辞、内容生成约束。这些规则被打上标签并路由分发,确保模型在处理当前请求时只看到相关规则,而不是背负所有规则。
当 Agent 需要回忆信息时,Argus 的检索管道会依次执行:
Argus 的一个独特设计是证据门控(Evidence-Gated)——当检索结果不足以支撑一个答案时,Agent 会主动发起二次检索,而不是返回低置信度内容或幻觉。这种"不知道就说不知道"的自我约束机制,是其区别于普通 RAG 系统的重要特征。
整个运行时通过 LangGraph 构建为状态图,支持多种执行路径:
Argus 的技术选型非常务实,以成熟的开源生态为主:
| 技术组件 | 用途 | 说明 |
|---|---|---|
| LangGraph | Agent 编排 | 基于状态图的流程控制,支持分支路由和循环 |
| FAISS (faiss-cpu) | 向量检索 | 本地向量数据库,无需外部服务 |
| FastAPI | API 服务层 | 提供 HTTP 接口,支持 Telegram 集成 |
| LangChain (v1.3.x) | LLM 接口抽象 | 支持 OpenAI、Google GenAI 等多种后端 |
| Pydantic v2 | 数据建模 | 结构化输入输出验证 |
| Textual | CLI 界面 | 终端富文本 UI,支持 Markdown 渲染 |
| Composio | 工具生态集成 | 插件化工具调用框架 |
| FAISS CPU | 本地向量存储 | 无 GPU 依赖,CPU 即可运行 |
| PyMuPDF + python-docx | 多模态输入处理 | 支持文件/图片/PDF 的 AI 辅助理解 |
值得注意的是,Argus 的代码体量相当可观:agent.py 约 227KB(单文件超过 2000 行),agent_cli.py 约 109KB,main.py 约 68KB,体现了功能实现的完整性,而非轻量级演示。
Argus 提供两种使用方式:
交互式 CLI 控制台(推荐入门方式):agent_cli.py 构建了一个类 Codex 的终端界面——固定底部输入行、可滚动对话历史、Markdown 渲染、命令面板、多行编辑、实时状态栏。通过 scripts/install_argus.py 可全局安装 argus 命令;scripts/setup_argus.py 提供一键环境配置脚本。
FastAPI 服务:作为 API Worker 运行,支持 /api/chat 接口。通过 Telegram Bot 集成,可以实现"消息驱动的远程 Agent"——Telegram Bot 收到消息后转发给 Argus Worker,Worker 处理后将响应发回。
部署前置要求:
OPENAI_API_KEY(必需,存储在 .env 中)GOOGLE_API_KEY(可选,用于 Google GenAI 模型)无 GPU 依赖:核心向量检索和 Agent 逻辑运行在 CPU 上,不需要 NVIDIA 显卡,这对个人用户和小团队非常友好。
不支持 Docker:项目未提供 Dockerfile 或 docker-compose.yml,容器化部署需要用户自行构建。
Argus 也有一些需要正视的局限:
结构化提取器处于停用状态。README 明确说明,结构化内容(表格、行、引用、预算、时间线等)的提取代码存在于仓库中,但在主动学习路径中被禁用,正在调整基准记忆质量。这意味着某些需要精确数值聚合的场景(如"汇总本月所有支出")的能力可能受限。
基准测试成本高昂。完整 500 题 LongMemEval-S 基准测试在当前模型组合下实际成本约 $2,500(每题约 $5)。作者明确警告在跑全量测试前先用单题或小样本验证。
API Key 强制依赖。Argus 需要调用 OpenAI API 或 Google GenAI API 来驱动 LLM 推理,没有本地模型支持路径——这意味着使用成本取决于调用量,且存在隐私方面的考量(对话数据需上传到第三方 API)。
社区规模较小。截至分析时,仓库仅有 263 stars、26 forks,Quarq 组织关注者仅 15 人。作为 2026 年 5 月才创建的项目,成熟度有待时间验证。
Argus 的出现折射出一个明确的行业趋势:Agent 记忆能力的工程化。从 2025 年的 MemGPT、2026 年的 AgentMemory 到 Quarq 的 Argus,开发者们逐渐意识到"让 AI 记住"不是一个 prompt engineering 问题,而是一个系统工程问题——需要分层存储、混合检索、时间推理、证据门控等多维度的精心设计。
Argus 的 LangGraph + FAISS + 三层记忆架构,代表了当前开源社区在 Agent 记忆方向上较为完整的工程实现。虽然社区规模不大,但代码质量和架构设计体现了 Quarq Labs 的技术深度。值得关注其后续版本中结构化提取器的启用进展。
# 克隆仓库
git clone https://github.com/quarqlabs/argus.git
cd argus
# 一键环境配置(macOS/Linux)
python scripts/setup_argus.py
# 全局安装 argus 命令
python scripts/install_argus.py
# 启动交互式控制台
argus
或直接使用 Python:
export OPENAI_API_KEY=your_key_here
python agent_cli.py