MineContext
持续感知屏幕上下文,让 AI 主动理解你的数字生活轨迹
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
持续感知屏幕上下文,让 AI 主动理解你的数字生活轨迹
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:MineContext 项目封面 Banner
想象一个场景:你花了半小时和AI讨论一个复杂项目,第二天再打开对话,它已经不记得你们聊过什么了。你不得不翻聊天记录、截图、发文档,把上下文重新灌进去。这种感觉,就像每次和助手说话都要从你好我是重新介绍自己一样令人沮丧。
这正是 MineContext 试图解决的核心问题。作为字节跳动旗下的开源项目,MineContext 提出了一个更激进的思路:不是让AI记住对话,而是让AI主动理解你的整个数字生活上下文——屏幕上的内容、最近修改的文件、聊天记录里的关键信息,全部自动捕获、按需浮现。
这不是一个简单的聊天机器人,而是一套完整的上下文工程 Context-Engineering 系统框架,旨在让AI从被动应答进化为主动感知。
在 AI 应用领域,有一个被广泛讨论的概念叫 RAG(检索增强生成),即在回答问题前从外部知识库检索相关信息。但 RAG 通常依赖预定义的知识库、固定的检索策略,检索时机和内容都是静态的。
MineContext 提出的 Context-Engineering 则更进一步:主动捕获加动态理解加按需浮现。具体来说,它通过截图、文件监控、API订阅等多种方式持续采集用户的数字上下文;然后利用多模态大模型(VLM)对这些上下文进行内容理解,提取关键实体和事件;最后通过向量检索和知识图谱,在合适的时机将相关上下文推送给用户或AI。
打个比方:传统AI像是一个每次见面都要你重新自我介绍的同事,而 MineContext 让AI更像一个一直跟在你身边、默默观察你的工作习惯、能在关键时刻递上相关资料的专业助理。
MineContext 的功能设计围绕四个核心支柱展开:
1. 无负担收集(Capture Without Burden)
系统支持从多种来源自动捕获上下文:本地文件系统变更、RSS订阅流、聊天记录、屏幕截图、AI对话历史等。用户无需手动整理,所有信息都在后台默默积累。系统通过存储管理设计,解决了海量收集却无心智负担的矛盾——换句话说,你只管用,它只管记。
2. 主动推送(Proactive Delivery)
这是 MineContext 区别于传统工具的关键能力。不需要你提问,系统会自动提炼每日、每周总结、待办事项、活动记录和关键洞见,主动推送到主页。比如它可能在你忘记某件事时提醒你上周讨论过这个方案,或者在周五生成一周工作回顾。
3. 智能浮现(Intelligent Recall)
在用户进行创作或分析时,系统会基于当前任务语义,智能浮现相关的历史上下文。不再需要手动搜索聊天记录或翻找文件——相关内容像第六感一样自然涌现。目前这一功能仍在持续完善中。
4. MCP协议支持(Model Context Protocol)
MineContext 实现了 MCP(Model Context Protocol)服务端,外部AI应用可以通过标准协议访问其处理好的上下文数据。这意味着它不仅仅是一个独立应用,更是一个可以被其他AI工具调用的上下文中间件,极大拓展了使用场景。
从架构文档来看,MineContext 采用清晰的分层设计,共五个核心层次:
① 上下文捕获层(Capture):负责从多源采集数据。支持本地文件监控(监控创建、修改事件)、API数据流订阅、用户交互记录(聊天、截图、AI对话)等。每种来源都有对应的捕获模块,架构上支持扩展新的数据源。
② 上下文处理层(Processing):这是系统最复杂的部分。捕获的原始数据会经过:文档切分(结构化、非结构化分别处理)→ 多模态内容理解(通过VLM理解截图、聊天内容)→ 实体抽取与关系建模 → 知识提炼(去噪、合并、分类)→ 向量化(Embedding)。系统还支持时间驱动的上下文压缩,自动管理记忆的生命周期。
③ 存储层(Storage):采用混合存储策略。SQLite存储结构化元数据(实体画像、活动记录、流程记录),ChromaDB向量数据库存储客观知识和事件向量。ChromaDB内部分为多个向量集合,分别存储客观知识、事件记录、实体关联等不同类型的语义向量。
④ 大模型层(LLM):支持多模型接入。默认使用 OpenAI API,同时深度集成字节自研的豆包系列模型(Doubao VLM 用于多模态理解、Doubao Embedding 用于向量化)。架构设计上采用接口抽象层,可方便地替换为其他模型供应商。
⑤ 上下文服务层(Services/Consumption):提供 MCP Server 通过标准协议对外暴露上下文能力,同时支持意图识别与查询改写、关系网络构建、时间线视图生成、双向语义检索、混合检索(语义加关键词)等高级查询能力。
MineContext 的技术选型非常务实。后端完全由 Python 实现(要求大于等于 3.10),核心依赖包括:
前端采用 Electron 构建跨平台桌面客户端,用户可以直接下载 dmg、exe 安装包使用。相比纯 Web 版本,Electron 可以更方便地实现本地文件监控、屏幕捕获等系统级能力。项目还提供了 build.sh 脚本支持本地源码构建,开发文档相当完善。
MineContext 的安装体验设计得非常友好。根据 README 的描述,用户只需:
对于开发者而言,源码构建需要 Node.js(大于等于 18)构建前端、Python(大于等于 3.10)运行后端,还需要 Playwright 运行环境和屏幕截图权限。项目不提供 Docker 支持,但 build.sh 脚本封装了大部分构建步骤,有一定 Python、Node 经验的开发者可以顺利上手。
需要客观指出 MineContext 当前面临的一些挑战:
隐私风险是首要顾虑。 系统需要持续监控屏幕和文件活动,这种始终在线的上下文捕获模式意味着所有工作内容都会被记录和上传到模型服务商处理。用户必须信任 API 提供方不会滥用数据,这在企业场景中可能是合规障碍。
智能浮现功能仍在开发中。 目前主动推送功能相对成熟,但最核心的创作时智能浮现上下文体验可能还不够稳定。用户应保持合理预期。
不支持容器化部署。 项目没有 Dockerfile 或 docker-compose,对于希望在服务器上运行或进行批量部署的用户来说不够友好。当前只能通过桌面客户端使用。
对非开发者有一定门槛。 虽然提供了安装包,但配置 API 密钥、设置权限、处理截图权限等操作,对完全没有技术背景的用户可能造成困扰。
MineContext 的真正价值不在于它本身有多好用,而在于它代表了一种新兴的 AI 应用范式——上下文优先(Context-First)。
传统的 AI 应用是问答式的:用户提问,AI回答。但真正强大的 AI 助手应该是环境感知式的——它知道你在做什么、做过什么、关心什么,能在你需要时主动提供支持。MineContext 通过系统性地解决上下文捕获、存储、检索和推送问题,为这种范式提供了可复用的工程框架。
特别值得一提的是,MineContext 实现了 MCP 服务端,这意味着它可以作为一个上下文中间件被其他 AI 应用接入。这比做一个独立的 AI 工具更有战略价值——当其他应用可以通过标准协议获取用户上下文时,整个 AI 生态系统的能力都会得到增强。
从项目增长来看,GitHub 5,349 颗星(且在 Trendshift 上榜)说明社区对这类上下文工程方向的关注度正在上升。随着 AI Agent 应用的爆发,上下文管理将成为所有 AI 系统的核心需求,MineContext 的探索值得持续关注。
一句话总结: MineContext 是字节跳动开源的主动式上下文感知 AI 伴侣,通过持续捕获、智能提炼和按需浮现,让 AI 真正记住用户的数字生活,是 Context-Engineering 领域的开源实践标杆。