personal-ai-assistant
通过 Telegram/Slack/WhatsApp 对话管理邮件、日历、Notion 待办和网络研究的分层多 Agent 个人助手系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
通过 Telegram/Slack/WhatsApp 对话管理邮件、日历、Notion 待办和网络研究的分层多 Agent 个人助手系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
周一早上8点,你坐在咖啡馆里,手机同时震动着来自 Slack 的 12 条未读消息、Gmail 里躺着 8 封待处理邮件、Notion 上的本周待办还没勾几个、日历显示下午2点还有个客户会议。你盯着这一堆待办事项,恨不得有个分身术。
现在想象:你打开 Telegram,给自己的 AI 助手发了条消息——"帮我看看今天下午2点前有哪些待办,顺便给 Emily 发邮件说我会晚到10分钟,再搜一下这个客户公司的最新动态"。30秒后,你的手机上陆续收到了:Notion 待办清单摘要、Gmail 发送成功通知,以及一份包含客户最新融资新闻的研究报告。
这正是 personal-ai-assistant 正在做的事情——一个运行在 Telegram、Slack 或 WhatsApp 上的分层多智能体系统,让你的日常生活事务在对话中自动流转。

图1:项目作者 kaymen99 的 GitHub 头像
大型语言模型(LLM)驱动的 AI Agent 在 2023-2024 年迅速崛起,早期实现多为"万能型"单 Agent——让一个模型同时管理邮件、日历、搜索等多个领域。这种设计的弊端显而易见:模型需要在每次工具调用时从大量相似工具中做选择,API 格式混杂,决策成本高,容易出错。
Supervisor Pattern(主管模式) 正是为此而生的多智能体协作架构。一个中央"主管 Agent"负责任务分发和质量把控,各领域的专家 Sub-Agent 专注于自己的工具链。2024 年,LangChain 官方文档专门收录了一篇基于相同模式构建个人助手的教程,说明这一架构已经进入主流视野。
本项目的作者 kaymen99 将这一模式落地为可直接运行的应用,集成了 Gmail、Google Calendar、Notion、Slack、WhatsApp 等多个真实生活/工作场景,无需 Web 界面,直接通过你最熟悉的聊天工具操控。
整个系统的核心是 Assistant Manager,它以 gpt-4o 作为底层模型(比各子 Agent 的 gpt-4o-mini 更强),负责以下关键决策:
主管 Agent 的 prompt 中明确写了"Executive Personal Assistant"的定位,要求它做到"确保任务细节具体、可操作、可实现"——这是一个明确为真实使用设计的 prompt,而非 Demo 级别的演示。
| Agent | 底层模型 | 核心工具 |
|---|---|---|
| Email Agent | gpt-4o-mini | Gmail API(读取/发送/查找联系人) |
| Calendar Agent | gpt-4o-mini | Google Calendar API(查日程/创建事件) |
| Notion Agent | gpt-4o-mini | Notion API(查待办/新增任务) |
| Slack Agent | gpt-4o-mini | Slack API(读取/发送消息) |
| Researcher Agent | gpt-4o-mini | Tavily 搜索 + BeautifulSoup 网页抓取 + LinkedIn Selenium 爬取 |
每个子 Agent 都有独立的 system prompt,包含角色定义、任务描述、工具选择策略和向主管 Agent 报告的流程。这种领域分离确保每次工具调用时,Agent 只需从少数几个高度相关的工具中选择,降低了决策复杂度。
系统使用 LangGraph Checkpointing(SqliteSaver) 实现多轮对话记忆持久化。每次对话的中间状态(主管 Agent 的决策、各子 Agent 的调用结果)都存入 SQLite 数据库,通过 thread_id 区分不同会话。这意味着即使用户关闭应用再重新打开,助手仍能基于之前的上下文继续工作。
子 Agent 的工具分为三类:
tavily-python 封装的网络搜索、notion-client 封装的 Notion API——稳定可靠,适合通用场景google-api-python-client 直接调用,配合 OAuth 2.0 认证selenium + webdriver_manager 模拟浏览器登录抓取,这是项目中较"脏"的部分——依赖浏览器环境,且 LinkedIn 的反爬策略可能随时导致失败代码质量方面,各 Tool 都用 @traceable 装饰器接入 LangSmith,可观测性较好;每个 Tool 都有 Pydantic schema 定义输入参数,类型安全;Agent 的 invoke 方法在首次调用时懒加载模型,避免启动开销。
整体是纯 Python 单体应用,无容器化、无微服务、无前端,纯靠配置文件(.env)驱动运行。
这个项目的部署难度被低估了——表面看是一个 pip install + python app.py 的脚本,实际上需要配置 8-10 个第三方服务的 API 凭证:
credentials.json硬件要求很低——不需要 GPU,纯 CPU 运行,2GB RAM 足够。但配置复杂度才是真正的门槛。对于非技术用户,光是理解 Google OAuth 流程就可能卡住。
personal-ai-assistant 代表着 2024 年 AI Agent 落地的一个真实方向——消息渠道作为 Agent 的自然交互界面。相比需要专门打开网页或 App 的 AI 助手,把 Agent 塞进用户已经重度使用的 IM 工具中,大幅降低了使用摩擦。
从架构学习角度看,这是一个教科书级别的 Supervisor Pattern 落地案例——代码结构清晰(agents/base、channels、prompts、tools 四层分离),prompt 工程有完整的注释说明,适合作为多 Agent 系统开发的上手项目。
分析基于 GitHub 仓库,2024 年 12 月最新提交。