second-brain-ai-assistant-course
从零构建生产级个人 AI 助理:RAG + Agent + Fine-tuning 三位一体的开源系
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
从零构建生产级个人 AI 助理:RAG + Agent + Fine-tuning 三位一体的开源系
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Second Brain AI Assistant 系统整体架构
你是一个 AI 研究者,每天需要阅读大量论文、浏览技术博客、整理笔记。当你想查找「上次看到的那篇关于 RAG 优化的文章」时,却发现笔记散落在十几个文件夹里,根本找不到。这种低效的「知识焦虑」,正是 Decoding AI 团队最初面临的问题。
Second Brain AI Assistant 是 Decoding AI 团队推出的开源课程项目,由 Paul Iusztin(AI/ML Engineer)和 Ernesto Larios(AI Engineer)主导,联合 MongoDB、Comet、Opik、Unsloth、ZenML 等知名 AI 基础设施厂商共同打造。课程通过 6 个模块,系统教授如何从零构建一个生产级的个人 AI 助理,让 AI 直接对话你的笔记、博客、论文——无需手动搜索,AI 帮你回忆和总结。
「第二大脑」的概念源自 productivity 领域专家 Tiago Forte 的著作《Building a Second Brain》。课程将其升级为 AI 时代版本:不是简单地管理笔记,而是构建一个能主动理解、检索、回答的 AI 系统。你可以把它理解为「Notion + ChatGPT」的深度融合——你的笔记就是 AI 的知识库,AI 就是你的智能检索入口。
课程分为两个核心模块:second-brain-offline 负责构建离线 ML 流水线,包含五大章节:数据 ETL 管道(从 Notion 或网络爬取文档)、质量评分、数据集蒸馏(用大模型生成微调数据)、模型微调(用 Unsloth + Comet 精细调整 Llama 3.1 8B)、高级 RAG 特征管道(contextual retrieval + parent retrieval)。second-brain-online 则构建在线推理服务,基于 smolagents 构建 RAG Agent,配合 Gradio 提供交互界面,并通过 Opik + Comet 实现全链路可观测性。

图2:数据 ETL 流水线架构
技术栈上,项目采用 LangChain 作为 RAG 和 Agent 的核心框架(langchain >= 0.3.14),ZenML 负责流水线编排,smolagents(HuggingFace 出品)驱动 Agent 推理,MongoDB 作为向量数据库和文档存储,OpenAI API 和 HuggingFace 作为底层 LLM 引擎。MLOps 工具链完整:训练用 Comet 记录实验,用 Opik 评估 RAG 质量,模型部署到 HuggingFace Endpoints。Python 包管理使用现代化的 uv,代码规范使用 ruff。

图3:模型微调与训练流水线
从代码质量来看,项目采用 Pydantic 做配置和类型校验,Loguru 替代 print 做日志,完整的 pyproject.toml 定义依赖,Makefile 提供标准化命令,测试使用 pytest。整体代码遵循模块化设计:src 目录结构清晰,每个 pipeline/step 可独立运行。文档质量极高:每个模块都有独立的详细 README,并配有架构图、数据集说明和逐步安装指南。

图4:课程配套的 Notion GenAI 资源数据集
需要注意的是,这是一个 系统性学习课程,不是可直接部署的生产应用。没有根目录 Dockerfile,不提供一键启动脚本。用户需要具备 Python 中级水平、了解 LLM/RAG 基础概念,并按模块顺序逐步配置环境。如果选择纯阅读模式(不运行代码),课程内容完全免费;如需运行代码,OpenAI API 成本约 $1-3。课程使用 Docker Compose 仅用于启动本地 MongoDB(开发用),不涉及应用本身的容器化。

图5:Opik LLMOps 评估结果示例
尽管不是生产应用,这个课程代表了当前 AI 应用开发的主流范式:RAG + Agent + Fine-tuning 三位一体,配合完整的 LLMOps 工具链。它的课程设计思路被广泛应用于企业内部知识库、AI 助手、智能文档问答等场景。从 GitHub 增长曲线看,项目自 2024 年底发布以来保持稳定更新,是 AI 开发者社区中口碑极佳的系统性学习资源。