ai-engineer-notebooks
从零实现 RAG、Agent、评估体系,全程不依赖框架,Groq API 免费运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
从零实现 RAG、Agent、评估体系,全程不依赖框架,Groq API 免费运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象一下这个场景:你是一名后端工程师,最近拿到了一个 AI Engineer 的面试机会。面试官问:「请从零实现一个带工具调用的 Agent 循环,如何保证它在生产环境里不出问题?」
你脑子里闪过 LangChain 的文档——但说实话,你只是会用,并不真正理解它底层在做什么。这是一个让很多想转型 AI 工程的开发者都头疼的问题:框架用熟了,却不知道自己到底在做什么。
calmrocks/ai-engineer-notebooks 正是为解决这个问题而生。这个开源项目用 40+ 个 Jupyter Notebook,在免费 Groq API 上,从提示词工程讲到模型微调,从 RAG 讲到 Agent 安全,全程不依赖任何框架,让你亲手写出 LangChain、LlamaIndex 背后的每一个机制。它不是一门课,而是一套可以直接在 Google Colab 里运行的实战练习册。
在深入项目本身之前,有必要先理解它对应的职位背景。Forward Deployed Engineer(FDE,前向部署工程师) 这个角色近年来呈现爆发式增长——LinkedIn、Indeed 等平台数据显示,相关职位发布量年同比增长超过 800%,Anthropic、OpenAI、Palantir、Snowflake、Databricks 等头部公司均在大力招聘。
FDE 的核心职责是在客户真实业务场景中直接落地 AI 系统:与客户共刨需求、设计 AI 工作流、在实际数据上评估效果、快速迭代。他们既是工程师,又是 AI 调优师,需要同时理解业务约束和模型能力边界。
这个岗位的崛起代表了 AI 落地方式的一个根本性转变:不再是后端工程师把模型 API 封装好扔给产品团队,而是工程师直接驻场、端到端负责。这也是为什么 calmrocks 的项目说「You can ship production code; you want the applied-model layer on top」——有生产级代码能力的人,补上 AI 应用层就能胜任这个岗位。
大多数 AI 课程和教程会直接教你怎么用 LangChain、怎么调 LlamaIndex 的参数。但这个项目反其道而行:要求你从零实现 RAG、Agent 循环和评估系统,只有在自己写出了完整逻辑之后,才会告诉你 LangChain/LlamaIndex 实际上在做什么封装。
这样做的好处是什么?当你在生产环境中遇到问题——比如 RAG 返回的答案总是偏离上下文、Agent 陷入了死循环、工具调用返回格式错误——你不再需要靠搜索引擎碰运气,而是能够从底层推理出问题的根源。框架是工具,不是护城河;理解底层逻辑才是。
这种「框架优先还是原理优先」的讨论在 Hacker News 上引发了热烈讨论,有评论直接称之为「最好的免费 AI 工程学习资源」。
项目内容按学习路径组织为 12 个章节,每章由若干独立 Notebook 组成,每个 Notebook 都自带依赖安装、API Key 配置(通过 Colab Secrets)和课后练习:
| 章节 | 主题 | 核心内容 |
|---|---|---|
| 00 Setup | 环境配置 | Colab Secrets 使用、API Key 管理、费用控制 |
| 01 Model APIs | 模型 API | 提示词工程、结构化输出(JSON)、工具调用、流式响应、上下文缓存 |
| 02-04 Evals | 评估体系 | 金标准集构建、LLM-as-Judge、回归测试、评估即骨架 |
| 05 Agents | Agent 开发 | 从零实现 Agent 循环、工具设计、Guardrails 与预算控制、MCP 协议、渐进式披露 |
| 06 Adaptation | 模型适配 | Fine-tune vs. RAG vs. Prompt 对比;LoRA 微调(含 Colab T4 GPU 验证) |
| 07 Security | 安全攻防 | Prompt Injection 攻击与防御、信任边界管理 |
| 08-10 Operations & Serving | 工程化 | 可观测性、LLMOps、容错降级、vLLM 自托管推理、性能优化 |
| 11-12 Customer Craft | 客户交付 | 需求挖掘与范围定义、支持助手调试实战、Agent vs. Pipeline 成本对比、Red Team 鲁棒性评估 |
评估即骨架(Evals as the Spine) 是贯穿全项目的方法论:项目要求在动手做任何功能之前,先建立测量基准。这与很多「先做再测」的常见做法相反,但它是区分「做出了 demo」和「做出了可上线系统」的关键习惯。
项目选择 Groq 作为默认推理后端,核心原因是完全免费、无需信用卡,这对学习者非常友好。Groq 的 LPU(Language Processing Unit)推理芯片以极低延迟著称,在部分任务上甚至超过 GPT-4o 的响应速度。
但 Groq 也有局限:它不支持 LoRA 微调(需要 GPU)和自托管推理(09-Serving 部分提供了 vLLM 可选方案,用 Colab T4 GPU 验证可行)。此外,Groq 的模型阵容相比 OpenAI 和 Anthropic 仍在丰富中,生产级项目可能需要后续迁移到其他后端。好在整个项目基于 OpenAI 兼容接口,所以切换基础 URL 就能无缝迁移到其他服务商。
项目最后三章提供了完整的端到端案例研究——不是 toy demo,而是真实约束下的实战记录:
这三个案例覆盖了 AI 工程落地的核心场景,对于准备面试或实际项目都有很高的参考价值。
项目代码质量有几个值得注意的亮点:
aien 工具包:一个极简的 groq>=0.11 依赖包,统一封装 Groq API Key 加载和客户端初始化,所有 Notebook 都依赖这个共享包。pip install -e . + 设置 GROQ_API_KEY 环境变量,即可在本地 Jupyter 环境中运行。诚实地讲,这个项目也有一些局限:
这个项目最核心的价值,不在于教会你用某个特定工具,而在于构建了一个 FDE / AI Engineer 的完整技能图谱。从模型 API 调用、到 RAG、到 Agent、到微调、到 LLMOps——这些技能组合在一起,就是一个 AI Engineer 的核心能力矩阵。
随着 AI 应用从「能跑 demo」进化到「能上生产」,市场对这类复合型人才的需求正在急剧扩大。GitHub Topics 上 forward-deployed-engineer 和 ai-engineering 的热度持续攀升,而真正能覆盖从提示词到 serving 完整链条的学习资源仍然稀缺。calmrocks 的这套 Notebook,恰好填补了这个空白。
项目基本信息