vector-search-class-notes
普林斯顿大学AI长期记忆与向量搜索课程笔记,由Pinecone CEO、FAISS核心开发者、DiskANN作者联合讲授
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
普林斯顿大学AI长期记忆与向量搜索课程笔记,由Pinecone CEO、FAISS核心开发者、DiskANN作者联合讲授
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2023 年,大模型狂飙突进,但一个根本性问题始终悬而未决:大模型的"记忆"能持续多久?
ChatGPT 的上下文窗口再长,也装不下一个公司十年积累的产品文档;Claude 的参数再多,也记不住用户三个月前的操作偏好。当 AI 开始"遗忘",开发者们才意识到——AI 长期记忆系统,才是这场游戏的下半场。
而向量数据库,正是这场下半场的基础设施。
那么问题来了:向量搜索背后的数学原理是什么?从近邻搜索到量化压缩,从 KD-Tree 到 HNSW,工业级方案如何炼成?
这就是普林斯顿大学 COS 597A 这门课要回答的核心问题。
这门课程的全称是"Long Term Memory in AI - Vector Search and Databases",由普林斯顿大学 2023 年秋季学期开设,课程编号 COS 597A。
师资配置堪称豪华:
三位讲师分别代表了向量搜索领域最重要的三个角色:向量数据库产品、向量搜索开源库、工业级大规模搜索系统。这种"产、学、研"三方同台授课的模式,在公开课程中极为罕见。
课程共 9 个讲座,覆盖向量搜索的完整技术栈:
第一阶段:向量基础与嵌入
第 1-3 讲从向量空间模型的基本概念出发,解释嵌入向量(Embedding)作为信息瓶颈的作用——为什么用向量表示比端到端学习更具可解释性和可扩展性。课程涵盖文本嵌入和图像嵌入的具体方法,以及向量空间中的距离度量选择。
第二阶段:索引与搜索算法
第 4 讲引入低维向量搜索问题,逐步过渡到近似近邻搜索(ANN,Approximate Nearest Neighbor Search)——因为精确搜索在十亿级数据量下计算代价不可接受。第 5 讲讲解降维技术(PCA 等)如何减少存储和计算开销。
第三阶段:工业级算法
第 6-9 讲是课程的核心,分别深入讲解:
本仓库本质上是一个 LaTeX 文档项目,而非可执行软件。
代码组件:
bibtomarkdown.py:Python 辅助脚本,将 BibTeX 引用转换为 Markdown 格式,用于文档生成build.sh:Unix Shell 脚本,驱动 LaTeX 编译流程,生成 PDF 讲义vs.bib / vs.sty:课程自定义参考文献格式和 LaTeX 样式宏包内容文件:
.tex(LaTeX 源码)和 .pdf(输出讲义)Class_08_runbook_for_students.ipynb:Jupyter Notebook 格式的学生实验手册images/ 目录包含课程图解(KD-Tree 构造过程、PCA 投影、向量空间模型等)构建方式: 在类 Unix 系统(Linux / macOS)上,安装 texlive 套件(含 pdflatex、bibtex)后,执行:
git clone git@github.com:edoliberty/vector-search-class-notes.git
cd vector-search-class-notes
./build
即可在本地编译生成完整 PDF 讲义集。
在线阅读: 课程已部署至 GitHub Pages,无需本地编译即可访问:https://edoliberty.github.io/vector-search-class-notes/
适合人群:
前置知识:
课程局限性:
向量搜索赛道在 2023-2024 年经历了爆发式增长。Pinecone、Weaviate、Milvus、Chroma 等向量数据库项目合计融资超过 10 亿美元。GitHub 上向量搜索相关项目的 star 增长曲线几乎呈指数形态。
而这门课的特殊价值在于:它不是向量数据库厂商的宣传材料,而是三位深度参与这一领域工业实践的从业者,从学术和工程双重视角讲授的完整知识体系。
Edo Liberty 讲授的向量数据库产品设计思维、Matthijs Douze 分享的 FAISS 内部实现细节、Harsha Simhadri 演示的 DiskANN 磁盘优化策略——这些内容在公开资料中极为稀缺。
对于希望真正理解向量搜索而不是仅仅调用 API 的开发者,这门课程笔记是目前 GitHub 上性价比最高的自学资源之一。