AI-Infra-from-Zero-to-Hero
AI 系统全栈知识导航库,覆盖训练、推理、LLM Infra、边缘 AI 等领域的学术论文与工业实践
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI 系统全栈知识导航库,覆盖训练、推理、LLM Infra、边缘 AI 等领域的学术论文与工业实践
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
对于大多数 AI 开发者而言,训练和部署模型的过程往往像一个"黑箱"——你准备好数据、配置好参数、按下 Run,然后就等着 GPU 风扇呼呼转。但很少有人停下来思考:支撑这一切的基础设施系统,是如何从零构建起来的?
今天要介绍的这个项目,正是为所有想要打开这个"黑箱"的开发者准备的。它不是某个具体的模型,也不是某个现成的框架,而是一张面向 AI 系统全栈知识体系的地图——从数据处理、训练系统、推理系统,到 LLM 训练与推理、边缘 AI、联邦学习,覆盖了 AI 工程落地的每一个关键环节。
这个项目的作者 HuaizhengZhang 从 2019 年开始系统性地整理 AI 系统领域的学术论文、工业实践和开源工具。他发现,随着深度学习在各行业的深入应用,市场对"既懂算法又懂系统"的复合型人才需求急剧增长,但高质量的学习资料却散落在各个会议(OSDI、SOSP、NSDI、MLSys)和无数 GitHub 仓库中,没有一个统一的入口。
于是他决定自己动手——用维护一个 Awesome List 的方式,把机器学习系统的方方面面串联起来。项目从最初的几百 Star 起步,逐步成长为如今超过 4000 Star 的明星资源库,成为 MLsys 领域最受关注的学习导航项目之一。
项目的内容组织像一个精心设计的课程体系:
ML/DL Infra(机器学习基础设施) 涵盖数据处理(data_processing.md)、训练系统(training.md)、推理系统(inference.md)和 ML 基础设施(infra.md)。其中 inference.md 和 training.md 是最核心的两个模块,详细梳理了从模型编译优化、算子融合、量化压缩,到分布式训练、流水线并行的完整知识链条。
LLM Infra(大语言模型基础设施) 聚焦 LLM 时代的特殊性,分别讨论 LLM 训练(llm_training.md)和 LLM 推理(llm_serving.md)中的独特挑战,包括 MoE 架构、长上下文支持、KV Cache 优化等前沿议题。
Domain-Specific(垂直领域系统) 则覆盖视频系统(video_system.md)、AutoML 系统、边缘 AI、GNN 图神经网络系统、联邦学习系统和深度强化学习系统,为不同应用场景提供针对性的系统设计参考。

图1:AI System 全栈知识体系概览
Conference(学术会议导航) 单独整理了 MLSys、OSDI、NSDI、SOSP、SIGCOMM 等顶级学术会议的论文索引,帮助读者追踪学术前沿。
首先,它系统性强。不同于零散的单篇论文分享,这个项目用分类体系把 AI 系统的知识点串联成网,读者可以从任意入口进入,逐步探索相关领域。
其次,它兼顾学术与工业。每个子模块既收录了顶会论文(提供理论深度),也包含了工业实践案例(展示真实挑战)。例如在推理系统部分,既有微软 ONNX Runtime 的技术解析,也有 TensorRT、vLLM 等开源推理引擎的最佳实践。
第三,它持续更新。作者维护了一个活跃的团队,定期补充最新论文和工具,并提供 YouTube 和 B站视频教程,让抽象的系统概念变得更容易理解。
这个项目的定位是进阶学习资源,适合以下读者:
对于完全的初学者,建议先补充计算机系统基础(操作系统、分布式系统)再进入 MLsys 领域。
坦诚地说,这个项目也有它的局限性:
超过 4000 个 GitHub Star,意味着有数以千计的开发者认为这个项目有价值。在 AI 基础设施人才极度稀缺的当下,这样一个知识导航项目的存在,为行业新人的学习和老兵的复习提供了一个可靠的起点。
它也折射出一个趋势:AI 系统的复杂度已经到达一个临界点,单纯靠"调参"和"跑 Demo"已经无法满足工业需求,系统层面的理解将成为区分普通 AI 工程师和顶尖 AI 系统工程师的关键。这个项目,正是这条进阶之路上的第一盏路灯。