llm-internals
一步步推导 LLM 内部机制:Tokenization、Attention、Backpropagat
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一步步推导 LLM 内部机制:Tokenization、Attention、Backpropagat
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:LLM Internals 项目横幅
你用 ChatGPT 问了一道数学题,AI 秒出答案。你兴奋地转发给朋友,却没停下来想过:这个问题到底是怎么被理解、被推理、被回答的?
Token 是怎么切分的?为什么「你好」可能不是一个词?Attention 机制里的 Q(Query)、K(Key)、V(Value)矩阵在做什么?Softmax 之后那些概率是怎么「决定」下一个词的?Backpropagation 的梯度是怎么一点一点修正神经网络的?RLHF(从人类反馈中学习)是怎么让 AI 变得「听话」的?
这些问题,构成了大语言模型最深层的冰山。而 amitshekhariitbhu/llm-internals 这个仓库,就是那把凿开冰山的工具。
图2:项目作者 Amit Shekhar(@amitiitbhu),Outcome School 创始人
本项目的作者是 Amit Shekhar,印度理工学院 IIT(IIT BHU Varanasi)2010-2014 届毕业生,现任 Outcome School 创始人,长期从事 AI 与机器学习教育。
Amit Shekhar 此前已有多个知名开源项目,在 GitHub 上积累了大量关注者。他的教学风格以化抽象为具体著称——擅长用一步一步的数字推导(step-by-step numeric example)替代枯燥的公式罗列,让数学推导变得可触可感。
llm-internals 仓库创建于 2026 年 4 月,短短三个月内积累超过 1331 Stars(截至分析时),成为 2026 年 AI 教育领域增速最快的学习资源之一。项目同步发布在 Outcome School 官网和 YouTube 频道,形成了「博客 + 视频 + 代码仓库」三位一体的学习生态。
如果把大语言模型比作一个人:
传统的 AI 教学往往直接给公式、给代码,学生记住步骤却不知道原理。Amit 的方法反其道而行:从数字出发,手推每一步矩阵运算,让学习者真正「看见」算法在做什么,而不是机械地调用 API。
目前仓库已覆盖以下核心主题,按学习路径排列:
BPE 是 GPT 系列、LLaMA、DeepSeek 等主流模型的共同选择。本节从「为什么需要分词」出发,完整推导 BPE 的合并规则,展示同一个词是如何被分解成 subword(子词)单元的——比如英文单词 "lower" 可能被拆成 "low" + "er",而中文则面临完全不同的切分挑战。
这是整个 Transformer 架构的核心。作者用具体数值矩阵替代抽象符号,完整演示:如何从输入词向量生成 Q、K、V 三个矩阵;Q × K^T 的点积得分代表什么;为什么要除以 √dₖ 进行缩放(方差推导是本节的亮点);Softmax 如何将得分转化为概率分布;Attention weights × V 矩阵的加权求和过程。
解释了为什么 GPT 这样的 decoder-only 模型不能「看到未来」。通过构造因果掩码矩阵,演示 masked attention 如何将未来 token 的注意力分数强制置为 -∞,从而保证自回归生成的顺序正确性。
从链式法则出发,用具体数值完整追踪前向传播(forward pass)和反向传播(backward pass)全过程,包括梯度计算、权重更新。不依赖任何深度学习框架,纯 NumPy 实现,是理解训练过程的最佳实践。
详细解释分类任务中 Softmax + Cross-Entropy 的组合为何是「黄金搭档」,配合一步步的数值示例说明预测概率与真实标签之间的距离是如何计算的。
仓库持续更新中,2026 年新增了多项前沿内容:
| 维度 | 分析结果 |
|---|---|
| 仓库类型 | 纯文档 / 学习资料 |
| 主要语言 | Markdown(README 驱动) |
| 代码结构 | assets/ 目录存放图片资源,无代码文件 |
| AI 框架 | 无(纯概念教学,非工程实践) |
| 容器化 | 无 |
| Web UI | 无 |
| License | Apache-2.0 |
虽然项目本身不产出可运行的代码,但它提供的数学推导和概念图谱对于理解和改进真实 LLM 系统至关重要——无论是做预训练、微调,还是部署优化,都离不开这些基础知识。
值得注意的是:这是一个「Living Repository」(活的仓库),作者明确表示会持续更新新的博客和视频。随着 LLM 领域的发展,这个仓库的内容边界也在不断扩展。
llm-internals 的定位是概念理解,而非工程实践。它的局限也很明显:
纯阅读型,无交互环境:没有 Colab notebook、没有在线运行按钮。读者只能「看」,无法直接动手改参数、做实验。如果你想把 Attention 的代码跑起来,还需要配合其他代码仓库(如 Andrej Karpathy 的 makemore 系列)。
缺少最新架构细节:截至分析时,仓库尚未覆盖 Flash Attention、Speculative Decoding、KV Cache 等推理优化技术的具体实现,对这部分感兴趣的开发者可能会失望。
语言偏向英文社区:博客和视频以英文为主,虽然 GitHub 页面是英文,但关键数学推导部分语言无关,全球通用。
不教你「怎么用」LLM:如果你想学 LangChain、AutoGen、vLLM 等工程工具,这本书帮不上忙。它的目标是让你理解 LLM 内部在做什么,而不是教会你怎么调用它。
2025-2026 年,LLM 应用层已经高度成熟——调用 API、构建 RAG、编写 Agent,已经有了大量框架和教程。但原理层的学习资源始终稀缺。llm-internals 的出现恰好填补了这一空白。
从增长曲线来看,该仓库 2026 年 4 月创建,7 月已超过 1331 Stars,增速远超同期同类教育仓库。背后有两个驱动力:
这也代表了 AI 教育的一个新趋势:从「怎么用」到「为什么」的逆向回归。当工具越来越傻瓜,原理的价值反而越来越稀缺。
| 维度 | 评分 |
|---|---|
| 内容质量 | ⭐⭐⭐⭐⭐ |
| 更新频率 | ⭐⭐⭐⭐ |
| 受众覆盖 | ⭐⭐⭐⭐ |
| 工程实用性 | ⭐⭐ |
| 总体推荐 | ⭐⭐⭐⭐ 适合想深入理解 LLM 原理的工程师和研究人员 |
如果你是 AI 应用开发者,这个仓库能帮你理解为什么模型会「幻觉」、为什么需要「温度」参数、为什么 Attention 是 Transformer 的核心。它不能让你直接多赚一分钱,但能让你少走很多弯路。