LLM-RL-Visualized
100+张原创架构图,系统图解LLM/VLM/RL/RLHF/GRPO/DPO等核心算法原理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
100+张原创架构图,系统图解LLM/VLM/RL/RLHF/GRPO/DPO等核心算法原理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否曾在学习大模型时,被密密麻麻的公式和代码绕晕?强化学习(RL)如何让 GPT 变 ChatGPT?DPO 和 RLHF 究竟有何本质区别?这些问题,你是否也曾反复查阅却总觉得差点意思?
changyeyu/LLM-RL-Visualized 就是为解决这些困惑而生的。
本仓库的作者是《大模型算法:强化学习、微调与对齐》一书的作者 changyeyu。changyeyu 在 GitHub 上被标记为"2025年度优秀作者",长期专注于大模型和强化学习领域的研究与教学。2025年,changyeyu 将书中积累的 100+ 张原创架构图 全部开源,诞生了 LLM-RL-Visualized 项目,一经发布便迅速获得 4000+ Stars。
项目的核心理念非常朴素:一张好图,胜过千言万语。对于 LLM 和 RL 这类高度抽象的算法体系,传统的文字解释往往事倍功半,而一张精心绘制的架构图能够一目了然地展示数据流、模块关系、算法流程,让学习者迅速建立直觉。
项目内容覆盖大模型和强化学习的完整知识体系,分为 11 大章节:
第 1-2 部分:全景图与基础
包含"大模型算法总体架构图"(全网最大)、"强化学习算法图谱"(8MB 超大 PDF)、"LLM 结构全视图"(1.8MB 高清 PNG)等多张总览图,以及 LLM 输入层、输出层、解码过程的详细拆解。
第 3 部分:有监督微调(SFT)
深入讲解 LoRA、Prefix-Tuning 等主流微调技术,配合可视化图表说明 TokenID 映射、Packing 策略和交叉熵 Loss 计算过程。
第 4 部分:DPO(直接偏好优化)
这是当前最热门的模型对齐技术之一。仓库不仅详细展示了 DPO 的训练架构,还解释了 β 参数对训练的影响,以及隐式奖励差异如何作用于参数更新幅度——这些细节往往是学习 DPO 时的最大难点。
第 5 部分:免训练的优化技术
涵盖 CoT(思维链)、Self-consistency CoT、ToT、GoT 等推理优化方法,以及波束搜索、Top-K/Top-P 采样、RAG 和 Function Calling 等工程实践。
第 6-7 部分:强化学习基础与策略优化
从 RL 发展历程、马尔可夫决策过程(MDP)、Q 函数、V 函数,到 Actor-Critic 架构、GAE 优势估计,再到 PPO 和 GRPO 两大核心算法的演进路径,全部配以架构图逐层拆解。
第 8 部分:RLHF 与 RLAIF
详细展示 RLHF 两阶段训练流程、奖励模型(RM)结构、PPO 中四种模型的合作关系,以及 RLAIF 与 RLHF 的区别——这正是 ChatGPT、DeepSeek 等模型背后最关键的对齐技术。
第 9 部分:逻辑推理能力优化
讲解 ORM/PRM(过程奖励模型)、MCTS(蒙特卡洛树搜索)在推理中的应用,以及知识蒸馏、多数投票等方法。
第 10 部分:大模型基础拓展
涉及 ALiBi/RoPE 位置编码、量化、梯度累积、Gradient Checkpoint、MHA/GQA/MQA/MLA 注意力机制对比、SwiGLU 等高级主题。
第 11 部分:参考文献与引用
附完整参考文献,支持 BibTeX 格式引用,适合学术写作。
每一张图都提供了三种格式:
所有图解均为 中文版(images_chinese)和英文版(images_english)双版本,兼顾国内外学习者。
这是一个纯静态内容项目,无任何代码依赖,无需安装任何环境。用户只需在浏览器中打开 GitHub 仓库地址,点击任意图片即可查看高清大图,查看 SVG 格式可获得最佳浏览体验。README 文件本身就是一本图文并茂的教科书。
在大模型飞速发展的今天,学习资料虽然丰富,但高质量的可视化资源极为稀缺。大多数教程要么过于理论化(满篇公式),要么过于工程化(满篇代码),缺乏一条从理论直觉到工程实践的桥梁。LLM-RL-Visualized 正是这座桥梁。
它尤其适合以下人群:
2025 年,强化学习与大模型的结合(RL for LLM)成为最热门的 AI 研究方向之一,o1、DeepSeek-R1、GRPO 等新范式相继涌现。这个时间点开源如此完整的图解资源,其行业价值不言而喻。
LLM-RL-Visualized 的价值不在于代码,而在于知识呈现方式的创新。它证明了一个好的可视化资源,对学习者的帮助可能远超一本厚重的教材。如果你正在学习大模型、强化学习或 AI 对齐技术,这个仓库值得在你的收藏夹里占有一席之地。