Awesome-Knowledge-Distillation-of-LLMs
LLM 知识蒸馏领域最系统的综述导航,收录 319 篇论文三维分类
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
LLM 知识蒸馏领域最系统的综述导航,收录 319 篇论文三维分类
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:LLM 知识蒸馏的三大核心价值
想象一位老中医积累了毕生经验,现在要把诊疗思路「蒸馏」给年轻学徒——学徒虽功力尚浅,但已掌握核心方法论。这个过程,就是大模型知识蒸馏(Knowledge Distillation, KD)的本质。随着 GPT-4、Claude 等超大参数模型能力越来越强,计算成本高得吓人,中小企业望而却步。正是在这一背景下,LLM 知识蒸馏在 2023-2024 年迎来爆发式发展。Awesome-Knowledge-Distillation-of-LLMs 就是这股热潮的集大成者——由港大、马里兰大学、微软等学者联合维护,配套同名 arXiv 综述(arXiv:2402.13116)。
该仓库创立于 2024 年 2 月,截至分析时已收录 319 篇 来自 arXiv、ACL、ICLR、EMNLP 等顶会的相关论文,涵盖知识蒸馏的完整技术栈。截至 2026 年 6 月,已获得 1,288 Stars 和 72 Forks,成为 LLM 知识蒸馏领域最受欢迎的社区资源之一。
项目最核心的价值在于提供了一套系统化分类框架,从 Algorithm(算法)、Skill(技能)、Verticalization(垂直化)三个维度对 LLM 知识蒸馏进行组织,帮助研究者和工程师快速定位方向,避免在浩如烟海的论文中迷失。
这一维度回答的核心问题是:如何从大模型中提取知识,又用什么方式教给小模型? 仓库将过程拆解为两步:
第一步:知识获取(Knowledge Elicitation)
Labeling(标注):让大模型生成高质量标注数据。「Large Language Models Are Reasoning Teachers」(ACL 2022)和「Is GPT-3 a Good Data Annotator?」(ACL 2022)证明 GPT-3.5/4 生成的标注质量可媲美甚至超越人工标注,但成本大幅降低。
Expansion(扩展):通过 prompt engineering 扩展训练数据。WizardMath 用强化学习 + Evol-Instruct 扩展数学指令数据;Code Llama 通过代码指令扩展实现强大代码能力;Self-Instruct 则让模型自主生成指令数据。
Curation(筛选):用大模型生成海量数据后做质量筛选。Phi 系列(Phi-1、Phi-1.5、Phi-2)颠覆性证明:用 GPT-4 生成的高质量「教科书级」数据,即便只有 10 亿参数,也能超越用海量网络数据训练的百亿参数模型。
Feature(特征蒸馏):蒸馏中间层表示。如 DISTILLM、MiniLLM 关注 logits 蒸馏的 KL 散度优化,BitDistiller 探索 4-bit 量化的自蒸馏。
Feedback(反馈):用大模型评估小模型输出并提供改进信号。RLAIF(用 AI 反馈替代人工反馈)大幅降低蒸馏成本,Constitutional AI 探索用 AI 原则指导对齐。
Self-Knowledge(自知识):大模型利用自身知识自我提升,绕过对外部教师模型的依赖。Self-Rewarding LM、V-STaR、SPIN 等开创性工作成为开源模型自我增强的重要路径。
第二步:蒸馏算法(Distillation Algorithms)——用什么方式训练学生模型。包括:Supervised Fine-Tuning(SFT)直接用蒸馏数据微调;KL 散度/MMD 等度量对齐教师与学生分布;RL 框架优化蒸馏目标;排序/偏好学习优化等。
这个维度关注的是:蒸馏哪些具体能力?
上下文跟随(Context Following):包括指令遵循(Instruction Following)、多轮对话(Multi-turn Dialogue)、RAG 能力等。Orca 2 证明让学生模型学习 GPT-4 的推理过程(而不仅是最终答案),能显著提升复杂指令的遵循能力。
对齐(Alignment):涵盖思维模式(Chain-of-Thought、System-2 推理)、偏好学习(DPO、PPO)、价值观对齐等。Lion 探索对抗性蒸馏,SelFee 让模型通过自我反馈迭代改进。
Agent 能力:工具使用(Tool Using)和规划(Planning),是当下最热门的前沿方向,Language Model Self-improvement by RL 等工作为 Agent 蒸馏开辟了新思路。
NLP 专项 + 多模态:NLU、NLG、信息检索、推荐系统、代码生成等专项能力,以及视觉-语言模型的多模态蒸馏。
通用模型蒸馏完成后,还需要针对垂直领域做定制化:法律(法律文档理解、判例推理)、医疗(临床诊断、医学文本)、金融(财报分析、风险评估)、科学(科研文献理解)等均有专门研究。这些垂直蒸馏工作是 LLM 在专业场景落地的关键。
综合仓库中 319 篇论文,可以总结出当前 LLM 蒸馏的几大核心趋势:
趋势一:数据质量优先于数据数量。Phi 系列证明「教科书级」高质量数据能以少胜多,Code Llama、WizardCoder 验证了「质量优先」思路在代码领域的普适性。
趋势二:推理链蒸馏成为主流。Orca 系列证明让学生学习推理过程能显著提升小模型能力。Symbolic CoT 将符号推理与神经蒸馏结合,Distilling Step-by-Step 在多个 benchmark 上达到 SOTA。
趋势三:自蒸馏绕过教师依赖。Self-Rewarding LM、V-STaR、SPIN 等工作让模型利用自身数据不断提升,绕过对外部大模型的依赖,特别适合开源模型的自我增强。
趋势四:RLHF 与蒸馏深度融合。RLAIF 大幅降低标注成本,MiniLLM 改进蒸馏目标函数,Constitutional AI 探索 AI 原则指导的对齐路径,三者共同构成当前对齐蒸馏的新范式。
知识蒸馏并非银弹。项目 README 明确指出法律风险:使用 LLM 输出数据训练可能涉及版权和隐私问题,商业场景需谨慎评估。
能力降级是普遍现象——小模型蒸馏后往往能保留约 90% 的通用能力,但复杂推理、长文本生成等高阶能力会显著退化。如何「选择性保留」核心能力而「精准丢弃」冗余能力,是当前研究的核心难题。
此外,评估标准不统一也是问题。不同论文使用的 benchmark 各不相同,仓库中专门提供的 Summary Table 是跨工作横向对比的少数参考之一。
AI 研究者:这是该领域最系统的文献地图。先通读 README 分类框架找到切入点,再深入具体分类下的论文。建议配合原 arXiv 综述论文(arXiv:2402.13116)阅读效果最佳。
算法工程师:重点关注有公开代码的论文(仓库「Code」列),如 MiniLLM、Orca、Self-Rewarding、SPIN 等,这些可以直接复现和落地。本项目为纯 Markdown 文献库,无容器化支持。
产品/决策者:了解大模型压缩技术的当前进展和能力边界,为 AI 产品选型提供参考。
截至 2026 年,LLM 知识蒸馏已从学术研究走向工程落地。Meta 的 Llama 系列、Apple 的设备端模型、Google 的 Gemini Nano 都大量使用蒸馏技术,使模型能在消费级硬件(手机、汽车座舱、边缘设备)上运行。可以预见,随着开源大模型生态持续繁荣,蒸馏将成为连接「最强模型」与「最广场景」的关键桥梁。建议持续关注仓库每周更新,及时跟踪最新研究进展。
数据来源:GitHub 仓库(截至 2026 年 6 月),配套 arXiv 综述 2402.13116