awesome-knowledge-distillation
知识蒸馏领域最全论文索引,涵盖1990-2026年200+篇论文与开源实现
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
知识蒸馏领域最全论文索引,涵盖1990-2026年200+篇论文与开源实现
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
如果把深度学习模型比作一个知识渊博的教授,那么**知识蒸馏(Knowledge Distillation)**就是让一个学生从教授那里学到「暗知识」(Dark Knowledge)的艺术——不只是记住答案,而是理解教授做判断时的犹豫和偏好。
而 Awesome Knowledge Distillation 则是这个领域最全面的「图书馆索引卡片」。它由维护者 dkozlov 发起,收录了知识蒸馏从1990年至今的几乎所有重要论文和开源实现,成为该领域研究者和工程师的必读资源。
2014年,深度学习教父 Geoffrey Hinton 与 Oriol Vinyals、Jeff Dean 发表了里程碑论文 Distilling the Knowledge in a Neural Network,正式提出知识蒸馏概念。他们发现:大模型的「软概率」输出(soft predictions)比硬标签(hard labels)包含更丰富的信息——模型不仅知道「这张图是猫」,还知道它「有70%像猫、20%像狗、10%像狐狸」。让小模型学习这种概率分布,效果远比直接学标签好得多。
这一发现开启了模型压缩研究的新纪元。随着时间推移,知识蒸馏技术不断演进:从最初针对分类任务的软标签蒸馏,发展出特征蒸馏、关系蒸馏、自蒸馏、跨模态蒸馏等众多分支,应用领域也从图像分类扩展到目标检测、语义分割、NLP、语音合成甚至LLM推理加速。
然而,论文数量爆炸式增长,研究者面临信息过载问题:如何快速找到某个特定蒸馏方法的原始论文和复现代码?Awesome Knowledge Distillation 正是在这个背景下诞生。
该项目分为两大核心文档:
README.md —— 论文分类索引
按时间线梳理了从1990年代到2026年的所有里程碑论文,每个条目都附有原始PDF链接或arXiv地址。按主题可归纳为:
Implementations.md —— 开源代码大全
按框架分类整理了所有可复现的实现:PyTorch(占比最高)、TensorFlow、Caffe、Keras、MXNet、Lua/Torch、Theano、Lasagne、PaddlePaddle等。每个条目都指向原始GitHub仓库或官方实现页面。
值得特别关注的是几个高频引用、质量较高的实现库:
从论文收录的时间线可以清晰看到知识蒸馏的技术演进路径:
第一阶段(2014-2018):任务导向蒸馏
以分类任务为主,核心问题是「如何让小网络学到和大网络一样的判断能力」。代表工作包括 FitNets、Attention Transfer、Relational KD。这一阶段的特点是方法相对独立,缺乏统一的理论框架。
第二阶段(2019-2022):预训练模型蒸馏
以BERT、ViT为代表的预训练模型兴起,带动了一批面向NLP和Vision-Transformer的蒸馏工作。TinyBERT、MobileBERT、FastBERT、DeiT等工作让Transformer模型能在移动端运行。同时,自蒸馏(Self-Distillation)概念得到系统研究。
第三阶段(2023-2025):LLM + 扩散模型蒸馏
大模型时代,蒸馏目标从「压缩」转向「加速」和「能力迁移」。MiniLLM探索了小模型蒸馏大模型的可能性,LCM(Latent Consistency Models)实现了扩散模型的少步生成,UniversalNER则展示了蒸馏NER能力到轻量模型的实际价值。
第四阶段(2026+):安全与对齐蒸馏
最新收录的论文开始关注蒸馏过程中的安全问题——当学生模型从教师那里学习时,有害知识是否也会被无意识地传递?这一方向正在引起越来越多的关注。
假设你是一个CV研究者,想要为语义分割任务选择合适的蒸馏方法,传统做法需要:读50+篇论文、找代码、对比实验、选择方案。在Awesome Knowledge Distillation的帮助下,这个过程被大幅缩短:
这种「论文索引 + 代码链接 + 时间线」的三维组织方式,是它区别于普通 awesome-list 的核心价值。
必须指出,这个项目的本质是文献索引,而非独立的代码库。它本身不提供任何可运行的模型、训练脚本或评估工具。对于想要深入理解某篇论文细节的读者,仍需要直接阅读原始论文。
此外,由于收录范围极广(约200+论文条目),维护质量参差不齐:部分条目缺少摘要或代码链接,部分最新工作(如2025-2026年的一些LLM蒸馏论文)可能存在收录滞后。读者在使用时需自行甄别。
从GitHub Stars增长曲线来看,该项目长期维持在知识蒸馏领域的头部位置,是该领域最有影响力的Awesome资源之一。它的存在本身也印证了一个趋势:随着AI领域论文产出速度越来越快,高质量的「论文地图」型资源将成为刚需。
另一个值得关注的趋势是知识蒸馏正在从「纯学术」走向「工业落地」。过去两年收录的工作中,有大量来自工业界(Google、Microsoft、NVIDIA、Intel)的实用蒸馏方案,反映了该技术在模型部署中的刚性需求。