Awesome-Efficient-LLM
GitHub 最全面的 LLM 高效化技术知识库,涵盖量化、剪枝、蒸馏、推理加速等 12 个方向
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
GitHub 最全面的 LLM 高效化技术知识库,涵盖量化、剪枝、蒸馏、推理加速等 12 个方向
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
如果你在 2024 年训练过一个 7B 参数的大语言模型,就会深刻理解一个痛点:光是存储一份 FP16 精度的模型权重,就需要约 14GB 显存。更别说在消费级 GPU 上进行推理——那张 RTX 4060 Ti 16GB 的显卡,连 7B 模型都塞不进去。
而当模型的规模从 7B 膨胀到 70B、175B 时,问题更是指数级恶化。这就是 Awesome-Efficient-LLM 诞生的背景——它由研究者 horseee 发起并维护,是目前 GitHub 上最全面、最系统的 LLM 高效化技术知识库,收录了从网络剪枝、知识蒸馏到量化、推理加速等全链路技术的代表性论文与实现。

图 1:LLM 高效化综述论文(Zhu et al., 2023)覆盖的技术全景
2022 年底 ChatGPT 爆火后,学界和工业界面临一个共同困境:模型越大,效果越好,但部署成本也越高得离谱。一个 175B 参数的 GPT-3,需要 350GB 显存才能以 FP16 精度运行——这需要至少 5 张 A100 80GB 显卡才能放下。
在此背景下,LLM 高效化研究在 2022-2023 年迎来了爆发期。GPTQ(ICLR'23)、SmoothQuant(ICML'23)、QLoRA(NeurIPS'23)等里程碑论文相继发表,剪枝方向出现了 SparseGPT(ICML'23)、LLM-Pruner(NeurIPS'23)等重量级工作。Awesome-Efficient-LLM 的作者 horseee 同时也是 LLM-Pruner 的核心作者,这让该项目在学术圈内具有相当的可信度和影响力。
项目的 GitHub 页面虽然创建于 2023 年 5 月,但一直保持活跃维护(最近一次推送在 2025 年 6 月),目前已收获超过 2000 颗星、165 个 Fork,说明其内容质量和时效性得到了广泛认可。
该项目按技术路线将高效化方法分为 12 个子方向,每个方向都配有详细的论文列表和简要说明。
剪枝是最直观的高效化手段——把模型中"不重要"的权重删掉,保留核心结构。这又分为结构化剪枝(按组删除神经元/注意力头)和非结构化剪枝(逐权重剪枝)。代表性工作包括:

图 2:SparseGPT 在不同规模 LLaMA 模型上的精度保持效果
量化是最实用的方向——将 FP32/FP16 权重压缩为 INT8、INT4 甚至更低位数表示,显存占用直接减半甚至更多。

图 3:GPTQ 量化流程示意
这部分涵盖注意力机制优化、KV-Cache 压缩、解码策略等多个方向:

图 4:FlashAttention 与标准 attention 的性能对比
MoE 通过稀疏激活减少计算量。代表性工作包括 DeepSeekMoE、Mixtral、Qwen-MoE 等,在保持模型容量的同时显著降低实际计算成本。
不再全量微调,只更新少量参数:LoRA 系列(LoRA、QLoRA、DoRA、LoRA+)、Adapter 系列、Prefix Tuning 等。这使得在消费级 GPU 上微调大模型成为可能。

图 5:QLoRA 将 4-bit 量化与 LoRA 结合,实现高效微调
让小模型学习大模型的行为,是压缩模型的重要手段。MiniLLM、LM-KD、GKD 等工作致力于将大模型的能力迁移到更小的模型中。

图 6:知识蒸馏框架示意图
除了对已有大模型进行压缩,还有一类方法从零设计更高效的小模型:

图 7:MobileLLM 与其他同规模模型的精度对比
随着 LLM 支持的上下文越来越长(从 4K 到 128K),KV-Cache 显存占用问题愈发突出。KVQuant、L4Q 等工作通过量化 KV-Cache 显著降低长上下文推理的显存占用;StreamingLLM、LM-Infinite 等通过"锚点注意力"机制,在无限长度序列上保持稳定生成。

图 8:长上下文压缩技术的效果示意
对 AI 爱好者的价值: 该项目是一个极好的学习地图。无论你是想了解量化是怎么做的还是剪枝为什么有效,都能在这里找到对应的综述论文和经典工作,配有 GitHub 链接和 arXiv 引用,适合系统性地构建 LLM 高效化知识体系。
对开发者的价值: 项目中收录的很多工作都附带官方实现(GPTQ、SparseGPT、QLoRA 等都有独立的 GitHub 仓库),可以直接克隆下来复现论文结果或集成到自己的项目中。尤其是推理引擎开发者,FlashAttention 系列几乎是必读项目。
使用门槛: 项目本身是纯 Markdown 知识库,无需安装任何依赖,直接在 GitHub 上阅读即可。唯一的门槛是对 LLM 基本概念的理解——建议配合 Stanford CS224N 或相关课程一起学习效果更好。

图 9:Scissorhands 剪枝方法的效果可视化
Awesome-Efficient-LLM 的广度本身就说明了 LLM 高效化研究的热度——从 2022 年到 2024 年,这个领域每年都有数十篇顶会论文涌现。几个值得关注的趋势:
该项目作为这个快速演进领域的知识枢纽,维护者 horseee 持续更新,使得它成为了解 LLM 高效化全貌的最便捷入口。

图 10:FlashDecoding++ 在长序列解码中的加速效果
资源速查
- GitHub:https://github.com/horseee/Awesome-Efficient-LLM
- Stars:2019 | Forks:165
- 主要语言:Python(收录代码项目)
- Topics:
model-quantizationpruning-algorithmsllm-compressionknowledge-distillation