Awesome-KV-Cache-Optimization
ACL 2026 接收的 KV Cache 优化综述,以系统行为视角系统性梳理 LLM 推理加速领域
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
ACL 2026 接收的 KV Cache 优化综述,以系统行为视角系统性梳理 LLM 推理加速领域
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
如果你在 2024 年尝试过用开源大模型搭一套生产级对话服务,大概率绕不开一个令人头疼的问题:显存不够用。明明模型参数量只有 7B,上下文窗口开到 32K,GPU 显存就爆了——问题不在权重本身,而在于 Attention 机制随序列长度平方增长的 KV 缓存。
这个痛点催生了一个极其活跃的研究方向:KV Cache 优化。2024 年下半年开始,这个方向论文爆发式增长,各种方法百花齐放:StreamingLLM、PagedAttention、H2O、FlashAttention……但问题也随之而来——论文太多、太散,缺乏系统性分类,想要快速了解某个子方向的进展,没有一篇好的综述来导航,你可能要在 arXiv 上翻几百篇论文。
jjiantong 团队出手了。2026 年初,他们在 arXiv 上发布了一篇综述,名为 《Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization》,随后被 ACL 2026 Findings 接收,并在机器之心上获得专题报道。截至分析时,该仓库已积累 362 颗 GitHub Stars,成为 KV Cache 优化领域最受欢迎的导航性资源。

图1:Awesome-KV-Cache-Optimization 仓库封面
KV Cache 优化的研究散落在系统、架构、AI 三个社区,同一个优化思路在不同社区的叫法不同,横向比较极其困难。该综述的核心贡献是提出了一套以系统行为为导向的分类法(System-Aware Taxonomy),把现有工作组织成三个维度:
| 维度 | 核心问题 | 代表性研究方向 |
|---|---|---|
| Temporal(时间维度) | KV 何时被访问/计算 | KV 调度、流水线并行、重叠计算 |
| Spatial(空间维度) | KV 存放在哪里、如何迁移 | GPU/CPU 分层存储、模型并行、卸载策略 |
| Structural(结构维度) | KV 如何表示和管理 | 量化、压缩、分块、选择性存储 |

图2:系统行为导向分类法
这套分类法不只是学术上的梳理——它实际上揭示了被忽视的优化区域。比如Temporal维度和Spatial维度的协同设计(Cross-behavior co-design),目前研究较少,但恰恰是最有工程价值的方向之一。

图3:行为-目标效果分析
这个仓库不是一个简单的 "awesome list"。作者设计了一个系统化的论文收集流程,每篇论文通过 generate.py 脚本生成标准化的 Markdown 条目,包含:论文标题、作者、发表venue(支持 ACL/ICLR/NeurIPS/MLSys 等)、GitHub 链接和 Stars 数、以及关键贡献的简短描述。
仓库的章节组织严格按照分类法展开:
每个子方向下列出具体论文,附带 GitHub Stars 数量和发表 venue 标注,方便读者按影响力筛选。
项目保持高度活跃,2026年6月单月新增了51篇论文。社区可以通过三种方式贡献:
generate.py,生成符合格式的 Markdown 行从代码结构来看,这是一个高度结构化的静态文档生成仓库,核心文件仅4个:
| 文件 | 作用 |
|---|---|
README.md | 核心内容,30000字论文列表 |
generate.py | 论文条目生成脚本(Python) |
.gitignore | Git 配置 |
assets/*.png | 可视化图表 |
代码质量评分:85/100。generate.py 结构清晰,注释详尽,文档质量极高——这是 ACL 2026 官方配套仓库应有的水准。
这个项目没有部署门槛。它不是一个需要运行的系统,而是一个需要阅读的参考资源。获取方式有三种:
硬件需求为零——纯文本项目,浏览器能打开网页就能用。
该仓库未声明明确的许可证。这意味着你不清楚是否可以将其内容用于商业目的或二次分发。对于一个高引用的综述仓库来说,这是一个令人遗憾的疏忽。
作者在 README 中明确限定了收录范围:sKis(System-aware KV-centric Serving optimizations),即不需要重新训练或修改模型架构的服务时优化方法。这意味着需要改模型架构的优化方向(如 LoRA、架构重设计)不在收录范围内,读者需要注意这一边界。
目前依赖社区贡献(PR/Issue),没有自动化的论文抓取机制。在 AI 研究论文产出速度极快的当下,被动收集可能存在一定滞后。
KV Cache 优化是 LLM 推理栈中增速最快的细分方向之一。这个仓库的意义在于:
截至2026年6月,该方向已有超过100篇论文被系统收录,且保持每月数十篇的增速。配合 ACL 2026 的背书,这个仓库的影响力预计将持续扩大。
Awesome-KV-Cache-Optimization 是 LLM 推理优化领域的一本"活字典"。它不是代码库,而是知识库——将碎片化的 KV Cache 优化研究用系统行为视角重新组织,为研究者和工程师提供了一张高效的认知地图。
如果你正在:
这个仓库值得认真读一遍 README。如果你在做系统性调研,不妨从它的三个行为维度出发,顺藤摸瓜找到适合自己的方向。
推荐指数:⭐⭐⭐⭐⭐(给 LLM 系统方向研究者和工程师)