Awesome-Efficient-Reasoning
LLM 高效推理领域最全论文宝库,515篇论文覆盖29个研究方向
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
LLM 高效推理领域最全论文宝库,515篇论文覆盖29个研究方向
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这种感觉:大模型回答一个简单问题时,却绕了一大圈才得出答案?这不是你的错觉,而是 2024-2025 年 AI 圈最核心的痛点之一——过度思考(Over-Thinking)。 当 GPT-4、Claude、DeepSeek 等大语言模型被要求解决复杂推理题时,Chain-of-Thought(CoT,思维链)技术让模型学会了「一步一步想」。但问题随之而来:模型有时候想得太多、太长,不仅浪费了大量计算资源(一个字一个字往外蹦,GPU 卡住半天),答案质量却未必更好。这种「想太久」的问题催生了整个「高效推理」研究领域。 今天要介绍的这个仓库——Awesome-Efficient-Reasoning,就是目前该领域最系统、最全面的论文汇总。它由独立研究者 hemingkx 维护,截至 2025 年中收录了超过 515 篇 相关论文,涵盖 29 个子方向,从「如何缩短思维链」到「大小模型如何协作」,一网打尽。
首先,这是一个活的文献库。作者几乎每周都在更新,持续追踪 2024-2025 年的最新研究。以 COLM 2025 和 NeurIPS 2025 为例,仓库里已经收录了 DR.GRPO、TreePO、CPPO 等最新录用论文——这意味着你可以在这里找到顶级 AI 会议中最前沿的推理效率研究动态。 其次,分类体系极为专业。仓库不是简单地按年份堆论文,而是按照技术路线做了细致的主题划分:
Long-to-Short 是当前最热的方向之一。传统 CoT 让模型生成完整推理过程,但研究者发现:大量中间推理 token 对最终答案贡献极小,完全可以「跳过」或「压缩」。 Skip-Thinking 思路的核心是训练模型学会「提前结束」——当模型判断当前推理步骤已经足够支撑答案时,直接停止思考。2025 年的代表性工作包括 DECO(来自 EMNLP 2025 findings)和 TokenSkip,前者通过对比学习让模型学会区分「关键推理 token」和「冗余推理 token」,后者则通过动态 token 跳过机制减少约 40% 的推理 token。 Length Penalty 方法则从奖励信号入手:在强化学习训练阶段加入长度惩罚项,让模型主动追求「用更少的推理 token 达到相同的准确率」。NeurIPS 2025 的 DR.GRPO 和 ICLR 2026 的 Group-Relative Length Reward 是这一思路的代表。
2025 年另一个引人注目的趋势是:小参数模型在特定推理任务上开始逼近大模型表现。s1(由 Samaya 等人发布)通过精心设计的长推理链数据蒸馏,让 1B 参数的模型在数学推理上达到了与 70B 模型相当的准确率。LIMO 则更进一步,通过渐进式课程学习让小模型学会了「何时深入思考、何时浅尝辄止」。 这些工作的核心洞察是:推理能力不完全由模型规模决定,数据质量和训练范式同样关键。小模型学会「聪明地分配思考资源」后,反而比大模型盲目「想更多」效率更高。
「小模型负责简单任务,大模型负责复杂任务」听起来直观,但实际落地极难——因为模型自己不知道当前问题属于哪一类。 Model Router 类方法(如 R2-Reasoner,来自 NeurIPS 2025)通过训练一个轻量级路由器,自动判断当前问题的难度等级,并动态分配到合适的模型或推理路径。这解决了「一个模型无法同时最优处理所有问题」的根本矛盾。 Speculative Decoding 则从生成效率入手:用小模型「草稿」大模型「核对」,两者并行工作,大幅降低推理延迟。SpecCoT(EMNLP 2025 findings)和 SpecExit(EMNLP 2025 findings)是这一方向的新进展。
一个领域要健康发展,必须有可靠的评测基准。仓库收录了多个关键 Benchmark:
高效推理技术正在快速落地: 企业级 AI 应用:在客服、法律文档分析、金融推理等场景中,响应延迟直接关系到用户体验。CoT 压缩技术可以让平均响应 token 减少 30-50%,而不损失准确率,这意味着更快的响应速度和更低的推理成本(Token 是要钱的)。 边缘部署:手机、车载设备等算力有限的场景,大模型推理效率至关重要。稀疏注意力 + 小模型蒸馏的组合,使得 7B 模型在移动端部署成为可能。 Agent 系统:在 AutoGPT、Claude Agent 等多步骤 Agent 系统中,每个 Agent 步骤的推理效率累积起来影响整体执行时间和成本。高效推理让 Agent 系统可以处理更长的任务链。
这个领域也存在值得关注的争议: 过度压缩 vs 准确率损失:Long-to-Short 方法最大的风险是「矫枉过正」——把思考链压得太短后,模型在边缘case上的准确率会显著下降。目前多数 Benchmark 衡量的是平均表现,但实际应用中往往是那 1% 的困难 case 最关键。 Benchmark 泛化问题:当前高效推理的 Benchmark 多在数学和编程任务上验证(如 MATH、GSM8K),但在开放域问答、创意写作等任务上的效率收益尚不明确。 评估指标单一:现有研究主要用「准确率 + token 数」来衡量,但推理过程中还有 KV 缓存占用、显存带宽消耗、多步推理的累积误差等实际问题未被充分覆盖。
Awesome-Efficient-Reasoning 的存在本身就是一个信号:AI 推理正在从「大力出奇迹」的 scaling 时代,向「聪明地分配算力」的精细化时代过渡。 2024 年 OpenAI 的 o1/o3 引发了 Test-Time Scaling 的热潮;2025 年,学术界和工业界的关注点已经转向:如何在有限的计算预算下获得最好的推理效果。这不仅是工程优化问题,更涉及对「推理本质」的理论理解。 从增长趋势看,2025 年上半年该领域论文数量同比翻倍,COLM 2025 和 NeurIPS 2025 均有专门的 Workshop 讨论推理效率问题。可以预见,高效推理将成为未来 2-3 年 AI 最重要的研究方向之一。 如果你关注 LLM 的实际落地,这个仓库值得定期浏览——它不只是论文列表,更是理解 AI 推理效率演进脉络的最佳地图。