Awesome_Efficient_LRM_Reasoning
清华大学出品的大模型高效推理综述,收录118篇论文,覆盖推理时、SFT、RL全栈优化路径
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
清华大学出品的大模型高效推理综述,收录118篇论文,覆盖推理时、SFT、RL全栈优化路径
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的经历:做一道数学题时,在草稿纸上反复验算了好几页,最终答案却是错的。而班里的「学霸」往往只需要瞟一眼题目,寥寥几行推导就能得出正确答案。思考的长度,并不等于思考的质量——这个朴素的道理,正在成为大语言模型(LLMs)研究的核心命题。
2025 年,以 OpenAI o1、DeepSeek-R1 为代表的大推理模型(Large Reasoning Models,LRMs) 横空出世,它们的核心特征是能够生成超长的 Chain-of-Thought(思维链),在复杂推理任务上取得了突破性进展。但代价同样触目惊心:一个问题的推理链可能消耗数万甚至数十万个 token,推理成本远超最终答案本身的价值。这种「过度思考」(Overthinking)现象,催生了一个全新的研究方向——LRMs 高效推理。
清华大学研究团队敏锐地捕捉到了这一趋势,于 2025 年 3 月发表了论文《A Survey of Efficient Reasoning for Large Reasoning Models》,并在 GitHub 上推出配套开源仓库 Awesome Efficient LRM Reasoning。该仓库系统梳理了 LRMs 高效推理领域的最新进展,涵盖 118 篇顶会/顶刊论文,划分 23 个子方向,被机器之心、同花顺等国内顶级 AI 媒体转载,成为该领域最具影响力的资源聚合项目之一。

图 1:LRMs 高效推理研究 Scope 概览(来源:项目官方 figs/Scope.png)
传统 LLMs 的推理模式类似于「System 1」——快速、直接、节省资源。而 o1/R1 类 LRMs 则引入了「System 2」思维:通过显式的长链推理来分解复杂问题。这种范式转变在数学证明、代码生成等任务上效果显著,但也带来了严重的效率问题。
研究表明,对于简单问题(如 2+3=?),o1 类模型的推理 token 消耗量是直接输出的数十倍,而最终准确率却未必更高。这就是 LRMs 领域的「过度思考」问题——模型把宝贵的计算资源浪费在了本不必要的中间步骤上。
更棘手的是,过长的推理链不仅增加成本,还可能损害模型的指令遵循能力。2025 年 5 月的论文《Scaling Reasoning, Losing Control》指出,推理链越长,模型越容易偏离用户指令的初衷。这打破了「想得越多越好」的假设,揭示了 LRMs 效率优化的紧迫性。
本项目的核心观点浓缩在这句话中:「效率是智能的本质」(Efficiency is the essence of intelligence)。正如一个真正聪明的人知道何时该停下来做决定,一个真正智能的模型也应该知道何时该停止不必要的推理,有策略地分配 token 预算,在成本与性能之间找到最优平衡点。

图 2:论文作者团队(来源:项目官方 figs/author.png)
项目将 LRMs 高效推理的研究归纳为四个阶段,覆盖从预训练到推理的全生命周期:

图 3:LRMs 高效推理 Taxonomy 分类体系(来源:项目官方 figs/figure2.png)
这是当前最活跃的研究方向,核心是在不重新训练模型的情况下,通过推理策略优化来削减 token 消耗。主要技术路径包括:
长度预算控制(Length Budgeting):最直观的方式是给模型设定 token 上限。2025 年 1 月斯坦福提出的 s1 方法通过简单的「Budget Forced」机制,让模型在达到预设长度后强制停止推理,在 MATH500 等基准上实现了性能与效率的双赢。2025 年 5 月的 AdaCtrl 则进一步引入「难度感知」机制——简单问题用更短的推理链,复杂问题允许更长的思考,实现了资源分配的帕累托最优。
系统切换(System Switch):模拟人类认知的双过程理论(快思考/慢思考),让模型在不同复杂度任务上自动切换推理模式。Fast-Slow-Thinking(2025.04)和 Dualformer(2024.10)等工作证明,在简单任务上用「快思考」跳过冗余推理,在复杂任务上才动用「慢思考」,可以在几乎不损失准确率的前提下大幅削减 token 消耗。
模型切换(Model Switch):利用 Speculative Decoding(投机解码)思想,用小模型草稿 + 大模型验证的方式加速推理。EAGLE-2(2024.06)和 Medusa(2024.01)等框架在大语言模型推理加速领域已有广泛应用。
并行搜索(Parallel Search):在推理阶段并行生成多个候选答案,通过自验证或 Best-of-N 采样来选择最优解。Self-Certainty(2025.02)通过模型对自己答案的置信度来指导搜索,在效率和效果之间取得了良好平衡。
模型合并(Model Merge):2025 年 3 月的新兴方向,探索将「长推理」模型与「短推理」模型的能力通过模型合并技术进行融合。
通过监督微调来教会模型「高效推理」,而非依赖推理时的策略干预。
推理链压缩(Reasoning Chain Compression):将长 CoT 数据蒸馏为短 CoT 数据。Chain of Draft(2025.02)提出「草稿链」方法,将冗长的推理压缩为简洁的要点列表;TokenSkip(2025.02)和 DRP(2025.05)则分别从 token 级别和技能级别进行压缩。Distilling System 2 into System 1(2024.07)探索将慢思考能力蒸馏到快思考模型中,是该方向的经典工作。
隐空间 SFT(Latent-Space SFT):不直接在 token 空间压缩,而是将长推理压缩为连续的隐向量。CODI(2025.02)和 SoftCoT(2025.02)在连续空间中模拟推理过程,在保持推理能力的同时大幅减少了显式 token 的生成量。LightThinker(2025.02)则提出「逐步压缩」的策略,让模型在推理过程中逐步将中间结果内化。
通过强化学习让模型自主学会缩短推理链,是 2025 年最热门的方向。
带长度奖励的 RL(Length Reward):在奖励函数中引入推理长度 penalty,引导模型主动精简推理链。L1(2025.03)是最具代表性的工作之一,通过 RL 直接控制模型的推理长度。ShorterBetter(2025.04)和 ThinkPrune(2025.04)分别从「最优长度搜索」和「推理链剪枝」角度进行了深入探索。Kimi k1.5(2025.01)则展示了 RL 方法在大规模模型上的可行性。
不带长度奖励的 RL:探索无需显式长度监督的 RL 方法。Concise Reasoning via RL(2025.04)证明仅通过结果奖励也能隐式地学习到简洁推理。
从根本上改变模型架构,使高效推理成为模型的「先天能力」。
亚二次注意力(Subquadratic Attention):用线性注意力替代标准 Transformer 的二次注意力。Mamba 系列(状态空间模型,SSM)和 MoBA(混合块注意力)是这一方向的主力架构。
模型线性化(Linearization):将预训练好的 Transformer 模型转化为线性复杂度架构。Mamba in the Llama(2024.08)和 Liger(2025.03)是代表性工作。
将效率优化扩展到图像、视频等多模态场景。MME-CoT(2025.02)是该方向的基准测试;Think with Images(2025.06)探索了多模态场景下的「显式思考」机制;Skywork R1V(2025.03)则将高效推理与视觉语言模型相结合。
MEM1(2025.06)提出将记忆与推理协同优化;AgentPrune(2025.04)探索对 Agent 系统中的推理模块进行剪枝;多轮交互中推理 token 的累积成本极为可观,高效推理在 Agent 场景下被放大。
SafeWork-R1(2025.07)探讨了在 AI-45 法规背景下,模型安全与推理效率的协同发展;X-Boundary(2025.02)确保高效推理模型的安全性不弱于原始模型。
项目收录 118 篇 2023-2025 年的相关论文,23 个子方向按推理阶段和技术类型双重维度组织。由于是纯 Markdown 文档仓库,使用方式极为简单:
git clone https://github.com/XiaoYee/Awesome_Efficient_LRM_Reasoning.git本项目已被机器之心(Synced)和专知(Zhuanzhi)报道,成为该领域的基础文献。从行业趋势看,LRMs 高效推理正在经历从「理论探索」到「工程落地」的转变。2025 年下半年,Kimi、DeepSeek 等国内大厂密集发布了具备高效推理能力的新模型,本项目所收录的诸多技术路线正在被快速工程化。
未来六大方向值得重点关注:多模态高效推理、无限推理(Infinity Thinking)、Agent 高效推理、可信推理、应用构建和评测基准。其中测试时计算最优扩展和无限思考是当前最前沿的研究热点。
本报告基于 XiaoYee/Awesome_Efficient_LRM_Reasoning 仓库及关联论文 arXiv:2503.21614 生成。