CoT-Reasoning-Survey
ACL 2024录用论文,系统梳理300+篇思维链文献,构建完整推理分类体系,是AI推理研究必备参考地图
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
ACL 2024录用论文,系统梳理300+篇思维链文献,构建完整推理分类体系,是AI推理研究必备参考地图
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:当你问大语言模型"如何把大象放进冰箱",一个模型直接回答"打开冰箱门,放进去,关上",而另一个模型则会一步步拆解问题——"首先评估大象和冰箱的体积差异,然后考虑生物伦理问题,最后才给出分步方案"。后者的思维方式,正是**Chain of Thought(思维链,简称 CoT)**的核心。
2022 年,Google Research 在 NeurIPS 上发表了里程碑论文 "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models",首次系统论证了"让模型展示思考过程"能显著提升推理能力。此后三年,CoT 相关研究呈爆发式增长,论文数量从每年数十篇激增至数百篇,研究方向涵盖数学推理、常识推理、逻辑推理、多模态推理等多个分支。面对这片汹涌的学术浪潮,研究者面临一个现实困境:如何在海量文献中找到脉络、理解前沿、定位自己的研究位置?
这就是本仓库诞生的意义。 由哈尔滨工业大学(HIT)和华为联合打造的 "Navigate through Enigmatic Labyrinth: A Survey of Chain of Thought Reasoning" 是 ACL 2024 录用论文,也是迄今为止对 CoT 领域最系统、最全面的综述之一。它不仅仅是一篇论文,更是一张覆盖 300+ 篇核心文献的知识地图,帮助研究者在纷繁复杂的思维链研究中找到方向。

图1:CoT 推理技术的分类学框架(taxonomy)
本综述最核心的价值在于其精心构建的分类体系(Taxonomy)。作者将 CoT 研究拆解为三大维度,每个维度下又细分出多个子方向,构成了一个完整的学术坐标系。
CoT 不仅仅适用于数学问题,作者系统梳理了思维链在不同推理场景下的表现:
数学推理(Mathematical Reasoning) 是 CoT 最早被验证有效性的领域。标准 CoT prompting 通过显式展示解题步骤,将 GPT-3 在 GSM8K 数学题上的准确率从 17.9% 提升到 46.7%。此后,MathPrompter、Program of Thoughts(PoT)、PAL 等方法相继涌现,分别从不同角度增强模型的数学推理能力。MathPrompter 要求模型生成多种求解思路并相互验证;PoT 将计算过程外化为可执行程序;PAL 则让模型生成 Python 代码来完成计算。本综述收录了超过 20 个数学推理基准数据集,从 MAWPS 到 LILA,涵盖了算术应用题、多步推理、证明验证等各个细分方向。
常识推理(Commonsense Reasoning) 处理的是人类日常经验中的隐含知识。比如"雨伞能挡雨,但放在外面会被风吹走"这类常识性判断。CommonsenseQA、PIQA、Event2Mind 等数据集测试模型在这方面的能力。研究发现,CoT 虽然能改善推理过程,但对需要深层世界知识的常识问题仍存在明显短板。本综述梳理了 10+ 个相关基准和对应的 CoT 改进方法。
逻辑推理(Logical Reasoning) 关注形式化逻辑推演。ReClor、LogiQA、FOLIO 等数据集要求模型处理一阶逻辑、演绎推理等高阶认知任务。值得关注的是,学者们发现纯 CoT prompting 在某些逻辑任务上的表现远不如形式化方法(如 Coq、Lean 等证明助手),这提示了符号推理与神经推理融合的潜力方向。
符号推理(Symbolic Reasoning) 处理抽象符号操作,如字母序列变换、模式匹配等。这类任务看似简单,却能暴露模型推理能力的边界。

图2:CoT 研究中的主要基准测试体系
综述系统梳理了 CoT 推理能力的构建路径,按技术路线分为三大类别。
手工构造(Manual Construction) 是最早期的方法。研究者手工设计 CoT 示例,让模型模仿思考过程。2022 年 Wei et al. 的开创性工作就是典型代表。这种方法效果稳定,但高度依赖人工,成本高,难以规模化。
自动构造(Automatic Construction) 的出现解决了手工的瓶颈。Zero-Shot CoT(Kojima et al., 2022)通过简单的"let's think step by step"提示语,无需任何示例即可激发模型的推理能力,引发学界轰动。Auto-CoT(Zhang et al., 2023)进一步用聚类方法自动生成多样化示例。RePrompting(Dhuliawala et al., 2023)通过 Gibbs 采样迭代优化示例选择,显著降低了人工成本。
半自动构造(Semi-automatic) 介于两者之间,典型工作包括 DSP(Dynamic Sampling Prompting)和 Synthetic Prompting,后者通过模型自身生成合成示例,再筛选高质量样本用于微调。
仅有内部推理能力还不够,很多复杂问题需要外部知识。综述将知识增强路径分为两大方向:
知识编译(Knowledge Compilation) 将外部知识编译进模型参数。典型方法包括检索增强生成(RAG)与 CoT 的结合、知识注入微调等。WebGPT、Toolformer 等工作展示了如何让模型调用外部工具(计算器、代码解释器、搜索引擎)来弥补知识不足。
隐式知识利用(Implicit Knowledge Utilization) 不依赖外部检索,而是通过设计巧妙的 prompting 策略,让模型更充分地调动自身参数中的隐含知识。Self-Ask、React 等方法通过追问(self-ask)和反思(reflection)机制,引导模型逐步激活相关知识。

图3:外部知识增强的 CoT 技术路线
推理链路越长,出错概率越高。综述专辟章节讨论推理验证与修正策略:
验证(Verification) 方法在生成完整推理链后,通过专门的验证模块检查结论是否正确。典型方法包括 Self-Verification、Check Your Steps 等。LLM Reasoning Solver 等工作则训练专门的验证器来判断推理步骤的有效性。
修正(Refinement) 方法在发现错误后主动回退和重试。Self-Correction 范式中,模型先生成初步答案,再评估其可信度,必要时重新推理。Active Correction 进一步结合外部反馈来指导修正方向。

图4:推理验证与修正的技术框架
最核心的争议在于:CoT prompting 到底是真的触发了类人的系统推理,还是仅仅在模式匹配——即通过识别训练数据中的统计规律来生成看似合理的推理文本?
2023 年 ICLR 论文 "Language Models Are Greedy Reasoners" 通过严格的对照实验发现,CoT 在形式逻辑任务上的表现可以被完全分解为对测试集分布的拟合。这一发现震撼了社区:如果 CoT 的推理能力仅仅是统计复现,那它的泛化边界在哪里?
作者在综述中诚实呈现了这一争议,并引用了多项针对此问题的实证研究。目前学界倾向于认为:CoT 的有效性是真实推理与模式匹配的混合体,在不同任务、不同模型规模上两者的比重不同。规模越大的模型(如 GPT-4、Claude)中真实推理的成分越高。
综述系统总结了 CoT 的已知局限:对于需要精确计算的任务(如长乘法),纯文本 CoT 的精度远不如程序辅助的 PoT;对于高度依赖世界特定知识的问题,CoT 容易产生幻觉(hallucination);对于需要多步推理且中间步骤不可观测的任务,CoT 的可解释性优势大打折扣。
综述提出了四个前沿方向:① 多模态 CoT:将视觉、语言、音频等多种模态纳入推理链路;② 自适应 CoT:根据问题复杂度动态选择推理策略;③ CoT 的可信赖性:确保推理链路的可靠性和可审计性;④ CoT 与 agent 架构的融合:在自主 agent 系统中设计更复杂的推理协议。
本综述的核心价值在于系统性。作者不是简单地罗列论文,而是建立了清晰的分类框架,将 300+ 篇文献按推理类型、技术路线、构建方式等多个维度组织起来,绘制了一幅完整的知识地图。这对于以下人群尤其有价值:
作为学术论文仓库,使用方式非常简单:
根据 GitHub 数据,该仓库目前已有 502 个 stars,说明其影响力正在持续扩大。作为 ACL 2024 录用的顶级会议论文,它的学术认可度较高,同时作为一个持续更新的阅读列表,对工业界和学术界都有参考价值。