Chain-of-ThoughtsPapers
GitHub 最全的 Chain-of-Thought 推理论文合集,追踪 AI「学会思考」的研究演进
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
GitHub 最全的 Chain-of-Thought 推理论文合集,追踪 AI「学会思考」的研究演进
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:大语言模型的思维链推理能力示意
想象这样一个场景:你在让 AI 做一道数学题,它不是直接给出答案,而是像一位耐心的老师,先写下「因为这道题的第一步是……所以我们需要……」,一步步推导出最终结果。这种「边想边说」的推理方式,正是 Chain-of-Thought(思维链)提示技术的精髓。
2022年1月,Google Research 的 Jason Wei 等人在 arXiv 发表论文《Chain of Thought Prompting Elicits Reasoning in Large Language Models》,首次系统性地证明:当大语言模型被引导展示中间推理步骤时,其复杂推理能力会显著提升。这篇论文迅速成为 NLP 领域被引用次数最多的论文之一,也正式拉开了「思维链」研究浪潮的序幕。
Timothyxxx(GitHub 用户)迅速捕捉到这一研究趋势,创建了 Chain-of-ThoughtsPapers 项目,系统性地收集、整理该领域的论文。从最初的寥寥数篇,到如今涵盖数十篇核心论文,这个仓库已经成为 AI 推理研究领域最全面的文献索引之一。
传统 prompt 通常是「输入→输出」的直连模式,用户提问,AI 直接给答案。这种方式在简单任务上表现尚可,但面对需要多步推理的问题(如数学应用题、逻辑谜题),AI 往往容易「一步错,步步错」。
思维链提示则引入了一个中间环节:显式推理步骤。以一个简单的数学问题为例:
这个看似简单的改变,实际上让模型将复杂问题拆解为多个简单子问题,大幅降低了推理链路出错的概率。
Google 在 2022 年 3 月发表的另一篇重磅论文《Self-Consistency Improves Chain of Thought Reasoning》中,提出了 Self-Consistency(自洽性)方法:对同一个问题,让模型生成多条不同的推理路径,然后取多数一致的答案。实验表明,这种方法比单纯的思维链提示又提升了约 3 个百分点。
Denny Zhou 等人提出的 Least-to-Most Prompting 进一步深化了这一思想:首先将复杂问题分解为一系列简单的子问题,逐个解决,最后综合子问题的答案得出最终结论。这种「分而治之」的策略在某些任务上比传统思维链提升超过 12%。
Chain-of-ThoughtsPapers 项目的结构极为简洁——仅一个 README.md 文件,容纳了从 2022 年初到 2022 年底的数十篇核心论文。每篇论文条目包含:
项目按时间顺序排列,清晰呈现了思维链研究从开创到蓬勃发展的演进轨迹。涉及的关键词覆盖:chain-of-thought、codex、gpt-3、in-context-learning、large-language-models、palm、prompt-learning 等,反映了该领域与 GPT-3、PaLM 等大模型的深度关联。
该仓库的论文来源全部为公开的 arXiv 预印本,没有任何专有数据。论文作者包括 Google Research、DeepMind、斯坦福大学、纽约大学等顶尖机构的研究者,形成了学界与工业界协同推进的可喜局面。
值得关注的是,这些论文中有相当一部分同时提供了官方代码实现(如 STaR 的 GitHub 仓库、Zero-Shot-CoT 的代码仓库),使得研究结果可以直接复现。这对于推动该领域的开放科学生态具有重要意义。
尽管思维链提示取得了显著成效,学界对其机制的理解仍然不够深入。有研究(如《The Unreliability of Explanations in Few-Shot In-Context Learning》)指出,模型生成的「推理步骤」未必是其真实思考过程的忠实表征,有时只是「看起来合理」的 post-hoc 解释。
此外,思维链提示在小型模型(参数量低于 100 亿)上效果有限甚至无效,这意味着该技术的普惠性仍有待提升。
Chain-of-ThoughtsPapers 项目虽然只是一个论文列表,但其价值不可低估:
随着 GPT-4、Claude 3、Gemini 等大模型能力的持续提升,思维链研究正在从「提示技巧」演变为「推理架构」的底层能力。Timothyxxx 的这个项目,将继续陪伴这一领域的研究者和实践者,共同见证 AI「学会思考」的每一个里程碑。