awesome-deliberative-prompting
系统性梳理 LLM 深思熟虑式提示词技术的里程碑式知识库,涵盖从 Chain-of-Thought 到 DeepSeek R1 的完整演进历程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
系统性梳理 LLM 深思熟虑式提示词技术的里程碑式知识库,涵盖从 Chain-of-Thought 到 DeepSeek R1 的完整演进历程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你问 ChatGPT 一道数学题,它不再像以前那样直接给答案,而是像一位耐心的老师,先在草稿纸上写下「让我仔细想想」「这里需要注意什么」「等等,我再验证一下」——这整个过程,就是 Deliberative Prompting(深思熟虑式提示词) 正在做的事。
2021 年,一个叫 ggbetz 的开发者在 GitHub 上创建了一个名为 awesome-deliberative-prompting 的仓库,最初只是记录自己阅读论文时的一些笔记。谁也没想到,这个小小的知识库会成为 AI 推理技术发展的活档案——从 2021 年「Thinking Aloud」的萌芽,到 2022 年 Chain-of-Thought 的正式登场,再到 2025 年 DeepSeek R1 通过强化学习让 AI 自主学会推理,这个仓库用 200+ 篇论文、工具和数据集,完整记录了 AI「学会思考」的整个历程。2025 年 2 月,在 DeepSeek R1 发布后不久,作者宣布仓库归档,留下了这句感言:「感谢一路陪伴」。
让我们从词源说起。Deliberation 来自拉丁语,意思是「审慎地思考以做出决定」。当我们把这个概念搬到 LLM 上,就变成了:如何通过精心设计的提示词,让大语言模型不仅仅「给出答案」,而是「展示推理过程」,从而做出更可靠、更符合逻辑的决策。
用一个生活场景来类比:你问两个朋友同一道数学题。朋友 A 看了一眼就说「选 C」;朋友 B 则说「这道题我先把已知条件列出来,看到有个公式好像可以用,我试试……咦,算出来的结果代回去验算一下发现不对,那我换一个思路……最后确认答案是 B」。你更信任谁?LLM 也是如此——「想清楚再回答」的 AI,往往比「秒回」的 AI 更可靠。
这个仓库的核心价值在于,它不是简单地罗列论文,而是按技术演进脉络组织成一条清晰的叙事线:
2021 年 3 月,GPT-2 的实验证明:让模型「出声思考」——在给出最终答案前生成推理痕迹——能显著提升准确率。这在当时还是个小众想法,但它是整个故事的起点。
2022 年 1 月,Google 发表了那篇里程碑式论文 「Chain-of-Thought Prompting Elicits Reasoning in Large Language Models」,首次用系统性实验证明:只要你让 LLM「think step by step」,它真的能推理。紧接着,「Least-to-Most Prompting」(大问题拆成小问题再逐一解决)和 ReAct(推理与行动交替进行)等变体相继涌现。
单一模型推理有瓶颈,于是研究者们开始让多个 LLM 相互辩论、相互评审。「Multi-Agent Debate」让不同视角的 AI 互相挑战;「ReConcile」让多个模型围坐圆桌,通过共识达成最优答案;更有「Socratic Method」,让 AI 之间进行苏格拉底式的追问与反驳。实验表明,这种集体智慧有时甚至超越 GPT-4。
最有意思的方向是让 AI 自我纠错。「Self-Correction」 章节记录了大量方法:让模型生成多个答案然后投票(Self-Verification)、让模型找出自己推理中的漏洞(Chain-of-Verification)、让模型不断自我改进直到通过验证(Reflexion)。当然,也有研究泼冷水:「Large Language Models Cannot Self-Correct Reasoning Yet」 指出,如果没有外部反馈,模型很难真正纠正自己的深层错误。
2025 年 1 月,DeepSeek R1 发布。它不再依赖人类设计的思维链提示,而是完全通过强化学习(RL)让模型自主学会推理、自我验证和自我修正。仓库在归档前的最后一篇收录,正是这篇论文——仿佛一个完美的终章。
虽然这个项目本身不包含代码,但它系统整理了所有可用的开源实现工具:
| 工具/框架 | 类型 | 用途 |
|---|---|---|
| DSPy | 编程框架 | 声明式地组合思维链模块,自动优化提示词 |
| LangChain | 开发库 | 构建基于思维链的 Agent 和 RAG 系统 |
| Tree of Thoughts | 方法论 | 让模型探索多条推理路径,类似于「并行宇宙」思考 |
| guidance | 控制语言 | 用结构化语法精确控制 LLM 的输出格式和推理过程 |
| llm-reasoners | 推理库 | 专门为高级推理任务设计的 LLM 调用封装 |
| PromptBench | 评测工具 | 统一评测框架,评估不同 CoT 策略的有效性 |
这些工具的共同特点是:它们不是让开发者手工设计完美的提示词,而是提供程序化、可复用、可评测的推理框架。
没有高质量的训练数据,再好的方法也是空中楼阁。仓库收录了多个关键数据集:
这个仓库最难得的一点是,它专门开辟了 「Limitations, Failures, Puzzles」 章节,坦诚记录 AI 推理的局限性:
这些「不完美」告诉我们:AI 的「思考」和人类的思考,本质上并不相同。
awesome-deliberative-prompting 的归档,恰恰说明这项技术已经从「前沿研究」变成了「工程常识」。2025 年之后,几乎所有主流大模型 API 都原生支持思维链调用,DeepSeek R1、OpenAI o1/o3 等推理模型更是将「显式推理」内嵌到模型架构中。
这个仓库的历史价值在于:它不仅是一个 reading list,更是一部 AI 推理技术的编年史——从 2021 年的一个小点子,到 2025 年 DeepSeek R1 的强化学习突破,完整记录了社区是如何一步步教会 AI「深思熟虑」的。
对于 AI 爱好者和开发者而言,这个仓库是理解 LLM 推理演进历程的最佳起点。无论你是想了解 Chain-of-Thought 的起源、多 Agent 协作的最新进展,还是想为自己的应用选择合适的推理框架,这座「知识金矿」都值得一挖再挖。
项目已于 2025 年 2 月归档为只读状态,但知识永不过期。
来源:logikon-ai/awesome-deliberative-prompting · GitHub