CoT-Igniting-Agent
系统梳理从 Chain-of-Thought 推理到 Language Agent 的演进路径,涵盖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
系统梳理从 Chain-of-Thought 推理到 Language Agent 的演进路径,涵盖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你向一个大语言模型提问「为什么天空是蓝色的」,它没有直接给出一个看似正确却语焉不详的答案,而是耐心地一步步拆解——先解释瑞利散射原理,再说明短波长光在大气中散射更强的物理机制,最终让你真正理解了这个现象。这种「思考过程可见」的问答方式,正是 Chain-of-Thought(思维链,简称 CoT)技术的核心追求。
CoT-Igniting-Agent 仓库由上海交通大学、清华大学等机构的研究者联合维护,系统性地梳理了从 2022 年以来 Chain-of-Thought reasoning 到 Language Agent(语言智能体)的发展脉络,涵盖超过 200 篇相关论文,被引用于 NeurIPS、ACL、ICLR 等顶会的论文体系中。这不是一份简单的论文列表,而是一份关于 AI「如何思考」的完整技术进化史。
在 2022 年之前,大多数 AI 问答系统的运作逻辑接近于「查表式匹配」——用户提问,系统从海量数据中检索最相关的答案直接输出。这种方式在简单问题上效果不错,但面对需要多步推理的复杂问题(比如数学证明、逻辑推导),模型的准确率会急剧下降,因为模型根本没有机会展示自己的推理过程,更谈不上在推理中途自我纠正。
2022 年 1 月,Google 团队发表了里程碑式论文「Chain-of-Thought Prompting Elicits Reasoning in Large Language Models」,正式提出 CoT 概念——通过在 Prompt 中加入少量「思考过程示例」(先展示推理步骤,再给出答案),诱导模型在回答时自发产生中间推理步骤。这篇论文揭示了一个重要发现:大语言模型不仅能「记住答案」,更重要的是它拥有潜在的推理能力,而 CoT 正是激活这种能力的钥匙。
随后在 2022 年 5 月,东京大学和 Google Brain 的研究者在论文「Large Language Models are Zero-Shot Reasoners」中进一步证明,模型甚至不需要示例,只需在问题末尾加上「Let's think step by step」这样的触发语,就能在数学推理任务上将准确率提升数倍。这就是后来被广泛使用的 Zero-Shot-CoT 方法。
CoT 并非一项单一技术,而是一套不断演进的方法论体系。仓库中系统地将 CoT 研究分为五大范式:
提示范式(Prompting Paradigm) 是 CoT 的起点。研究者发现,CoT 的效果高度依赖「示例」的质量。Manual-CoT 需要人工撰写推理示例,成本高但质量可控;Auto-CoT 则尝试让模型自动生成多样化示例,降低人工成本;Active-Prompt 在 Auto-CoT 基础上引入主动学习策略,选择模型「最不确定」的问题优先标注,最大化标注效率。OPRO 更进一步,将大语言模型本身作为优化器,自动搜索最优的 Prompt 组合。
推理聚合(Reasoning Aggregation) 关注如何利用多条推理路径。Self-consistency(自洽性)方法让模型针对同一问题生成多条不同的推理链,然后通过投票选择最一致的答案。这种「集思广益」的思路在数学推理上带来了显著提升。Rationale-Augmented Ensembles 则将推理依据与最终答案结合训练,提升模型的解释性。
推理验证(CoT Verification) 是近年最活跃的研究方向。OpenAI 在 2023 年发布的「Let's Verify Step by Step」引入了 Process Reward Model(PRM,过程奖励模型),在每一步推理中间插入验证信号,而非仅评价最终答案。Self-Verification 让模型用自己的推理结果反向验证原始问题,形成「自我纠错」闭环。Verify-and-Edit 框架在知识密集型任务(如事实核查)上结合外部知识库,对推理链进行编辑修正。
多模态与跨领域扩展 则将 CoT 从纯文本推理扩展到多模态场景。Multimodal-CoT 引入图像信息辅助文本推理,在科学图表理解任务上取得突破;Multilingual-CoT 证明 CoT 推理能力可以跨语言迁移,低资源语言同样受益;Graph-of-Thought 则将推理结构从链式扩展到图式,允许推理路径的合并、分叉与回溯,适合复杂的多跳问答场景。
如果说 CoT 解决的是「如何想得对」的问题,那么 Language Agent 要解决的是「如何做得住」的问题。2022 年 10 月,Shunyu Yao 等人发表的 ReAct(Synergizing Reasoning and Acting)将 CoT 与工具调用完美融合——模型不仅生成思考链,还主动调用搜索、计算、代码执行等外部工具来辅助推理,并根据工具返回结果动态调整后续行动。这标志着 AI 系统从「被动回答」向「主动行动」的根本转变。
围绕 ReAct 范式,研究者们进行了大量扩展。ToolLLM 让模型掌握超过 16000 个真实 API 接口的能力;MM-ReAct 将多模态感知融入推理-行动闭环;Auto-UI 则让 Agent 直接操控手机和电脑界面,无需 API 即可完成真实世界的任务。
仓库后半部分系统梳理了从 2023 年初至今 Language Agent 领域的爆发式发展:
多智能体协作 是最热门的方向之一。CAMEL 让两个 Agent 分别扮演「老板」和「员工」进行角色扮演式协作;MetaGPT 引入了类似软件公司的多角色分工机制——产品经理、架构师、程序员、测试工程师各司其职,通过结构化消息协议协作完成复杂软件项目;ChatDev 进一步将这一思想用于自动化软件开发;Multi-Agent Debate 让多个 Agent 就同一问题展开辩论,相互质疑与反驳,最终收敛到更可靠的答案。
具身智能体 将 Agent 能力延伸到虚拟与物理世界中。Voyager 在 Minecraft 中持续探索和学习,积累技能库;GITM 利用 LLM 的文本知识与记忆系统解决开放世界任务;Generative Agents 则构建了一个由 25 个 AI 居民组成的虚拟小镇,观察它们的社交行为涌现现象。
自主研究 Agent 代表了 AI 辅助科学研究的最高水平。ChemCrow 整合化学工具(分子搜索、反应预测等)辅助化学研究;Auto-PaLM 在医学问答上达到专家水平;CodePlan 让 Agent 在真实代码仓库中执行编程任务;ToRA 则是专为数学定理证明设计的工具调用推理 Agent。
纵览这份仓库梳理的演进路径,可以提炼出几条清晰的技术演进规律:
从 Prompt 到 Agent 的能力跃迁:CoT 最初只是改变 Prompt 格式,但很快演化出 Tool Use(工具使用)、Memory(记忆)、Planning(规划)、Reflection(反思)等 Agent 核心组件,能力边界不断扩展。
推理与行动的一体化:ReAct 证明了「想」和「做」不应割裂。推理提供方向,行动提供反馈,两者相互强化形成闭环。这一范式深刻影响了后来 Agent 框架的设计哲学。
多智能体协作的规模化效应:从单 Agent 到多 Agent 的跃迁,带来了能力涌现的可能性。多 Agent 辩论、多角色协作、分布式问题解决,正在成为处理复杂任务的主流路径。
这是一个纯文档型仓库,无需安装任何依赖。直接阅读 README.md 即可按主题检索论文。对于研究者和开发者,建议的阅读路径为:
每篇论文都附有arXiv链接,可以直接下载原文深入阅读。仓库还提供了可视化图表,展示 CoT 五大范式之间的关系与演进路径,帮助读者建立系统认知。
尽管这份调研覆盖面极广,但仍有局限:仓库主要聚焦于 LLM-based CoT 与 Agent,对传统符号推理方法(如神经符号系统)覆盖有限;论文列表以 2022-2024 年为主,对 2025 年后涌现的新范式(如 Agentorchestras、MCP 协议等)尚需更新。
展望未来,CoT 与 Agent 的融合正在进入新阶段:大模型不仅需要「会想」「会做」,还需要在长程任务中保持一致性、积累可复用的技能、与其他 Agent 高效协作。这些挑战将驱动下一波技术突破,而这正是这份「Hitchhiker's Guide」持续更新的价值所在。