CoRe
TianHongZXY/CoRe加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
场景切入: 你问 GPT-3 一个小学数学鸡兔同笼问题,它洋洋洒洒写了一大段推导,结论却是"答案是 5 只鸡、3 只兔"——显然算错了。传统大模型做数学应用题,往往一步错、步步错,即使有思维链(Chain-of-Thought)也难以自我纠错。ACL 2023 收录的 CoRe 项目,就是来解决这个问题的。
CoRe,全称 Cooperative Reasoning,由北京大学、新加坡国立大学等机构的研究者提出,发表在 ACL 2023 会议。项目核心作者包括 Xinyu Zhu、JunJie Wang、Lin Zhang 等。GitHub 发布于 2022 年末,迄今已获得 51 颗 Stars、8 次 Fork。
这个项目的学术背景很有意思:当时(2022年末)ChatGPT 还未正式开放 API 调用,GPT-3 API 费用高昂,研究者们在有限预算下,探索如何让中等规模的语言模型(如 GPT-J 6B)也能在数学应用题(Math Word Problem, MWP)上达到甚至超越 GPT-3 的表现。CoRe 正是这个探索的产物。
CoRe 的架构设计非常精妙,引入了三组件协同推理机制:
1. 生成器(Generator)
基于 GPT-J 6B 或 DeBERTa 等模型,在 GSM8K 等数学数据集上微调,负责生成解题推理步骤序列。
2. 验证器(Verifier)
这是一个关键创新——CoRe 同时训练了一个**奖励模型(Reward Model)**作为验证器,它能够评估生成器输出的每一个推理步骤是否正确,从而在搜索过程中起到"裁判"作用。
3. 蒙特卡洛树搜索(MCTS)
在没有 MCTS 时,模型只能线性生成解题步骤,一个错误会导致连锁失败。CoRe 引入 MCTS,将解题过程建模为树搜索问题:验证器评估每个节点的置信度,MCTS 选择最有前途的分支继续探索,从而实现有方向性的探索 + 自我纠错。

如上图所示,CoRe 的搜索树会同时探索多条解题路径,通过验证器打分识别正确路径,在预算(搜索深度/宽度)内最大化正确答案概率。
项目基于 PyTorch Lightning 1.6.4 + PyTorch 1.10.0 构建,要求 Python 3.8 + CUDA 11.1,对硬件要求较高。核心依赖包括:
pytorch-lightning:分布式训练框架coloredlogs:日志彩色输出jsonlines:JSON 行格式数据处理代码库设计了完整的训练流程:
train.slurm:微调生成器(Generator)train_verifier.slurm:微调验证器(Verifier)mcts.slurm:执行 MCTS 推理搜索CoRe 在 GSM8K(Grade School Math 8K)数据集上进行了评测,这是当时最具挑战性的数学应用题数据集之一。
不适合做什么:
unsupported适合做什么:
CoRe 代表了 2022 年 NLP 领域的一个重要方向:用外部知识或辅助模型增强 LLM 的精确推理能力。这个思路后来在许多工作中得到延续,比如让 LLM 调用外部工具(Toolformer)、多智能体协作(Multi-Agent)等。CoRe 的生成器-验证器双塔设计,可以看作是"LLM 自协作"的早期实践。
虽然 2023 年下半年 ChatGPT/GPT-4 的数学能力大幅提升,让这类研究工作的必要性有所下降,但 CoRe 的方法论对于资源受限场景下的小模型优化仍有参考价值——如何在有限参数规模下通过搜索策略弥补能力差距,是一个持续有意义的课题。