openr
让大模型学会「慢思考」的开源推理框架,支持 MCTS、PRM 过程奖励与在线 RL 训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让大模型学会「慢思考」的开源推理框架,支持 MCTS、PRM 过程奖励与在线 RL 训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年10月,OpenAI 推出 o1 模型,在数学和编程任务上展现出惊人的推理能力,核心突破在于 Process Reward Model(过程奖励模型,PRM)——让 AI 在推理过程中「自我审视」,而不是只给最终答案。这一突破背后,是 o1-preview 和 o1-mini 在 AIME 数学竞赛、MATH 基准测试上的大幅领先。
但 o1 是闭源的。学术圈和开源社区一直在追问:如何在自己的模型上复现这种「慢思考」能力?
OpenR(openreasoner/openr)正是答案之一。这是一个由 Wang Jun 等研究者发起的开源框架,目标是用 PRM 和蒙特卡洛树搜索(MCTS)等技术,让任意大语言模型具备 advanced reasoning 能力。项目在 GitHub 已有超过 1800 颗星,配套发布了 Math-psa 过程奖励模型和 MATH-APS 数据集,并在 arXiv 发表了技术报告(arXiv:2410.09671)。
OpenR 的架构分为三个核心层次:
推理引擎层(reason/):支持多种推理搜索策略——
训练框架层(train/、prm/、gen_rm/):支持过程奖励模型的训练,包括:
环境模拟层(envs/MATH/):基于 LaTeX 和 SymPy 的数学推理环境,能将 LaTeX 数学公式解析为可执行的符号系统,用于验证推理结果的正确性。

图:不同推理方法在 MATH 子集上的表现对比,PRM + Best-of-N 显著优于纯 Greedy CoT。
传统的结果奖励(Outcome Reward)只在推理结束后给一个分数,但过程奖励(Process Reward)会对推理的每一步打分。这就像让一位数学老师不仅评判学生最后答案对不对,还在每一步推导时指出思路是否正确。
OpenR 自研的 Math-psa 模型(基于 Math-Shepherd 架构)就是这样一个过程奖励模型。在 Best-of-N 推理中,Math-psa 显著超越了原版 Math-Shepherd,尤其在复杂推理路径上优势明显——因为它不仅看最终结果,还理解推理过程中的「关键转折点」。

图:OpenR Math-psa(左)与 Math-Shepherd(右)在同一问题上的推理路径评分对比,Math-psa 能更准确地识别正确的中间步骤。
这是一个面向研究人员和深度用户的框架,上手有一定门槛:
硬件要求:必须使用 GPU,推荐 NVIDIA 显卡,显存建议 24GB 以上(运行 7B 模型)。框架底层使用 vLLM 进行高效推理,支持连续批处理。
安装流程(约 2-4 小时):
cot_greedy.sh、beam_search.sh)部署方式:纯 CLI,无 Web UI,无 Docker 支持。不提供 pip install 一键安装包,需要从源码运行。
OpenR 的出现填补了 o1 类推理框架的开源空白。它不仅提供了完整的 PRM 训练 + 推理流程,还开源了 MATH-APS 数据集和 Math-psa 模型权重,让学术圈可以在同一基线上进行公平比较。
从技术趋势看,OpenR 体现了三个方向:
项目目前仍在活跃开发中(TODO 包括分布式训练、多模态推理、自改进训练等),值得关注。
相关链接: