ChatGLM-Math
THUDM/ChatGLM-Math加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

2024年初,一位使用大模型辅助教学的高校数学老师发现:同一个问题,换一种问法,模型的答案就可能从「正确」变成「胡说八道」。几何证明题能列出方程却画不对图,概率题算对了结果却写不出推导过程。更让他困惑的是,模型明明在文学创作、代码生成上表现惊艳,偏偏在中学数学上频频「卡壳」。
这并非个案。数学推理——这个人类教育体系中看似基础的能力——实际上是当前大语言模型(LLM)最明显的短板之一。原因在于:数学解题需要严密的逻辑链、符号推理和多步推导,任何一步出错都会导致整题答错。而传统LLM的「下一个token预测」训练范式,并不能天然习得这种能力。
THUDM(清华大学知识工程实验室)发布的 ChatGLM-Math 项目,正是为了解决这一核心矛盾。
传统的LLM数学能力提升方案,大多是构造数学数据集然后做监督微调(SFT)。这种方法有点像「刷题库」——题刷得越多,见过类似的题目正确率就越高,但一旦遇到新题型、新问法,模型立刻原形毕露。
ChatGLM-Math 提出了一个更聪明的思路:让模型学会自我批评。
这个 Self-Critique 流水线分为三个阶段:
第一阶段:训练 Math-Critique 模型。 从待优化的LLM本身出发,训练一个通用的数学批评模型。这个批评模型的作用类似于「数学家教」——它不直接解题,而是对模型的解题过程和答案进行评价:「你这步推导有问题」「这个结论逻辑上不成立」「第三步的符号用错了」。
第二阶段:拒绝采样微调(RFT)。 让原始LLM对数学问题大量生成解答,然后由Math-Critique模型打分,保留高分的正确答案,形成高质量的微调数据,再对LLM做微调。
第三阶段:直接偏好优化(DPO)。 在RFT的基础上,进一步引入偏好学习,让模型不仅学会正确答案,还能区分「好解法」和「坏解法」,从而在生成时就更倾向于选择高质量的推理路径。
基于 ChatGLM3-32B,这套流程带来的提升效果非常显著:在基础数学上平均提升 23%,高级数学提升 34%,最终性能超越了参数规模两倍于它的其他模型。
好的评测集是科研的基石。ChatGLM-Math 还附带了一个精心设计的测试集 MathUserEval,包含 545 道高质量数学题,分为两大类八个子类:
题目来源既有大学考试真题,也有模拟真实用户对话场景的原创题——后者由标注员模拟日常使用大模型的体验提出,更贴近实际使用中的痛点。评测采用 GPT-4-1106-Preview 作为评分模型,从多个维度(逻辑正确性、步骤完整性、表达清晰度)综合打分。
ChatGLM-Math 的核心是一个模块化的评测框架,使用流程非常清晰,分为三步:
第一步:获取模型回复。 在 inference/api_models/ 中实现待测模型的 API 调用类(参考 do_nothing 示例),然后运行 get_answers.py 生成模型回复。框架支持并行调用,效率较高。
第二步:调用评分模型。 在 config/mathusereval.json 填入 OpenAI API Key,运行 judge.py 调用 GPT-4-1106-Preview 对所有回复进行评分和分析,结果保存到 data/judgment/。
第三步:汇总结果。 运行 show_result.py,读取所有评测结果,输出带详细子类别分数的 Excel 报告。
评测脚本设计得非常实用,参数清晰,扩展方便。THUDM 还透露计划开源 Math-Critique 作为 GPT-4 的替代评分模型,降低使用成本。
评测框架本身设计完善,但使用时需要注意几个现实问题:
必须依赖 OpenAI API。 评测流程使用 GPT-4-1106-Preview 作为评分模型,这意味着在没有 API Key 的情况下无法运行完整的评测流程。在国内网络环境下,调用 OpenAI API 本身也是一道门槛。
评测而非可直接部署。 本仓库是评测研究工具,不是开箱即用的模型服务。没有 Docker 支持,没有 Web UI,如果你的目标是「跑一个数学问答机器人」,这并不是正确的选择。
基础模型不在本仓库。 评测的是其他模型的数学能力,本仓库不提供训练好的模型权重。需要自己部署被测模型或获取其 API。
ChatGLM-Math 的 Self-Critique 范式,对 LLM 对齐研究具有重要的方法论价值。它证明了一个关键洞察:模型不仅需要学会正确答案,还需要学会判断答案的质量。这种「元认知」能力,正是让LLM从「背题选手」进化为「解题高手」的关键。
从趋势看,Math-Critique 这类专用批评模型正在成为 LLM 后训练的重要工具。ChatGLM-Math 作为 THUDM 在数学推理领域的代表作,与该团队的 AlignBench(通用对齐评测)、ChatGLM3(基座模型)形成完整的研究生态,代表了国产大模型在评测工具链上的深度积累。
如果你在研究 LLM 的数学推理能力,或需要一套标准化的数学评测基准,ChatGLM-Math 及其 MathUserEval 数据集是非常值得关注的资源。