DeepSeek-Math
7B参数开源数学推理模型,MATH基准51.7%逼近GPT-4,附GRPO强化学习训练代码
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
7B参数开源数学推理模型,MATH基准51.7%逼近GPT-4,附GRPO强化学习训练代码
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Imagine a world where your laptop could solve IMO 国际数学奥林匹克级别的难题——不是靠死记硬背,而是真正学会推理。这听起来像是科幻,但 DeepSeekMath 正在把这件事变成现实。2024年2月,深度求索公司开源了 DeepSeekMath 7B 模型,在 MATH 数学基准测试中斩获 51.7% 的成绩,逼近 GPT-4 和 Gemini-Ultra 的水平,而它只是一个体积仅 7B 参数的轻量模型。
对于普通数学爱好者而言,这意味着:曾经只有顶级闭源模型才能完成的复杂推理,现在任何人都可以在本地运行。对于 AI 开发者来说,DeepSeekMath 是一扇窗口——它展示了如何用相对有限的资源,通过高质量数据和精妙的训练方法,在特定领域达到接近天花板的水平。
让我们先把 DeepSeekMath 想象成一个被精心培养的数学竞赛选手。
选苗阶段:从 DeepSeek-Coder 出发的数学天才
DeepSeekMath 7B 并非从零训练,而是以 DeepSeek-Coder-Base-7B-v1.5 为基础模型。为什么要用代码模型作为起点?研究团队发现,代码训练让模型具备了良好的结构化推理能力——编写代码本质上就是一种逻辑推理过程,这恰好与数学思维高度契合。在代码能力基础上,团队继续对数学相关语料进行大规模预训练,总计消耗 5000 亿个 token,最终诞生了 DeepSeekMath-Base。
海量习题册:35.5M 数学网页,1200亿token
数学推理能力的上限,很大程度上取决于训练数据的质量。DeepSeekMath 的数据构建过程颇具匠心:团队以 OpenWebMath(高质量数学网页集合)为种子,用 FastText 分类器从 Common Crawl 数据库中大海捞针般筛选数学内容,经过 4 轮迭代,最终收集了 3550 万个数学相关网页,总计 1200 亿 token 的训练语料。这些数据涵盖了从初等代数到高等数学的广泛领域,为模型提供了丰富的习题册。
图1:DeepSeekMath 数据采集 Pipeline(4轮迭代FastText筛选)
教练方法:GRPO——让AI自己学会做数学
在模型微调阶段,DeepSeekMath 采用了团队自研的 GRPO(Group Relative Policy Optimization) 算法。简单类比:传统的 RLHF(如 PPO)像是一个严格的教练,每次都要和标准答案比较来打分;而 GRPO 则让模型同时生成多个答案,通过组内相对排名来学习——表现好的答案被强化,表现差的被抑制。这种方式大幅降低了对参考模型的依赖,同时保持了强化学习的有效性。
在此基础上,团队还引入了 Self-Specific 奖励机制:让模型自己判断答案的逻辑一致性和完整性,而非单纯依赖外部打分。这种自我反思能力让 DeepSeekMath-RL 在工具使用场景下达到了接近 60% 的 MATH 准确率。
仓库提供了三个模型checkpoint,分别对应不同的使用阶段:
所有模型均托管在 HuggingFace,序列长度支持 4096 token,推理时通过 Transformers 库加载,配合 bf16 精度可在单卡 A100(40GB)或双卡 3090 上运行。
图2:DeepSeekMath 在 MATH 基准上的表现(51.7%逼近GPT-4/Gemini-Ultra)
从评测代码结构来看,DeepSeekMath 的推理层构建在 vLLM 之上,充分利用了 vLLM 的高效批处理推理能力。评测脚本提供了三种评测模式:
评测支持中英双语题目,针对中国用户的数学题(如高考、竞赛题)同样适用——只需在 prompt 中附加中文指令即可。
图3:DeepSeekMath-Instruct 与 DeepSeekMath-RL 在多基准上的评测结果
DeepSeekMath 并非没有局限。首先,它是纯学术研究导向的产物——没有 Docker 化、没有 Web 界面,部署需要较强的工程能力(CUDA、PyTorch 环境、GPU 资源)。其次,7B 模型在面对需要多步逻辑链的复杂证明题时,仍可能出现推理跳跃或错误累积。
更深层的争议在于:51.7% 的 MATH 准确率究竟代表真正理解数学,还是仅仅学会了在海量数据中匹配模式?这个问题至今没有定论,也是整个 AI 数学推理领域的核心争议。DeepSeekMath 的发布为研究者们提供了丰富的评测数据和开源模型,让这场讨论有了更具体的着力点。
DeepSeekMath 的意义不仅在于它本身的性能,更在于它代表了一种趋势:开源模型正在以远低于闭源模型的资源投入,在特定领域逼近顶级水平。从 GPT-4 到 Gemini-Ultra,闭源模型的数学能力长期领先;但 DeepSeekMath 用 7B 参数、相对低成本的方式达到了接近的水平,为学术界和中小企业提供了一个可复现、可研究、可微调的高质量基座。
从增长曲线看,DeepSeekMath 的 3300+ GitHub Stars 反映了社区的高度关注,其背后的 GRPO 算法、数据构建方法论,以及用代码模型作为数学训练起点的思路,都值得 AI 研究者和工程师深入挖掘。
图4:DeepSeekMath 预训练语料来源与构成