DeepSeek-R1
首个纯强化学习驱动的开源推理模型,数学/代码表现对标 OpenAI o1
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个纯强化学习驱动的开源推理模型,数学/代码表现对标 OpenAI o1
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025 年 1 月 20 日,国产大模型公司 DeepSeek 发布了一款名为 DeepSeek-R1 的推理模型。它在数学、编程、逻辑推理等任务上的表现,与 OpenAI 同年 9 月发布的 o1 模型旗鼓相当——而 DeepSeek 选择将权重和技术报告全部开源。一时间,全球 AI 社区为之震动。
想象这样一个场景: 你向 AI 提问一道复杂的数学竞赛题,AI 不是立刻给出答案,而是像一位认真思考的学生一样,在「内心独白」中反复推演、验证、修正,最终一步一步地把解题思路和盘托出。这正是 DeepSeek-R1 带给用户的体验。

图 1:DeepSeek-R1 在多项推理基准测试中与 OpenAI o1 的对比(2025年1月发布版)
长期以来,业界普遍认为「大力出奇迹」——模型越大、训练数据越多,智能就越强。DeepSeek 团队并没有否认这一路线,但他们敏锐地捕捉到了一个被低估的方向:与其让模型记住更多知识,不如让模型学会主动思考。
2024 年 9 月,OpenAI 率先发布了 o1-preview,首次将「长思维链」(Long Chain-of-Thought)引入大众视野。o1 的核心思想是:让模型在回答前先生成一段完整的推理过程(think),再从中提炼出最终答案。这一「边想边答」的机制显著提升了模型在数学和代码任务上的表现。
DeepSeek 的团队深受启发,但他们想做的是把这件事推向极致——不仅让模型思考,还要让模型自己学会如何更好地思考。
DeepSeek-R1 最引人注目的一点,是它的「零-shot 推理」特性。团队先训练了一个名为 DeepSeek-R1-Zero 的版本,它完全不使用任何监督微调(SFT)数据,直接从基础模型出发,通过大规模强化学习(RL)让模型自己涌现出推理能力。
这意味着什么?以往训练一个推理模型,需要人工标注大量「问题→推理过程→答案」的监督数据,成本极高且质量参差不齐。而 DeepSeek-R1-Zero 的实验表明:只要给出正确的奖励信号(答案对不对),模型自己就能摸索出有效的思考策略。
DeepSeek-R1-Zero 在训练过程中自发涌现出了三大能力:
不过,DeepSeek-R1-Zero 也有明显缺陷:容易陷入重复输出、语言混杂、格式不友好。团队在 R1-Zero 的基础上加入了「冷启动数据」(少量高质量的推理样本),经过两轮 RL + 两轮 SFT,最终得到 DeepSeek-R1,在保持强大推理能力的同时,输出质量大幅改善。
DeepSeek-R1 实际上是一个庞大的模型家族,包含两个层次:
满血版(671B 参数):
两者的共同特点是采用了 MoE(混合专家)架构——671B 总参数中,每次推理只激活 37B,因此理论上可以在多卡环境下运行。
蒸馏版(1.5B ~ 70B): DeepSeek 团队用 R1 生成的高质量推理数据,对多个开源基座模型进行了微调,产出了 6 个规模的蒸馏模型:
| 模型 | 基座 | 推荐硬件 |
|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | Qwen2.5-Math-1.5B | 单卡 RTX 3060 级别 |
| DeepSeek-R1-Distill-Qwen-7B | Qwen2.5-Math-7B | 单卡 RTX 4060 级别 |
| DeepSeek-R1-Distill-Qwen-14B | Qwen2.5-14B | 单卡 RTX 4090 级别 |
| DeepSeek-R1-Distill-Qwen-32B | Qwen2.5-32B | 双卡或高端单卡 |
| DeepSeek-R1-Distill-Llama-8B | Llama-3.1-8B | 单卡 RTX 4060 级别 |
| DeepSeek-R1-Distill-Llama-70B | Llama-3.3-70B-Instruct | 多卡 A100 级别 |
这些蒸馏模型的意义在于:把大模型的「推理思维模式」压缩进了小模型里。DeepSeek-R1-Distill-Qwen-32B 在 AIME 2024 数学竞赛题上达到 72.6% 的 pass@1,超越了 OpenAI o1-mini 的 63.6%。这说明小模型通过蒸馏,确实可以「继承」大模型的推理能力。
DeepSeek-R1 在各大推理基准上的表现是它最大的亮点:

图 2:DeepSeek-V3 在多项通用基准上的表现(DeepSeek-R1 基于同架构)
冷静来看,DeepSeek-R1 也存在一些争议:
1. 「对标 o1」是真是假? 基准测试数字上,DeepSeek-R1 确实在多项任务上超越了 o1-mini,但 OpenAI 的 o1 是闭源服务,完整版 o1-1217 的具体能力并未公开。DeepSeek-R1 真正对标的是 o1-mini,在部分任务(如 GPQA Diamond)仍落后于 o1-1217。
2. 蒸馏模型的「作弊」争议 有研究者指出,DeepSeek 的蒸馏数据可能包含了 benchmark 题目的答案——即模型在蒸馏阶段「见过」测试题,因此测试分数不能完全代表真实能力。这一争议尚未有定论。
3. 输出可读性问题 即使在 DeepSeek-R1(而非 R1-Zero)中,长思维链输出的格式有时仍不够友好,尤其在中文场景下可能出现语言混杂。用户需要通过 prompt engineering(如强制以 <think> 开头)来改善。
4. 无法本地部署满血版 671B 参数的完整模型需要约 800GB+ GPU 显存,当前的消费级硬件根本无法运行。团队建议使用蒸馏模型或通过官方 API 调用。
DeepSeek-R1 的发布,在 AI 行业引发的震动远超技术本身:
官方 API(推荐): 访问 platform.deepseek.com,使用与 OpenAI 兼容的 API,只需将 base_url 改为 DeepSeek 端点即可。
本地蒸馏模型部署(示例):
使用 vLLM 启动 DeepSeek-R1-Distill-Qwen-32B:
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --tensor-parallel-size 2 --max-model-len 32768 --enforce-eager
或使用 SGLang:
python3 -m sglang.launch_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --trust-remote-code --tp 2
使用建议:
许可说明: DeepSeek-R1 采用 MIT 许可证,支持商业使用和模型蒸馏。蒸馏模型的许可取决于其基座模型(Qwen 系列为 Apache 2.0,Llama 系列为 Llama 3.1/3.3 License)。