DeepSeek-LLM
deepseek-ai/DeepSeek-LLM加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年初,一份来自中国团队的论文在硅谷引发震动。一家名为深度求索(DeepSeek)的公司,以远低于"行业共识"的算力成本,训练出了性能比肩GPT-4的开源大语言模型。Meta前高管感慨:"他们做到了我们认为不可能的事。"而这一切的起点,正是今天我们要分析的开源项目——DeepSeek-LLM。
DeepSeek LLM 标志
深度求索的背后,是杭州量化投资基金幻方量化。2021年,幻方在亚太地区率先拿到英伟达A100 GPU,成为国内少数囤积超过万张A100的机构之一。2023年4月,幻方宣布进军大模型,同年5月独立出深度求索公司,专注于AGI研究。
DeepSeek-LLM发布于2023年11月,是深度求索的首款开源大语言模型,包含7B和67B两种参数规模,在数学、代码、推理等多个评测基准上展现出令人印象深刻的能力。
项目基本信息
- ⭐ Stars: 7,257 | Fork: 1,282
- 🔤 语言: Makefile
- 📅 创建: 2023-11-29 | 最近更新: 2026-09-17
- 📄 许可证: MIT
- 🌐 官网: https://chat.deepseek.com/
- 🌳 默认分支: main
DeepSeek-LLM的核心亮点在于数学推理和代码生成能力。
数学能力方面,DeepSeek-LLM 67B Chat在匈牙利国家数学奥林匹克竞赛题上得分高达84.1分,在HumanEval代码测试中得分65.2,在MATH基准(0-shot)上得分32.6。这一成绩不仅超过了同期开源模型,甚至在某些指标上逼近了GPT-3.5的水平。
DeepSeek-LLM 在数学评测中的表现
代码能力方面,DeepSeek-LLM 67B Base在LeetCode周赛题目上Pass@1得分达到73.78分(内部人类评测),展现了出色的算法思维和代码实现能力。评测结果显示,其代码生成质量已接近初级工程师水平。
DeepSeek-LLM 在 LeetCode 竞赛中的代码生成表现
在MMLU、C-Eval等通用理解基准上,DeepSeek-LLM 67B Base分别达到71.3%和66.6%的成绩,在中文理解任务上更是超越了GPT-3.5。
DeepSeek-LLM采用了标准的Transformer架构,7B模型使用Multi-Head Attention(MHA),67B模型则使用Grouped-Query Attention(GQA),以提升推理效率。
模型训练语料超过2万亿tokens,涵盖英文、中文、代码、数学等多个领域。预训练阶段采用AdamW优化器,学习率调度采用多步衰减策略:初始学习率对应的warmup步数为2000,在1.6T tokens处降至最大值的31.6%,在1.8T tokens处进一步降至10%。
训练过程中,团队使用了严格的数据清洗流程,包括:
DeepSeek-LLM的部署方式完全依赖HuggingFace Transformers生态。以下是文本补全的最小示例:
import torch
from transformers import AutoTokenizer, AutoModelForCausalLM, GenerationConfig
model_name = "deepseek-ai/deepseek-llm-67b-base"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name, torch_dtype=torch.bfloat16, device_map="auto"
)
model.generation_config = GenerationConfig.from_pretrained(model_name)
model.generation_config.pad_token_id = model.generation_config.eos_token_id
text = "An attention function can be described as mapping a query and a set of key-value pairs to an output"
inputs = tokenizer(text, return_tensors="pt")
outputs = model.generate(**inputs.to(model.device), max_new_tokens=100)
result = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(result)
对于Chat版本,只需切换模型名称并使用对话模板即可。整个过程没有Web界面,没有Docker化,纯Python脚本驱动,对用户的工程能力有一定要求。
DeepSeek-LLM并非完美,存在以下局限:
幻觉问题:与所有LLM一样,DeepSeek-LLM可能在生成内容中包含不准确或虚构的信息,需要用户具备辨别能力。
重复生成:部分场景下会出现重复输出相同短语或句式的情况,尤其在长文本生成中更为明显。
部署门槛高:67B参数模型需要约140GB显存(FP16),7B模型也需要16GB以上显存,普通开发者难以在消费级GPU上运行大参数版本。
无开箱即用UI:项目仅提供模型权重和基础推理代码,缺乏Gradio/Streamlit等Web界面,用户需要自行编写调用代码。
DeepSeek-LLM的意义远超技术本身。2024年初,当DeepSeek-V2(基于DeepSeek-LLM的升级版)以极低价格开放API时,OpenAI前员工评价道:"DeepSeek正在改变AI的成本结构。"
DeepSeek-LLM系列的崛起证明了一个重要观点:算力不是大模型的唯一护城河,数据质量、训练方法、模型架构的创新同样关键。这给全球AI研究者带来了新的思考方向。
目前,DeepSeek已发展出DeepSeek-V2/V3、Coder系列、Math系列、RL系列等多个模型,形成了完整的产品矩阵,而DeepSeek-LLM正是这一生态的奠基之作。
分析时间: 2026-09-18 18:33 数据来源: GitHub API + HuggingFace