MiniCPM
国产端侧大模型旗舰,1B 参数达同尺寸 SOTA,支持双模式推理与多框架部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
国产端侧大模型旗舰,1B 参数达同尺寸 SOTA,支持双模式推理与多框架部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:MiniCPM 官方 Logo
想象一下:你有一个私人助理,随时能在本地回答问题、帮你写代码、分析数据,而且完全不依赖云端,数据永远留在你自己的设备里——这就是 MiniCPM 想要实现的目标。
MiniCPM 由清华大学 NLP 实验室孵化的 OpenBMB(Open Big Model Lab) 团队开发。该团队此前在模型压缩、量化、高效推理领域有深厚积累,曾提出 BPM、BPMT 等多项前沿技术。2024年2月,团队发布 MiniCPM-2B,在当时刷新了「最强2B开源模型」记录,引发业界广泛关注。此后项目保持高频迭代,先后推出 MiniCPM3、MiniCPM4、MiniCPM-SALA,直到最新的 MiniCPM5-1B。
简单来说,MiniCPM 就是:用尽可能小的参数规模,达到尽可能大的模型效果。它不是简单的「缩水」,而是通过训练配方优化、RL + OPD(Optimal Process Distillation)强化学习、混合注意力架构等技术创新,让小模型「学会更聪明地思考」。
把大模型理解为一个知识渊博但行动迟缓的学者——他什么都知道,但需要大量精力(计算资源)才能回答一个问题。MiniCPM 的思路是把这位学者「训练」得更高效:

图2:MiniCPM5-1B 各领域能力对比(来源官方)
1. 多版本并行,覆盖全场景
仓库采用多版本并行维护策略,每个版本针对不同硬件和使用场景优化:
| 版本 | 参数量 | 特点 | 适用场景 |
|---|---|---|---|
| MiniCPM5-1B | 1B | 端侧 SOTA,双模式推理(思考/快速) | 手机/树莓派/边缘设备 |
| MiniCPM4.1-8B | 8B | 原生稀疏注意力,百万词元上下文 | 长文本处理 |
| MiniCPM3-4B | 4B | 超越同尺寸,接近 7B-9B 模型 | 通用对话 |
| MiniCPM-SALA | 可变 | 稀疏+线性混合注意力 | 超长上下文 |
| MiniCPM-MoE-8x2B | 8x2B | 专家混合架构 | 高性能推理 |
2. 双模式推理(enable_thinking)
MiniCPM5 内置 <think> chat template,通过 enable_thinking 开关在「快速助手」和「深度推理」两种模式间切换。关闭思考模式时响应快、适合简单问答;开启思考模式后模型会像人类一样先想再答,适合复杂逻辑和数学问题。
3. 丰富的部署选项
仓库提供 8 种部署 Agent Skills,每种都有对应的 cookbook 和脚本:

图3:MiniCPM5 训练流程(RL + OPD 两阶段)
4. 微调生态
finetune/ 目录下提供完整的微调工具链:

图4:RL + OPD 带来的效果提升
| 模型版本 | 推荐 GPU | 最低 VRAM | 量化版本 VRAM |
|---|---|---|---|
| MiniCPM5-1B BF16 | RTX 3090 / A10G | 8GB | 2GB(GGUF Q4) |
| MiniCPM4.1-8B BF16 | A100 40G | 20GB | 6GB(GGUF Q4) |
| MiniCPM3-4B BF16 | RTX 4090 | 12GB | 4GB(GGUF Q4) |
对于只是想体验的用户,可以直接在 HuggingFace Spaces 上在线体验,无需任何硬件。
MiniCPM 的持续迭代反映了一个明确趋势:端侧 AI 正在从「能用」向「好用」跃迁。
MiniCPM5-1B 的同尺寸 SOTA 成绩(平均分 42.57 vs 竞品最高 35.61)说明,小模型的性能天花板仍在持续被推高。配合 GGUF 量化技术,单消费级显卡(RTX 4060 Ti 16GB)完全能运行目前最高效的 MiniCPM 版本。
OpenBMB 团队还同步维护了 MiniCPM-V(多模态版本,支持图片理解)、UltraData(超大规模预训练数据)等配套项目,形成了从数据到模型到推理的全栈生态。
方法一:Transformers(推荐新手)
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
'openbmb/MiniCPM5-1B',
trust_remote_code=True
)
tokenizer = AutoTokenizer.from_pretrained('openbmb/MiniCPM5-1B')
messages = [{'role': 'user', 'content': '你好,介绍一下你自己'}]
inputs = tokenizer.apply_chat_template(
messages, tokenize=True, add_generation_prompt=True, return_tensors='pt'
)
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0]))
方法二:Ollama(一键本地部署)
ollama run openbmb/minicpm5-1b
方法三:在线体验 HuggingFace Spaces Demo
本报告基于 GitHub 公开信息生成,分析时间:2026-05-29。数据来源:OpenBMB/MiniCPM 官方仓库(Apache-2.0)。图片版权归属 OpenBMB 团队。