MiniCPM-V
OpenBMB/MiniCPM-V加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

你站在菜市场里,面前是一堆从没见过的热带水果。你掏出手机,对准一串外形奇特的果子拍了一张照片。几秒后,屏幕上跳出一行字:"这是蜜汁金橘,来自越南,酸甜可口,常用来做蜜饯。"整个过程没有网络请求,没有数据上传,模型跑在你手机本地——这就是 MiniCPM-V 正在做的事。
这不只是极客的玩具。面壁智能(OpenBMB)联合清华大学,从 2024 年 2 月起持续迭代 MiniCPM-V 系列,目标是让多模态大模型真正走进普通人的口袋。2026 年 5 月发布的 MiniCPM-V 4.6,参数量仅 1.3B(约 13 亿参数),在手机端仅需约 6GB 内存即可流畅运行,性能却能超越更大规模的模型。
MiniCPM-V 的背后,是面壁智能和清华大学 NLP 实验室多年在大模型高效推理方向的技术积累。团队的核心思路很明确:与其追求更大的参数规模,不如让更小的模型发挥更大的价值。
1.3B 是什么概念?对比一下:GPT-4V 拥有约 1.8 万亿参数,MiniCPM-V 4.6 是它的万分之一。但它采用了三项关键优化技术:
第一,LLaVA-UHD v4 视觉早期压缩。 传统多模态模型在处理图像时,先将图片编码为大量视觉 token(可能数千个),再送给 LLM 处理——这意味着大量计算浪费在视觉编码上。MiniCPM-V 4.6 提出了"ViT 内提前压缩"技术,在视觉编码器内部就完成 token 压缩,将视觉编码计算开销降低 50% 以上。
第二,4x/16x 混合视觉 token 压缩率。 图像信息密集的场景用 4x 压缩保留更多细节,背景图等低信息密度场景自动切到 16x 压缩大幅提速,用户也可手动切换。这是业界首次在端侧模型中支持动态混合压缩率。
第三,SigLIP2-400M 视觉编码器。 团队选择了一个轻量但高效的视觉编码器(仅 4 亿参数),配合 Qwen3.5-0.8B 作为 LLM 基座,实现了性能和效率的平衡。模型还支持 GGUF(Q4_K_M 量化约 1.6GB)、BNB int4、AWQ、GPTQ 等多种量化格式,进一步压缩体积。
在 Artificial Analysis Intelligence Index 评测中,MiniCPM-V 4.6 得分 13 分,超越了 Qwen3.5-0.8B(10 分)、Qwen3.5-0.8B-Thinking(11 分)和 Ministral 3B(11 分)。Token 消耗仅为 Qwen3.5-0.8B 的 1/19,比 Qwen3.5-0.8B-Thinking 少了 43 倍。这意味着在手机有限的算力下,它不仅能跑,而且跑得高效。
在 OpenCompass、RefCOCO、HallusionBench、MUIRBench、OCRBench 等多个视觉语言基准测试中,MiniCPM-V 4.6 达到了 Qwen3.5-2B 级别的视觉理解能力——而它的 LLM 基座只有 0.8B 参数。
对于开发者而言,MiniCPM-V 的上手成本极低:
from transformers import AutoModelForImageTextToText, AutoProcessor
model_id = "openbmb/MiniCPM-V-4.6"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(model_id, torch_dtype="auto", device_map="auto")
# 单图理解
messages = [{"role": "user", "content": [
{"type": "image", "url": "https://example.com/demo.jpg"},
{"type": "text", "text": "这张图片里有什么?"}
]}]
inputs = processor.apply_chat_template(messages, return_dict=True, return_tensors="pt", downsample_mode="16x").to(model.device)
generated_ids = model.generate(**inputs, downsample_mode="16x", max_new_tokens=512)
output = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(output[0])
进阶推理框架也一一支持:vLLM(高并发推理)、SGLang(自定义 pipeline)、llama.cpp(纯 CPU/GPU 推理)、Ollama(一行命令运行)。LLaMA-Factory 和 SWIFT 也提供了微调支持,让企业可以针对自己的业务场景做定制。
对于普通用户,MiniCPM-V 同样提供了开箱即用的手机端体验。项目方维护了一个独立的 MiniCPM-V-Apps 仓库,同时提供:
三端 App 均通过 llama.cpp-omni 实现模型本地运行,所有推理在设备上完成,无网络请求,用户数据永不离开手机。这是 MiniCPM-V 与其他"手机端 AI 助手"的本质区别——后者往往需要云端算力,而 MiniCPM-V 是真正的端侧部署。
此外,HuggingFace 提供了在线 Demo,无需注册即可体验 MiniCPM-V 4.6 的图像理解能力。modelbest.cn 也提供了 OpenAI 兼容的云端 API(MiniCPM-V-4.6-1B、MiniCPM-V-4.6-Thinking 等多版本),适合不想自己部署服务器的用户。
除了 HuggingFace 在线版,仓库自带三个 Gradio Web Demo,支持不同硬件:
# NVIDIA GPU(推荐)
python web_demos/web_demo_2.6.py --device cuda
# Apple Silicon Mac(MPS 加速)
python web_demos/web_demo_2.6.py --device mps
# 纯 CPU(兼容所有设备,速度较慢)
python web_demos/web_demo_2.6.py --device cpu
支持单图、多图和视频理解,可直接在浏览器中体验实时交互。
MiniCPM-V 4.6 是一款针对高效端侧部署优化的模型,在以下场景存在局限:
推理能力有限。 作为 1.3B 的非推理模型,MiniCPM-V 4.6 在复杂推理任务上不如参数更大的模型。团队提供了 MiniCPM-V-4.6-Thinking 版本,在推理时引入 Chain-of-Thought,适合需要多步思考的场景,但速度会明显下降。
视频理解有帧数限制。 视频理解默认最多 128 帧,长视频需要调整 max_num_frames 参数并可能需要调整 stack_frames。
没有语音输出。 MiniCPM-V 4.6 仅支持图像和视频理解,不含语音合成能力。团队另外提供了 VoxCPM 系列做 TTS,MiniCPM-o 系列则支持端到端语音对话。
GPU 显存需求。 虽然手机端可以用量化版本跑满 6GB 内存,但如果你想在 NVIDIA GPU 上用 BF16 全精度跑,需要至少 4GB VRAM;用 int4/BNB 量化则可降至 3GB。
MiniCPM-V 4.6 是目前开源社区支持最全面的端侧多模态模型之一:
MiniCPM-V 4.6 的发布具有重要的行业意义。在它之前,端侧多模态模型要么体积太大(无法在手机上运行),要么体积小但性能差(几乎没有实用价值)。MiniCPM-V 4.6 第一次在 1.3B 参数规模上同时实现了"能跑"(6GB 内存)和"能看"(视觉理解接近 GPT-4V 水平)。
这意味着什么?对于移动应用开发者,MiniCPM-V 4.6 提供了将视觉 AI 能力内嵌到 App 里的可能性,无需依赖云端 API,既保护了用户隐私,又节省了服务器成本。对于智能硬件厂商,它提供了将多模态 AI 能力装进手表、眼镜、耳机等小内存设备的技术路径。对于 AI 研究者,MiniCPM-V 系列从 2024 年至今持续迭代,为"小模型高效视觉理解"这一方向提供了持续的高质量开源参考。
从 2024 年 GitHub Trending 霸榜,到 2025 年被 llama.cpp/vLLM/LLaMA-Factory 三大框架官方收录,再到 2026 年 4.6 版本全面支持 iOS/Android/鸿蒙三端,MiniCPM-V 已经成为端侧多模态 AI 的标杆开源项目。