minimind-v
仅需3元和2小时,从零训练一个65M参数的视觉多模态大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
仅需3元和2小时,从零训练一个65M参数的视觉多模态大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你想让 AI 学会「看图说话」,传统方案需要调用 OpenAI GPT-4V 或 Google Gemini,调用一次费用可能超过一顿午饭钱。但如果你能自己在本地,用不到一张 RTX 3090 显卡,在喝完一杯咖啡的时间里,训练出一个真正能「看懂图片并对话」的模型——这就是 MiniMind-V 所做的事。
2024 年 10 月,国内独立开发者 龚景元(GitHub @jingyaogong)在 GitHub 发布了 MiniMind-V 项目,首次提出一个大胆的实验:用最少的算力、最低的成本,从零开始训练一个完整的多模态视觉语言模型(Vision Language Model,VLM)。项目一经发布便引发社区热议,如今已斩获 8,000+ Stars,成为开源 VLM 领域的标杆项目之一。
GPT-3 有 1750 亿参数,而 MiniMind-V 的最小版本仅 65M(0.065B)参数,是 GPT-3 的约 1/2600。这种极致的小型化并非噱头——它让研究者和学生无需昂贵算力,在个人 GPU 上就能完成完整的训练、微调和推理全流程,真正实现「大模型面前人人平等」。
MiniMind-V 的架构设计清晰明了,整体由三大核心模块组成:
1. 视觉编码器(Vision Encoder) 最新版本(2026年4月)采用的是 Google 提出的 SigLIP2(siglip2-base-p16-256-ve) 视觉编码器。图像输入后被 resize 到 256×256 分辨率,经过编码器提取为固定长度的视觉特征序列。SigLIP 系列以优秀的零样本分类能力和高效的视觉表示著称,是 CLIP 的强力继任者。
2. 投影模块(Projector) 视觉编码器输出的特征维度(768)与语言模型的 embedding 维度对齐,通过一个轻量级 MLP 投影层将视觉 token 序列映射到 LLM 的输入空间。与早期版本使用的 QFormer 相比,MLP 投影更为简洁高效,减少了约 60% 的中间参数量。
3. 语言模型基座(MiniMind LLM) 语言模型基座基于 MiniMind 系列纯语言模型,延续其精简的 Transformer 架构设计,默认配置为 8 层 hidden_size=768 的小型 Transformer,支持标准因果语言建模(CLM)训练。

图1:MiniMind-V 整体架构(左侧为视觉编码器,中间为投影模块,右侧为语言模型)
项目同时支持 MoE(混合专家)架构变体 minimind-3v-moe,通过稀疏激活机制在保持高质量的同时进一步降低推理计算量。

图2:MoE 变体的混合专家架构
MiniMind-V 的训练分为两个阶段,与业界标准 LLM 训练流程高度一致:
Pretrain 阶段(预训练) 使用海量图文对数据训练 projector 和 LLM 的基础语言能力。最新版本基于 ALLaVA-4V 数据集,其中预训练阶段使用约 127 万条图文数据。训练时视觉编码器保持冻结(freeze),仅更新 projector 和 LLM 参数,大幅降低算力需求。
SFT 阶段(监督微调)
在预训练模型基础上,使用约 290 万条高质量指令数据微调,使模型具备指令跟随和对话能力。SFT 阶段使用 freeze_llm=1(解冻首末两层)策略,在保持泛化能力的同时注入对话技能。

图3:Pretrain 阶段 Loss 收敛曲线(可以看到模型在数十万步后趋于稳定)

图4:SFT 阶段 Loss 曲线
根据项目作者的实测数据,使用单张 RTX 3090(24GB),SFT 阶段 1 个 epoch 约需 2 小时,GPU 租用成本约 3 元人民币。这一数据打破了「大模型训练必须烧钱」的传统认知。
本地推理(推荐有GPU的用户)
项目提供了 Gradio WebUI(scripts/web_demo_vlm.py),支持动态扫描本地模型目录、通过下拉菜单切换不同模型版本。上传图片后,模型会输出图像描述或回答相关问题,支持流式输出(逐字生成)。
本地启动方式(假设已下载模型权重):
cd scripts
python web_demo_vlm.py --model_path ../model/minimind-3v
依赖通过 pip install -r requirements.txt 一键安装,主要依赖包括 transformers>=4.57.6、gradio>=5.49.1、streamlit>=1.50.0、peft>=0.7.1 等。
ModelScope 在线体验(零部署) 项目在阿里云 ModelScope 平台提供了在线 Demo 地址: https://www.modelscope.cn/studios/gongjy/MiniMind-V 无需任何配置,直接在浏览器中上传图片并与模型对话,适合没有本地 GPU 的用户尝鲜。

图5:minimind-3v 在线体验界面(支持图片上传和多轮对话)
尽管 MiniMind-V 在轻量化上做得极为出色,但也存在明显的局限:
性能天花板有限:65M 参数的模型在复杂视觉推理任务上无法与 GPT-4V 等百亿参数模型相提并论。它更适合作为学习多模态系统的教学工具,或在边缘设备上做轻量级视觉问答。
依赖外部视觉编码器:SigLIP2 视觉编码器权重需要额外下载(约 300MB),首次运行时需从 HuggingFace 获取,增加了环境配置的复杂度。
纯 Python 脚本部署:项目没有提供 Docker 容器化方案,在非 Linux/macOS 环境(如 Windows)上安装 CUDA + Python 依赖链可能遇到兼容性问题。
数据依赖:高质量图文数据的准备是训练效果的关键,ALLaVA-4V 数据集的下载和预处理需要额外时间和存储空间。
MiniMind-V 的出现代表了开源 AI 社区一个重要趋势:大模型的民主化。通过将复杂的 VLM 训练流程压缩到可复现的粒度,它让更多研究者、教育者和学生能够:
截至 2026 年 4 月,MiniMind-V 系列已发布 6 个模型版本(从 26M 到 200M 参数),配套的 MiniMind 纯语言基座也持续迭代,形成了完整的开源多模态模型生态系统。