MoE-LLaVA
北京大学开源的 MoE-VLM 架构,通过稀疏专家路由在保持模型容量的同时大幅降低激活计算量,发表至
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
北京大学开源的 MoE-VLM 架构,通过稀疏专家路由在保持模型容量的同时大幅降低激活计算量,发表至
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是一家顶级餐厅的主厨,面对上百道菜谱,每道菜只用其中几页——但你并不需要翻遍所有菜谱,而是精准知道哪几页最相关,按需调取。这正是 MoE-LLaVA 的核心思想:让视觉-语言大模型学会"按需取材",只激活真正需要的专家模块,而非每次都调动整个模型。
2023-2024 年,以 LLaVA 为代表的视觉-语言模型(VLM)在图文理解、视觉问答等任务上取得突破。但随着模型规模越来越大,问题也随之而来:一张图片进来,整个模型全部激活——哪怕图片只涉及简单的"是/否"问题。计算成本高、推理速度慢、显存占用大,部署到实际应用中困难重重。
北京大学 YuanGroup 团队敏锐地捕捉到了这个痛点。2024 年 1 月,他们在 arXiv 发表论文《MoE-LLaVA: Mixture of Experts for Large Vision-Language Models》,首次将混合专家架构(Mixture of Experts, MoE)引入大型视觉-语言模型。2025 年,这项工作正式被 IEEE Transactions on Multimedia(TMM)接收——这是多媒体领域顶级期刊,含金量极高。
MoE-LLaVA 的架构创新在于引入了 MoE Router(路由专家)。传统的 VLM 只有一个 vision encoder 加一个 LLM,所有输入都走同一路径。而 MoE-LLaVA 在 LLM 层引入了多个并行的"专家"(Expert)MLP 模块,输入 token 根据内容被路由到最相关的专家——只有少数专家被激活,其余保持沉默。
这种设计的精妙之处在于:模型的总参数量没有减少(保留了"知识容量"),但每次前向传播的激活参数量大幅下降——理论上可以在不损失性能的前提下将计算量降至原来的 1/N。
项目支持的底层 LLM 非常广泛,代码库中对应文件包括:
llava_llama.py / llava_llama_moe.py — Meta LLaMA 系列llava_qwen.py / llava_qwen_moe.py — 阿里通义千问llava_phi.py / llava_phi_moe.py — 微软 Phi 系列llava_mistral_moe.py — Mistral AI 模型llava_minicpm_moe.py — 望曦 MiniCPMllava_stablelm_moe.py — Stability AI StableLM支持的多模态编码器包括 CLIP 和 SigLIP,多模态投影器支持 MLP、Q-Former(受 BLIP-2 启发)和池化块三种方案。
MoE-LLaVA 的训练分为三个阶段:
阶段一:多模态预训练(MMIT)
冻结 LLM 和 Vision Encoder,仅训练 Projector 和新增的 MoE Router。使用 pretrain.sh 脚本,典型配置使用 DeepSpeed ZeRO-3 分布式策略,配合梯度 checkpointing 来节省显存。
阶段二:指令微调(SFT)
解冻 LLM 的部分或全部参数。finetune.sh / finetune_qlora.sh / finetune_lora.sh 分别对应全参数、QLoRA 和 LoRA 三种微调方案,满足不同硬件条件的用户需求。
阶段三:下游任务评估
eval/ 目录下包含完整的评测脚本,覆盖 GQA、VQAv2、POPE、ScienceQA、TextVQA、MMbench 等多个视觉问答基准,还有一套基于 GPT-4 的开放式评估框架,用于生成式视觉问答的质量评估。
HuggingFace Spaces(最简方案):访问 LanguageBind/MoE-LLaVA Space,直接在浏览器中上传图片并提问,无需任何本地部署。
Replicate API:通过 camenduru/moe-llava 的云 API 调用模型,适合集成到生产流程中,按调用量付费。
本地部署(开发者方案):moellava/serve/ 目录下提供了完整的 Gradio Web UI 服务框架,包含 controller、model_worker 和 gradio_web_server 三层架构,支持多卡并发推理。需准备 HuggingFace 模型权重,下载后修改 predict.py 中的 model_path 即可运行。
MoE-LLaVA 的价值不仅在于技术本身,更在于它引领的"稀疏化多模态"研究方向。2024 年下半年,Google 的 Gemini 1.5、OpenAI 的 GPT-4o 等主流多模态模型相继引入 MoE 架构,证明了这套思路的普适性。MoE-LLaVA 作为最早开源的 MoE-VLM 之一,为社区提供了一个高质量的研究基座和工程参考。它代表了多模态 AI 从"暴力扩展"走向"智能计算"的关键转折。
适用场景总结:研究多模态大模型效率优化选 MoE-LLaVA;快速体验多模态图文理解用 HuggingFace Spaces;自有数据微调请准备充足的多卡 GPU。