LLaVA-Mini
将576个视觉Token压缩至1个,中科院开源的高效多模态模型,推理效率提升4倍
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将576个视觉Token压缩至1个,中科院开源的高效多模态模型,推理效率提升4倍
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
当你打开 GPT-4o,让它分析一张图片时,你或许没有意识到背后发生了什么——图片首先被切分成几百个小块(patch),每个 patch 转换为一个"视觉Token",然后这些 Token 和文字指令一起送入大语言模型(LLM)进行处理。LLaVA-v1.5 处理一张 224×224 的图片就需要 576 个视觉 Token,这意味着大量计算资源被消耗在处理这些视觉信息上,而 LLM 最终真正"看到"的,只是这些 Token 中的一小部分。
这就是多模态大模型的"视野税"(Vision Tax)——视觉理解能力越强,Token 消耗越多,计算成本越高。2025 年初,中国科学院计算技术研究所(ICT/CAS)的研究团队在 ICLR 2025 发表了一篇论文,提出了一个大胆的问题:能不能把 576 个 Token 压缩到 1 个,同时保持甚至超越原有的视觉理解能力?
这个问题的答案,就是 LLaVA-Mini。

图1:LLaVA-Mini 在 11 项图像理解和 7 项视频理解基准测试中,与 LLaVA-v1.5 性能对比。压缩率高达 99.83%,性能基本持平。
LLaVA-Mini 的创新点可以用一句话概括:在视觉信息进入 LLM 主干网络之前,就先把它们融合进文本 Token 中去。
研究团队首先对 LLaVA-v1.5 进行了深入的可解释性分析,发现了一个关键规律:视觉 Token 主要在 LLM 主干网络的早期层发挥作用——它们主要负责将视觉信息融合(fuse)到文本 Token 中。一旦融合完成,后续的深层网络其实主要在处理文本语义,视觉 Token 的独立信息量已经大幅降低。
基于这一发现,LLaVA-Mini 引入了一个核心创新:模态预融合模块(Modality Pre-Fusion)。这个模块由堆叠的 Transformer 块组成,在视觉信息进入 LLM 之前,就预先将压缩后的视觉 Token 与文本 Token Embedding 在同一空间进行融合。融合完成后,只保留 1 个视觉 Token(压缩率高达 99.83%),大大降低了 LLM 主干网络的计算负担。

图2:传统 LLaVA-v1.5 需要 576 个视觉 Token,而 LLaVA-Mini 将其压缩至仅 1 个 Token,实现 77% FLOPs 降低。
LLaVA-Mini 在 11 项图像理解基准测试和 7 项视频理解基准测试中,与 LLaVA-v1.5 进行了全面对比:
| 指标 | 传统方案 | LLaVA-Mini | 提升 |
|---|---|---|---|
| 视觉 Token 数 | 576 | 1 | 压缩 99.83% |
| FLOPs | 100% | 23% | 降低 77% |
| 响应延迟 | 100ms | 40ms | 降低 60% |
| VRAM 占用 | 360MB/图 | 0.6MB/图 | 降低 99.8% |
| 24GB GPU 可处理帧数 | 有限 | 10000+ | 质的飞跃 |
这意味着在相同硬件条件下,LLaVA-Mini 可以处理 10 倍以上的图像或视频帧数,真正实现了在保持视觉理解能力的同时大幅提升推理效率。
LLaVA-Mini 的代码仓库采用了成熟的项目结构,与原始 LLaVA 高度兼容,同时也包含了项目自研的 llavamini 模块:
llavamini/:项目核心实现,包含模型推理(serve)、评测(eval)和对话管理(conversation)。核心模型加载使用 load_pretrained_model() 函数,兼容 HuggingFace 生态,支持 4-bit / 8-bit 量化加载以降低显存需求。llava/:与原始 LLaVA 共享的基础组件(model、mm_utils、conversation 等),采用模块化设计,代码复用良好。llavamini/serve/:服务层实现,包含 Controller、Model Worker、Gradio Web UI、CLI 客户端,支持本地部署和远程调用。llavamini/eval/:评测模块,覆盖图像理解(VQA、ScienceQA、POPE)和视频理解(Benchmark 1-5、MLVU、MVBench)两大类评测任务。依赖生态以 PyTorch 2.1.2 + Transformers 4.43.1 为基础,量化推理借助 BitsAndBytes 4-bit 量化(NF4),加速推理支持 Accelerate 框架和 PEFT(LoRA 微调),前端展示基于 Gradio 5.9.1。

图3:LLaVA-Mini Gradio Web UI 演示,支持图像、视频输入和实时交互。
LLaVA-Mini 推荐使用 24GB+ VRAM 的 NVIDIA GPU(如 RTX 3090/4090、A100 等)。如果显存不足 20GB,可以使用 --load-8bit 启用 8-bit 量化模式降低显存占用。
项目提供了开箱即用的 Gradio Web UI:
# 克隆仓库并安装
git clone https://github.com/ictnlp/LLaVA-Mini.git
cd LLaVA-Mini
pip install -e .
# 启动 Web UI(自动启动 Controller、Model Worker 和 Gradio 界面)
bash webui.sh
# 图片理解
CUDA_VISIBLE_DEVICES=0 python llavamini/eval/run_llava_mini.py \
--model-path ICTNLP/llava-mini-llama-3.1-8b \
--image-file <图片路径> --query "描述这张图片"
# 视频理解(可处理 3 小时视频)
CUDA_VISIBLE_DEVICES=0 python llavamini/eval/run_llava_mini.py \
--model-path ICTNLP/llava-mini-llama-3.1-8b \
--video-file <视频路径> --query "视频中发生了什么"
对于没有 GPU 的用户,项目提供了 cog.yaml 配置文件,可直接部署到 Replicate 平台,在云端体验推理。

图4:LLaVA-Mini 典型应用案例。
LLaVA-Mini 的核心局限在于精度与效率的取舍边界。虽然论文声称在多项基准测试中与 LLaVA-v1.5 持平,但极端压缩(从 576 Token 到 1 Token)意味着对细节密集型任务(如密集 OCR、小目标检测、复杂图表理解)的性能损失尚需更多验证。此外,项目目前仅开源了 8B 参数版本,尚未提供更小规模的蒸馏版本。
LLaVA-Mini 的出现代表了多模态 AI 研究的一个重要方向:从"更大更强"转向"更小更精"。随着多模态模型在实时视频分析、智能座舱、机器人感知等场景的广泛应用,推理效率将成为制约落地的关键瓶颈。LLaVA-Mini 用 99.83% 的 Token 压缩率证明了一个重要观点——视觉 Token 不是越多越好,关键在于让每一个 Token 都发挥最大价值。
该项目由中科院计算所 NLP 团队开发,论文发表于 ICLR 2025,模型权重托管于 HuggingFace,为学术界和工业界提供了一个极具参考价值的多模态效率优化范式。
本报告基于 GitHub 仓库 v1.0 及 arXiv:2501.03895 论文编写,分析时间 2026-06-22。