ml-fastvlm
苹果 CVPR 2025 开源项目,通过 FastViTHD 混合视觉编码器实现 85 倍推理加速,
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
苹果 CVPR 2025 开源项目,通过 FastViTHD 混合视觉编码器实现 85 倍推理加速,
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你对着一张 4K 高清图片问 AI「这张图里有什么?」——等待了整整 5 秒才得到回答。大多数人可能以为是大语言模型「思考」慢,但实际上,超过 80% 的延迟来自视觉编码器把图片转成 token 的过程,而非语言模型推理。
2025 年 6 月,苹果机器学习团队在 CVPR(计算机视觉顶级会议)上发表了一篇论文,提出了一个大胆的问题:能不能在几乎不损失精度的情况下,把视觉编码速度提升几十倍? 答案就是 FastVLM——一个专为视觉语言模型设计的高效视觉编码器。它的最小版本比 LLaVA-OneVision-0.5B 快 85 倍,却能达到相近甚至更好的准确率。

图1:FastVLM 在不同模型规模下的精度-延迟权衡曲线(来源:FastVLM 论文)
FastVLM 由苹果机器学习团队(Apple ML Research)开发,是 CVPR 2025 论文 "FastVLM: Efficient Vision Encoding for Vision Language Models" 的官方开源实现。核心创新是 FastViTHD(Fast Vision Transformer Hybrid Decoder)——一种专为高分辨率图片设计的混合视觉编码器,通过大幅削减 token 数量同时保持甚至超越原有精度。
项目基于 LLaVA(Large Language and Vision Assistant)代码库进行训练和推理,并针对 Apple Silicon(Mac/iPhone/iPad)做了专门优化,提供了 CoreML/MLX 格式的导出工具。
图2:FastVLM 在图像计数任务上的表现
图3:FastVLM 识别手写内容的能力
图4:FastVLM 理解 Emoji 和复杂视觉内容
可以把传统视觉编码器想象成一个「慢动作摄像机」——它把画面逐帧扫描得非常仔细,但输出了一大堆数据,处理起来很慢。FastViTHD 则像是一个「智能快拍相机」:它只关注画面中最关键的信息,输出精简但精准的特征描述,处理速度大幅提升。打个更具体的比方:传统方案是让 AI 先用「放大镜」仔细看完整张图;FastVLM 则是先「扫一眼」全局,直接抓住重点——速度自然快得多。
1. 高效视觉编码:支持 0.5B、1.5B、7B 三种规模,全部基于 Qwen2 大语言模型,提供 PyTorch 官方权重和 Apple Silicon 优化版本(INT8/INT4 量化)。
2. 极致推理速度:FastVLM-0.5B 比 LLaVA-OneVision 快 85 倍;FastVLM-7B 相比 Cambrian-1-8B 快 7.9 倍,同时精度相当甚至更优。
3. Apple 设备原生推理:通过 MLX 在 Mac 上高效运行,提供 iOS App 演示程序,支持 CoreML 模型导出,兼容苹果设备端 AI 生态。
4. 简洁推理接口:
python predict.py --model-path /path/to/checkpoint --image-file image.png --prompt "Describe the image."
FastViTHD 采用混合视觉编码器架构,结合 CNN 的局部特征提取能力和 Vision Transformer(ViT)的全局建模能力。关键创新包括:渐进式 token 生成(根据内容复杂度动态调整 token 数量)、量化感知训练(INT8/INT4 压缩)、固定 LLM 专注优化视觉编码器的训练策略。代码库结构清晰:llava/ 核心模型、app/ iOS 部署、model_export/ 格式转换、docs/ 演示图表。
1. 仅支持英文:训练数据以英文为主,多语言泛化能力有限。 2. 精度取舍:在细粒度视觉任务(微小物体检测)上与全量编码器仍有差距。 3. 生态锁定:Apple Silicon 优化突出,但 NVIDIA CUDA 优化不如竞品成熟。 4. 无生产级部署:未提供 Docker 或 Kubernetes 配置,企业需自行工程化。
FastVLM 代表了多模态 AI 的重要趋势:从「越来越大的模型」转向「越来越快的推理」。苹果通过开源 FastVLM,既展示了 ML 研究实力,也为 Apple Intelligence 生态提供技术储备——未来的 iOS/macOS 系统级 AI 助手,将大量受益于这类高效视觉编码技术。