VLM-R1
将 DeepSeek-R1 的 GRPO 强化学习引入视觉语言模型,让 VLM 在图像理解任务中自主
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将 DeepSeek-R1 的 GRPO 强化学习引入视觉语言模型,让 VLM 在图像理解任务中自主
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你给 AI 看一张照片,问它「图里那只猫在哪里」,它不仅能准确指出位置,还能像人类一样一步步推理——「我看到一只猫在沙发扶手上,背景是暖色调的客厅,这只猫正侧卧着……」这就是 VLM-R1 正在做的事情。
2025 年 1 月,DeepSeek 发布的 R1 模型在纯文本领域掀起了轩然大波。它没有依赖大量人工标注数据,而是通过强化学习(GRPO 算法)让模型自己学会「思考」,显著超越了传统的 SFT(监督微调)路线。这条路能否复制到视觉理解任务上?
VLM-R1 正是对这个问题的系统性回答。由 Om AI Lab 团队开发,GitHub 收获了近 6000 颗星。核心技术思路是:将 DeepSeek-R1 的 GRPO 强化学习训练框架,嫁接到 Qwen2.5-VL 等视觉语言模型上,让模型在图像理解任务中也能自主涌现出推理能力。
图1:VLM-R1 在多个任务上的性能表现。在 Open-Compass 多模态推理榜单上,VLM-R1 Math 模型在 4B 参数以下模型中排名第一。
VLM-R1 并不是一个单一功能的模型,而是一套完整的视觉语言模型强化学习训练框架。当前支持三种核心任务:
1. Referring Expression Comprehension(REC,指称表达理解)
给定一张图片和一句自然语言描述(如「左边的红色汽车」),模型需要准确框出对应的目标区域。VLM-R1 在这项任务上的表现超越了传统 SFT 路线,尤其在跨域泛化测试中优势明显——即便面对训练时从未见过的场景,RL 训练出的模型依然能保持稳定的推理能力。
图2:SFT 模型与 GRPO 模型在域内和域外数据上的表现对比。随着训练步数增加,SFT 在域外数据上出现性能退化,而 GRPO 始终保持稳定提升。
2. Open-Vocabulary Detection(OVD,开放词汇检测)
模型需要检测图片中任意类别的目标。相比传统目标检测,OVD 允许用自然语言描述从未在训练集中出现过的类别。VLM-R1-OVD 在 OVDEval 基准上达到了 SOTA(最优表现),击败了专门的检测模型和 SFT 基线。
3. 多模态数学推理
让视觉语言模型处理含图片的数学问题。VLM-R1 Math 基于 Qwen2.5-VL-3B 微调,在 OpenCompass 多模态推理榜单(4B 以下参数组)取得第一名。
VLM-R1 的技术核心是 GRPO(Group Relative Policy Optimization)——一种改进版的 PPO 强化学习算法。与传统 RL 的单一基准不同,GRPO 在每个训练步骤中为一个问题生成多组回答样本,用组内相对排序来计算优势函数,大幅降低了训练成本。
整体训练流程:
图3:VLM-R1 在不同 IoU 阈值下的 REC 准确率。在严格 IoU 阈值(0.75)下,GRPO 训练的模型依然保持较高精度。
代码架构上,项目 fork 了 HuggingFace 的 Open-R1,并对其 GRPO 实现进行了多模态改造:
grpo_jsonl.py:统一的数据加载和训练入口,支持多数据源混排vlm_modules/qwen_module.py / internvl_module.py:不同 VLM 的统一接口封装,支持自定义奖励函数注入run_scripts/:即开即用的训练脚本,覆盖 REC、OVD、GUI 多图等多种任务Dockerfile 基于 pytorch/pytorch:2.5.1-cuda12.4-cudnn9-devel 镜像,预装了 Flash Attention、wandb、transformers(最新版)等依赖。
VLM-R1 的定位是训练框架,不是开箱即用的推理服务,这对部署方式有直接限制:
| 维度 | 评估 |
|---|---|
| Web UI | ❌ 无,纯命令行工具 |
| 快速部署 | ❌ 不支持,依赖多卡分布式训练 |
| 硬件要求 | 必须 NVIDIA GPU,8 卡 A100/H100(推荐),至少 24GB 显存/卡 |
| 数据依赖 | 需自行下载 COCO 图片集 + RefCOCO+/g 标注文件 |
| 部署难度 | 困难(4/5),适合有分布式训练经验的团队 |
| 预估时间 | 数小时(环境配置 + 数据下载 + 训练调参) |
此外,团队已支持华为昇腾 Atlas 800T A2 和 Atlas 300I Duo 的推理适配,通过 vllm-ascend 和 xllm 框架实现,突破了 NVIDIA 生态限制。
src/eval/)与训练模块分离,需单独配置VLM-R1 的出现填补了一个关键空白:此前 R1 范式的成功主要体现在纯文本推理(数学、代码),而视觉领域的 RL 训练缺乏统一、稳定的开源实现。VLM-R1 提供了一个经过验证的训练框架,证明强化学习同样可以帮助视觉语言模型在指称理解、目标检测等任务上实现泛化能力的跃升。
作者团队 SZHanZ 等人在 2025 年 4 月发布了技术报告(arXiv:2504.07615),详细阐述了 GRPO 在多模态场景下的训练细节与消融实验结果,为后续研究提供了可复现的基线。
对于希望将「会思考的 AI」扩展到视觉领域的团队而言,VLM-R1 是目前最完整、最活跃的开源实现之一。