Skywork-R1V
首个开源视觉链式思维多模态推理模型,GRPO 强化学习驱动,在多项基准上逼近 GPT-4V
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个开源视觉链式思维多模态推理模型,GRPO 强化学习驱动,在多项基准上逼近 GPT-4V
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
试想这样一个场景:化学家把一张手绘的反应机理图拍下来,丢给一个 AI 模型,问它「这个反应为什么能发生」。传统的图像识别模型可能只会描述图中有什么基团,而一个真正理解视觉信息的多模态模型,则需要像人类一样,边「看」边「思考」,把视觉输入和逻辑推理串联起来。
Skywork-R1V 就是这样一个模型。它由深度求索(DeepSeek)系团队 Skywork AI 开发,是首个在开源社区公开权重、具有视觉链式思维(Visual Chain-of-Thought)能力的多模态推理模型系列。它不仅「看得见」图像,更能「想明白」图像中蕴含的逻辑关系,在多项权威多模态基准测试中逼近甚至超越 GPT-4V 等闭源巨头。

图1:Skywork-R1V 系列模型架构概览
Skywork AI 并非无名之辈。该团队此前在文本推理模型领域有深厚积累,尤其以 DeepSeek-R1 系列闻名——也就是那个在 2025 年初引发 AI 社区地震的开源推理模型,它首次证明了纯强化学习可以让大语言模型「顿悟」复杂推理任务。
在文本推理趋于成熟后,Skywork AI 将目光投向了一个更具挑战性的方向:视觉-语言联合推理。核心问题是:如何让模型在看图时也展现出类似文本 CoT(Chain-of-Thought)的深度思考能力?答案是设计一套视觉链式思维机制——模型在生成最终答案之前,会先输出中间推理步骤,把「看到」的信息转化为「逻辑链」,从而做出更可靠的判断。
从 2025 年 3 月发布初代 R1V 以来,该团队以几乎每月一个大版本的速度迭代:R1V2(4月)、R1V3(7月)、R1V4-Lite(11月),每次更新都在基准测试上刷新开源多模态模型的 SOTA 纪录。这种高频迭代节奏在开源社区极为罕见。
传统的多模态模型(如 LLaVA、MiniGPT-4)通常采用「图像编码器 → 投影层 → LLM」的串联架构,在接收图像后直接输出答案。这种「端到端」的范式缺乏中间推理过程,导致模型在面对需要多步推理的复杂图像时表现欠佳。
Skywork-R1V 的核心创新在于引入了视觉链式思维机制。当模型处理一张图像时,它会先输出一个「视觉思考」片段,描述图像中的关键元素、元素间的关系、以及由此推导出的假设,然后再给出最终答案。这个过程模仿了人类看图思考的方式——先观察、再分析、最后判断。

图2:多模态推理示例——模型对开放街道地图进行多步空间推理
R1V 系列之所以能在推理能力上快速超越竞品,关键在于训练方法。Skywork AI 将 DeepSeek-R1 中验证成功的 GRPO(Group Relative Policy Optimization) 算法迁移到多模态训练中。
GRPO 的核心思想是:不再依赖人工标注的思维链数据,而是让模型自行生成多条候选推理路径,通过对比这些路径的最终答案质量来更新策略网络。这种方式极大降低了对标注数据的依赖,同时让模型学会了探索多种推理可能性。在文本领域,GRPO 已经被证明能让模型「顿悟」——即在训练过程中突然涌现出此前没有的复杂推理能力。R1V 的成功表明,GRPO 在多模态领域同样有效。

图3:开源与闭源多模态模型基准测试对比
Skywork-R1V 系列经历了清晰的演进路径:

图4:Skywork-R1V3 在多项权威多模态基准上的评测得分
R1V4-Lite 提供标准 OpenAI 兼容 API,最快上手:
import requests
import base64
def image_to_base64(path):
with open(path, "rb") as f:
return base64.b64encode(f.read()).decode("utf-8")
response = requests.post(
"https://api.skyworkmodel.ai/v1/chat/completions",
headers={"Authorization": "Bearer YOUR_API_KEY"},
json={
"model": "skywork/r1v4-lite",
"messages": [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64," + image_to_base64("photo.jpg")}},
{"type": "text", "text": "这张图中的人数是多少?"}
]
}],
"stream": False
}
)
print(response.json()["choices"][0]["message"]["content"])
API 方式无需 GPU,按调用计费,适合快速集成到现有应用。
对于需要完全自托管的用户,R1V3-38B 的开源权重在 HuggingFace 上可用,提供两种本地推理方案:
方案一:Transformers(兼容性最好)
pip install transformers torch Pillow
python inference/inference_with_transformers.py
方案二:vLLM(吞吐量最高)
pip install vllm
python inference/inference_with_vllm.py
本地推理需要 30GB 以上 VRAM 的 GPU(推荐 A100/H100)。如果使用 AWQ 量化版,RTX 4090(24GB)或专业级单卡亦可运行,但性能会有所下降。

图5:开源与闭源前沿模型在各基准上的全面对比
对于需要批量处理图文任务的用户,R1V4 提供了完整的测试工具集:
batch_nonstream.py:非流式批量推理,处理 JSONL 格式的测试用例batch_stream.py:流式输出模式,适合需要实时反馈的场景batch_planner_*.py:使用 planner 模型进行任务规划后的批量推理visual.py:Web 可视化界面,查看推理过程和中间思考步骤这些工具对于研究团队评估模型性能、构建测试集尤为实用。

图6:模型在规划类多模态任务上的推理轨迹可视化
R1V 系列的核心竞争力在于 benchmark 成绩。在 30B 参数级别中,R1V4 几乎全面领先:
| 基准 | R1V4-30B | Qwen3-VL-30B | Gemini 2.5 Flash | 说明 |
|---|---|---|---|---|
| HIRbench-4K FSP | 91.8 | 88.5 | 81.5 | 高分辨率图像理解 |
| MME-Real 综合 | 71.4 | 67.7 | 60.9 | 真实场景感知 |
| V* 综合 | 88.0 | 82.2 | 72.3 | 视觉属性+空间推理 |
| MMSearch | 66.1 | 18.7 | 64.9 | 深度研究+搜索 |
最值得关注的是 HIRbench-4K(91.8分) 和 MMSearch(66.1分) 两项。前者说明 R1V4 在高分辨率图像理解上具有显著优势;后者则揭示了模型的「深度研究」能力——它可以调用搜索工具,结合视觉信息和外部知识源进行多跳推理,这在开源多模态模型中非常罕见。
相比同为 30B 级别的 Qwen3-VL-30B,R1V4 在几乎所有测试维度上均有领先,尤其在视觉空间推理(V* Spatial: 84.2 vs 82.9)和深度研究(MMSearch: 66.1 vs 18.7)上优势明显。与更大的 Qwen3-VL-235B(量化后 A22B)相比,R1V4-30B 在感知类任务上基本持平甚至更优,体现出更高的参数效率。
R1V3-38B 的全精度版本需要 76GB+ 显存,即使 AWQ 量化版也需要 30GB+ VRAM。这意味着大多数个人开发者无法在消费级 GPU(如 RTX 3090/4090 24GB)上运行全功能版本。GGUF 4-bit 量化可以降到 CPU 运行,但推理速度会显著下降,实用性受限。
R1V4-Lite 支持搜索工具集成,但这是一项较新的能力,在复杂的多步工具调用场景中,稳定性尚未得到充分验证。开源社区对 Agent 能力的期待是「达到 GPT-4 水平」,R1V4 目前还有差距。
相比 Qwen、LLaMA 等已经形成丰富生态的模型,Skywork-R1V 的社区资源(微调示例、第三方工具集成、垂直领域适配)还相对较少。文档以英文为主,对中文用户存在一定门槛。
Skywork-R1V 的意义不仅在于它是一个「性能出色的开源模型」,更在于它验证了 GRPO 强化学习在多模态推理领域的普适性。此前,GRPO 被认为主要适用于纯文本推理任务,而 R1V 系列的成功表明,通过适当的多模态架构设计,强化学习同样可以驱动视觉-语言联合推理能力的涌现。
从趋势看,Skywork AI 正在从「开源模型开发商」向「开源+API 服务双轨并行」转型。R1V4-Lite 的发布表明,团队的商业化路径与 Meta 的 Llama 系列有相似之处:先开源基础版本建立影响力,再通过云服务变现。
对于 AI 开发者和爱好者而言,Skywork-R1V 提供了一个不可多得的实践平台:在 HuggingFace 上可以直接下载权重,在 GitHub 上有完整的推理代码和测试工具,甚至可以用 R1V4-Lite API 零成本体验最强开源多模态模型的推理能力。无论你是研究多模态推理机理,还是构建视觉问答、图表理解、深度研究类应用,Skywork-R1V 都值得纳入技术选型的视野。
本报告基于 GitHub 仓库(SkyworkAI/Skywork-R1V)公开信息生成,截至 2026 年 1 月。