Qwen3-VL
阿里开源最强多模态大模型,能「看懂」图片、视频、文档,并操控电脑和手机界面
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里开源最强多模态大模型,能「看懂」图片、视频、文档,并操控电脑和手机界面
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,一位放射科医生正在审阅肺部 CT 片。数千张切片中,一个微小的阴影若隐若现——用肉眼反复对比后,她仍然无法确定性质。传统 AI 模型需要大量标注数据训练,面对罕见病灶往往束手无策。但从 2025 年开始,她有了一个新的选择:将 CT 片交给 Qwen3-VL,模型不仅识别出病灶位置,还能结合上下文给出恶性概率评估。这不是科幻,而是 Qwen3-VL 开源后在全球医疗影像场景中真实发生的场景之一。
Qwen3-VL 是阿里云通义千问团队于 2025 年 9 月发布的多模态大语言模型系列,其旗舰版本 Qwen3-VL-235B-A22B 一经发布便引发社区热议,在 GitHub 迅速积累超过 19000 颗星,成为 2025 年最受关注的开源多模态模型之一。与前代 Qwen2-VL 相比,Qwen3-VL 在视觉理解、推理能力、视频处理、Agent 控制等维度实现了全面升级,被业界视为"最强大的通义视觉语言模型"。

图 1:Qwen3-VL 官方 Logo
阿里通义千问模型系列的发展轨迹,本身就是中国大模型发展的一个缩影。2023 年通义千问初代模型发布时,主要聚焦于纯文本理解和生成;此后 Qwen2 系列在 2024-2025 年初逐渐拓展到多模态,Qwen2.5-VL 首次在多个视觉基准上逼近闭源模型。但彼时的通义视觉模型,在视频理解、长上下文、Agent 能力等方面仍有明显短板。
Qwen3-VL 的出现,标志着通义团队正式将这些短板一一补齐。项目团队在 2025 年 9 月先发布了旗舰 235B 版本(MoE 架构,激活参数 22B),随后在 10 月密集发布了 2B、4B、8B、32B 等多个规模的密集(Dense)和 MoE 变体,以及专门针对推理优化的 Thinking 版本,形成了从边缘设备到云端超大规模的全谱系覆盖。截至 2025 年 11 月,Qwen3-VL 系列已在 Hugging Face 累计下载超过数百万次。
项目采用 Apache-2.0 开源许可证,模型权重托管于 Hugging Face 和 ModelScope,方便全球开发者使用和二次开发。
如果把纯语言模型比作一位"文字大师"——精通阅读和写作,但天生失明——那么多模态大模型就是这位大师被赋予了视觉能力,可以在看到一张图片、一段视频后,用自然语言与你讨论其中的内容。
Qwen3-VL 的核心能力,可以类比为以下几种场景:
换句话说,Qwen3-VL 不只是"能看图说话",而是真正理解了视觉信息的语义层次和空间关系,能够像人一样在视觉世界中进行推理和行动。

图 2:Qwen3-VL 核心架构示意图(来源:GitHub README)
Qwen3-VL 最令人眼前一亮的能力之一,是其 Visual Agent 功能。只需给模型一张手机或电脑的截图,它就能识别界面中的每一个 UI 元素(按钮、输入框、图片、列表项),理解其功能,并规划出一系列操作步骤来完成任务。
在仓库中提供的 cookbooks/computer_use.ipynb 和 cookbooks/mobile_agent.ipynb 两个 Cookbook 中,展示了具体的实现思路。模型首先对截图进行 UI 元素检测和功能识别,然后根据用户的自然语言指令(如"帮我订一张明天北京到上海的机票")拆解任务步骤,模拟人类的鼠标点击、输入等操作序列。这使得 Qwen3-VL 有潜力成为真正的 AI 操作系统助手。
Qwen3-VL 在模型架构上引入了两项关键创新:
Interleaved-MRoPE(多维旋转位置编码):将时间、宽度、高度三个维度的位置信息统一编码,使模型在处理长视频时能够精确地将视觉特征对应到具体的时间和空间位置。这解决了前代模型在视频时序理解上的根本性局限。
DeepStack(深层特征融合):将视觉编码器(ViT)的多层特征逐层融合,而非仅使用最后一层输出。这让模型能够同时捕获粗粒度的整体语义和细粒度的局部细节,显著提升了密集标注、文档解析等任务的精度。
OCR(光学字符识别)能力在 Qwen3-VL 中获得了质的飞跃。支持语言从 Qwen2.5-VL 的 10 种扩展到 32 种,涵盖了主流欧洲语言、亚洲语言乃至部分小语种。更重要的是,模型在低光照、模糊、倾斜等退化条件下仍能保持较高识别率,对罕见字和古籍字符的处理能力也有明显提升。
在长文档理解方面,Qwen3-VL 支持最高 256K tokens 的原生上下文,并可扩展至 1M tokens,足以处理数百页的书籍或合同文档。通过仓库中的 cookbooks/long_document_understanding.ipynb,开发者可以快速上手超长文档的结构化提取和语义分析。
得益于 Interleaved-MRoPE 和原生长上下文支持,Qwen3-VL 在视频理解任务上表现优异。官方基准测试显示,它能够在数小时长视频中实现"秒级索引定位"——用户提问"视频中第 23 分 15 秒发生了什么",模型可以快速定位并给出准确回答。这对于视频内容审核、新闻归档、教育视频分析等场景有直接价值。

图 3:Qwen3-VL 视觉任务性能对比(来源:GitHub README)
Qwen3-VL 提供了极其完整的模型规模矩阵:2B / 4B / 8B / 32B / 235B,涵盖密集(Dense)和 MoE 两种架构,并有专门针对复杂推理优化的 Thinking 版本。2B-4B 版本可在消费级 GPU 单卡上运行(如 RTX 3090),8B 推荐单卡 40GB,32B 需多卡并行,旗舰 235B 则需要 8×80GB 的算力集群。
访问 Hugging Face Spaces 上的 Qwen3-VL-Demo(huggingface.co/spaces/Qwen/Qwen3-VL-Demo),直接在浏览器中上传图片即可体验核心能力,无需任何安装配置。
仓库提供了 Dockerfile(基于 vllm/vllm-openai:v0.11.0),内置 vLLM 推理引擎和 Gradio 5.49.1 Web Demo 环境:
# 构建镜像
docker build -f docker/Dockerfile-qwen3vl-cu128 -t qwen3vl .
# 启动 Gradio Web Demo
docker run --gpus all -p 7860:7860 qwen3vl \
python web_demo_mm.py --checkpoint-path Qwen/Qwen3-VL-8B-Instruct
启动后在 7860 端口提供交互界面,支持多图输入和流式输出。
官方推荐使用 Hugging Face Transformers(需 >= 4.57.0)加载模型:
from transformers import AutoModelForImageTextToText, AutoProcessor
model = AutoModelForImageTextToText.from_pretrained(
"Qwen/Qwen3-VL-8B-Instruct", device_map="auto"
)
processor = AutoProcessor.from_pretrained("Qwen/Qwen3-VL-8B-Instruct")
messages = [{"role": "user", "content": [
{"type": "image", "image": "photo.jpg"},
{"type": "text", "text": "这张图片里有什么?"}
]}]
inputs = processor.apply_chat_template(messages, return_tensors="pt")
inputs = inputs.to(model.device)
output = model.generate(**inputs)
print(processor.batch_decode(output, skip_special_tokens=True))

图 4:Qwen3-VL 图像理解效果示例(来源:通义团队官方 Demo)
Qwen3-VL 仓库提供了 12 个 Jupyter Notebook Cookbook,每个都托管于 Google Colab,可直接在云端 GPU 上运行。这些 Cookbook 涵盖:
| Cookbook | 能力 |
|---|---|
| Omni Recognition | 万物识别(动植物、商品、地标、名人) |
| OCR & Key Info Extraction | 多语言 OCR 和关键信息抽取 |
| Document Parsing | 文档结构化解析(输出 Qwen HTML 格式) |
| 2D / 3D Grounding | 2D 目标定位和 3D 空间边框标注 |
| Video Understanding | 长视频理解、视频 OCR |
| Computer Use Agent | 电脑 GUI 控制自动化 |
| Mobile Agent | 手机 APP 控制自动化 |
| Multimodal Coding | 基于图像生成 Draw.io / HTML / CSS / JS |
| Long Document Understanding | 超长文档语义理解 |
| Spatial Understanding | 空间信息推理 |
| Thinking with Images | 图像精细理解(多步推理) |
部署门槛高:旗舰 235B 版本需要 GPU 集群;2B-8B 虽然单卡可跑,但性能与大模型有明显差距。
视频推理速度:超长视频的端到端推理时间仍然较长,实时应用场景受限。
Agent 安全性:Visual Agent 具备操控数字界面的能力,生产环境部署需要严格的权限控制和操作审计。
中文文档相对薄弱:中文教程资源不够丰富,对国内部分开发者有一定上手门槛。
Qwen3-VL 的发布,在开源多模态领域产生了深远影响。它不仅将开源视觉语言模型的规模上限再次拔高(235B MoE),更重要的是提供了从 2B 到 235B 的完整系列,使得从手机端到云端的全场景覆盖成为可能。
从技术趋势看,Qwen3-VL 所代表的"视觉 Agent"方向——让 AI 模型真正能够操控数字界面——正在成为多模态大模型发展的下一条主线。传统多模态模型止步于"看懂",而 Qwen3-VL 开始探索"看懂并行动",这一跨越意义重大。
此外,Qwen3-VL 同步发布的 Thinking 推理版本,也反映了当前大模型发展的另一个核心方向:慢思考(Chain-of-Thought)在视觉领域的落地。复杂视觉推理任务(如空间规划、数学图表分析)需要模型在给出最终答案前进行多步推理,这一能力对学术研究和工业应用都有重要价值。
整体而言,Qwen3-VL 是 2025 年开源多模态领域最具标志性的项目之一,无论是对于 AI 研究者、开发者,还是对于希望将视觉 AI 能力落地的企业而言,都值得关注和深入探索。