Qwen2.5-VL
全球TOP级开源多模态大模型,支持图像、视频、3D空间理解与Agent操作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
全球TOP级开源多模态大模型,支持图像、视频、3D空间理解与Agent操作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Qwen3-VL 官方标志
清晨 8 点,你打开电脑,屏幕上同时开着产品设计图、密密麻麻的英文合同文档、一段手机录制的操作演示视频——每一种内容形态各异,传统 AI 模型只能逐个击破,无法"一眼看穿"所有信息。
这就是多模态大模型要解决的问题:让 AI 真正像人一样,同时理解文字、图像、视频、甚至 3D 空间。 阿里巴巴通义千问团队于 2025 年底推出的 Qwen3-VL,正是这一方向上截至目前最强大的开源多模态模型系列。
Qwen3-VL 并非凭空出现。阿里 Qwen 团队从 Qwen-VL 开始,持续迭代:Qwen1.5-VL、Qwen2-VL,再到今天的 Qwen3-VL,每一次发布都在基准测试上刷新纪录,并在 GitHub 积累了超过 19,000 颗 Stars,成为全球最受关注的开源多模态模型之一。

图2:Qwen3-VL 整体架构图,融合视觉编码器与 LLM 语言主干
Qwen3-VL 最大的架构亮点是同时提供 Dense(稠密) 和 MoE(混合专家) 两种架构变体,参数规模从 2B 到 235B 不等,满足从边缘设备到超大规模服务器的全场景需求。
Dense 模型(如 Qwen3-VL-2B、7B、72B):传统 Transformer 结构,每个 token 激活全部参数,适合对延迟敏感、吞吐量要求高的在线推理场景。
MoE 模型(如 Qwen3-VL-235B-A22B):每 token 仅激活 22B 参数,但总参数量高达 235B。这意味着部署 235B 级别模型时,显存和算力消耗仅相当于 22B 级别,极大降低了顶级能力的部署门槛。评测显示,235B MoE 模型在多项基准上可与 400B+ Dense 模型媲美。

图3:Dense 与 MoE 模型规模与性能对比(Instruct 版本)
Qwen3-VL 内置了原生视觉 Agent 能力,能够直接"看懂" PC 桌面或手机屏幕上的 UI 元素(按钮、输入框、图片),理解其功能,并在无需额外工具调用接口的情况下自主完成复杂任务,例如:
官方提供的 computer_use.ipynb 和 mobile_agent.ipynb Jupyter Notebook 示例,覆盖了 PC GUI 操作和移动端自动化两大场景,是当前开源多模态 Agent 领域的标杆级实现。
输入一张 Draw.io 架构图、Web 页面截图、甚至手绘草图,Qwen3-VL 即可理解其结构并生成对应的 HTML/CSS/JS 代码或 Draw.io XML。mmcode.ipynb 示例展示了如何用图片驱动代码生成,将设计到实现的周期大幅压缩。
相比前代版本,Qwen3-VL 的空间理解能力有了质的飞跃:
Qwen3-VL 原生支持 256K token 上下文,通过技术优化可扩展至 1M token。这意味着它可以:
OCR 能力从 Qwen2-VL 的 10 种语言扩展到 32 种语言,并新增:
Qwen3-VL 同时提供 Thinking(推理增强)版本模型。与快速响应的 Instruct 模型不同,Thinking 模型会在生成最终答案前进行深度推理,适用于:

图4:Thinking 模型与普通 Instruct 模型的性能对比
Qwen3-VL 的代码库采用清晰的模块化组织:
| 目录/文件 | 说明 |
|---|---|
cookbooks/ | Jupyter Notebook 形式的实践教程,涵盖 Agent、OCR、空间理解等 9 大场景 |
docker/ | 官方 Dockerfile(基于 vLLM v0.11.0)和一键启动脚本 |
qwen-vl-finetune/ | 微调框架,支持 LoRA/QLoRA 等轻量微调方案 |
qwen-vl-utils/ | 核心工具库,处理视觉信息编码与预处理 |
web_demo_mm.py | Gradio Web Demo 主程序,支持 HF Backend 和 vLLM Backend |
核心技术栈:
torch),深度学习主力transformers(AutoProcessor、AutoModelForImageTextToText)transformers-stream-generatortorchcodec(PyTorch 官方视频编解码器)推理后端双模式:
1. HuggingFace 原生 Backend(适合快速原型验证,小模型)
2. vLLM Backend(适合生产部署,支持高吞吐、连续批处理)
官方提供预构建镜像 qwenllm/qwenvl:qwen3vl-cu128,基于 CUDA 12.8 + vLLM 0.11.0。启动命令仅需:
docker run --gpus all --ipc=host --network=host --rm --name qwen3vl \
-it qwenllm/qwenvl:qwen3vl-cu128
通过 docker/docker_web_demo.sh 脚本可一键拉起 Web Chat 界面(默认端口 8901),无需手动配置模型路径。
web_demo_mm.py 支持两种推理后端:
transformers 加载模型,适合研究和调试启动参数丰富:支持 CPU Only 模式、Flash Attention 2 加速、公开分享链接生成等。
通过 pip 安装核心工具库:
pip install qwen-vl-utils transformers accelerate
Qwen3-VL 的发布,标志着开源多模态模型正式进入"从视觉感知到视觉行动"的新阶段。以往的多模态模型多停留在"看图说话"层面,而 Qwen3-VL 的 Visual Agent 和 Visual Coding 能力,让模型真正具备了基于视觉理解执行复杂任务的潜力。
从指标来看,Qwen3-VL 在 MathVision、MMMU、VideoMME 等权威基准上刷新了开源模型最高分,部分指标接近 GPT-4o、Claude-3.5-Sonnet 等闭源顶级模型。同时阿里选择将模型权重开源,为学术研究和商业应用提供了宝贵的基座。
作为一个持续活跃的项目,Qwen 团队在 GitHub 上保持着高频更新,Issues 讨论区汇聚了大量来自全球开发者的问题和实践经验,是当前多模态 AI 领域最具参考价值的开源社区之一。