ComfyUI-QwenVL
在 ComfyUI 工作流中集成 Qwen3-VL/Qwen2.5-VL 多模态大模型,支持图片理解、视频分析和提示词增强
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在 ComfyUI 工作流中集成 Qwen3-VL/Qwen2.5-VL 多模态大模型,支持图片理解、视频分析和提示词增强
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
如果你是 AI 绘图爱好者,一定对 ComfyUI 不陌生——那个以节点式工作流闻名的图像生成平台,让你能够精细控制 SD 模型的每一步生成过程。但长期以来,ComfyUI 主要聚焦于图像生成本身的流程编排,缺乏对视觉语言模型(VLM)的原生支持。用户想要对一张图片"提问",或者用视频素材让 AI 做分析,往往需要切换到另一个独立应用。
ComfyUI-QwenVL 解决了这个痛点。它是一个由 1038lab 团队开发的 ComfyUI 第三方节点(Custom Node),将阿里巴巴通义实验室的 Qwen-VL 系列多模态大模型——包括最新的 Qwen3-VL 和 Qwen2.5-VL——无缝嵌入 ComfyUI 工作流生态中。
Qwen-VL 是阿里巴巴通义实验室开源的视觉语言模型系列,在 Hugging Face 上积累了极高的社区热度。其中 Qwen3-VL 是 2025 年底发布的最新一代,具备强大的图像理解、视频帧序列分析和文字生成能力。该系列支持多种量化格式(FP16、8-bit、4-bit),在消费级显卡上也能运行。
Qwen3-VL-8B-Instruct 在 FP16 精度下需要约 16GB 显存,而通过 4-bit 量化可压缩至 6GB 以下,一张 RTX 3060 级别的显卡即可本地部署。ComfyUI-QwenVL 正是为这一场景量身打造。
ComfyUI-QwenVL 提供两组节点体系,分别对应 Hugging Face Transformers 后端和 llama.cpp GGUF 后端:
Transformers 节点组(HF Backend):
GGUF 节点组(llama.cpp Backend):
pip install llama-cpp-python[server] 并需额外编译 vision 支持)。自动量化与显存优化:内置 BitsAndBytes 量化支持(4-bit/8-bit),配合 FP16 自动降级机制。在加载 Qwen3-VL-8B 模型时,系统会自动检测显卡架构(如 RTX 3090 的 SM86 或 RTX 4090 的 SM89),若检测到 FP8 不兼容(如老款显卡),会自动回退到更安全的精度级别,避免崩溃。
SageAttention 加速:v2.1.0 版本引入 SageAttention,这是专为 Ampere(SM80)、Ada(SM89)、Hopper(SM90)、Blackwell(SM120)架构优化的注意力计算内核。在支持的 GPU 上,SageAttention 可显著提升推理吞吐量。节点内置自动选择策略:优先尝试 Sage → 降级 Flash Attention 2 → 最后使用 SDPA(PyTorch 内置实现)。
视频帧序列处理:除了单张图片,QwenVL 节点还支持视频输入——自动从视频中均匀采样 N 帧(可配置帧数),将帧序列作为多图输入传给 VLM,实现视频内容理解。这一功能对于视频审核、内容分析等场景非常实用。
模型自动下载:首次使用时,节点会自动从 Hugging Face 下载对应模型权重到 ComfyUI/models/LLM/Qwen-VL/ 目录,无需手动操作。同时支持通过 custom_models.json 配置文件加载自定义模型路径。
前置要求:必须先安装 ComfyUI 核心程序(GitHub 搜索 ComfyUI,clone 到本地后按官方文档配置 CUDA 环境)。在此基础上,只需两步即可安装本插件:
cd ComfyUI/custom_nodes
git clone https://github.com/1038lab/ComfyUI-QwenVL.git
cd ComfyUI-QwenVL && pip install -r requirements.txt
重启 ComfyUI 后,节点栏中即可看到 QwenVL 系列节点。
显存需求(以 Qwen3-VL-4B-Instruct 为例):
| 量化精度 | 显存需求 | 推荐显卡 |
|---|---|---|
| FP16 | 6GB | RTX 3060 12GB / RTX 4060 Ti |
| 8-bit | 3.5GB | RTX 3060 / RTX 2060 |
| 4-bit | 2GB | GTX 1080 / RTX 3060 笔记本 |
若使用 GGUF 后端,量化后的模型文件(.gguf)可放在 ComfyUI/models/llm/GGUF/ 目录,配合 llama-cpp-python 运行时加载。
无 Docker 支持:目前项目不提供 Dockerfile 或 docker-compose.yml,若追求容器化部署需自行编写。整体安装难度评定为"简单"——只要 ComfyUI 跑通,安装本插件几乎没有额外障碍。
没有原生 Web UI:ComfyUI 本身是基于浏览器的节点编辑器,但 ComfyUI-QwenVL 是纯工作流插件而非独立 Web 应用。如果你在找"上传图片 → 返回分析结果"的独立工具,这个项目不适合你。它的价值在于将 VLM 嵌入已有的图像生成工作流中,与 SD 节点、ControlNet 节点配合使用。
GGUF 视觉支持门槛较高:GGUF 后端虽然降低了内存占用,但需要自行编译带有 vision 支持的 llama-cpp-python wheel,这一步骤在 Windows 和 macOS 上较为繁琐,官方文档中有专门的安装指南。
许可证注意事项:插件代码本身采用 GPL-3.0 许可,但 Qwen3-VL/Qwen2.5-VL 模型采用 Apache-2.0 许可——两者许可证要求不同,商用场景需注意合规。
ComfyUI-QwenVL 的出现,填补了 ComfyUI 生态中"多模态大模型节点"的空白。在它之前,ComfyUI 的能力边界主要在图像生成;有了 QwenVL 节点后,工作流可以天然地加入图像理解、视频分析、图文问答等步骤,实现了 "生成 → 理解 → 再生成" 的闭环。
这个项目也体现了当前 AI 工具发展的一个趋势:基础模型能力越来越强,但如何将这些能力嵌入具体的工作流工具中,让非专业用户也能用上,是一个巨大的需求缺口。ComfyUI 作为一个高度可定制的节点式平台,天然适合做这种能力组装——ComfyUI-QwenVL 正是这一方向的优秀实践。