zhihui_nodes_comfyui
55+ ComfyUI自定义节点,集成Qwen3-VL/Florence2视觉理解、多平台翻译、提示
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
55+ ComfyUI自定义节点,集成Qwen3-VL/Florence2视觉理解、多平台翻译、提示
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你正在用 ComfyUI 构建一套 AI 图像生成工作流,需要把中文提示词翻译成英文、让 AI 识别参考图的构图、把多张图片批量排列成拼图、还得生成一段视频生成提示词——在没有这套工具之前,你可能需要在 ChatGPT、Photoshop、和多个节点之间来回切换,效率大打折扣。
潪AI ComfyUI 节点包(zhihui_nodes_comfyui)正是为了解决这个问题而生的:它将 55 个常用功能打包成 ComfyUI 自定义节点,覆盖提示词处理、多语言翻译、AI 视觉理解、图像编辑、视频生成提示词等多个维度,让 AI 创作工作流在一套界面内一气呵成。
ComfyUI 之所以在 AI 图像生成社区长盛不衰,关键在于其高度模块化的工作流设计——每个功能封装为一个节点,用户像搭积木一样自由组合。然而,官方默认节点偏向底层能力封装,中文用户在实际创作中常常需要额外工具链:提示词优化需要借助大语言模型、图像批处理需要写 Python 脚本、多模态理解需要调用云端 API……
本项目的作者 Binity 敏锐地捕捉到了这个痛点,自 2024 年起持续在 GitHub 更新这套节点包,目前已达到 162 stars、8 forks,积累了稳定的中文用户群体。项目采用 GPL-3.0 开源协议,代码完全开放,同时提供中英文双语文档,降低了入门门槛。
图1:批量图片加载节点支持多格式图片一次性导入ComfyUI工作流,省去手动拼接的繁琐步骤。
这套节点包的功能可以划分为以下五大模块,涵盖了从提示词输入到图像输出的完整创作链路。
提示词是 AI 图像生成的灵魂,直接决定输出质量。本项目提供了多个提示词优化工具:
Prompt Expander(提示词扩写器):基于大语言模型,将简短的中文描述自动扩展为丰富的英文提示词,包含风格、构图、光线等多维度细节。
Prompt Preset(提示词预设):内置多种预设模板(如"照片写实""动漫风格""水彩画"),用户一键选择即可应用对应提示词结构。
Photograph Prompt Manager(摄影提示词管理器):专门针对摄影场景,提供焦距、光圈、景深等参数的精细化控制。
System Prompt Loader(系统提示词加载器):允许用户在节点中直接注入系统级指令,影响整个工作流的默认行为。
翻译是中文用户最大的痛点之一。本项目集成 MultiPlatformTranslate 节点,支持以下翻译引擎:
Google Translate / DeepL / 百度翻译 / 腾讯翻译:自动识别源语言,将提示词精准翻译为目标语言。
OpenAI GPT / Claude:利用大语言模型的语义理解能力进行高质量意译,而非逐字翻译。
阿里云/火山引擎等国产方案:降低对境外服务的依赖。
用户可以在节点内选择具体引擎,并设置"翻译后自动替换原提示词"或"翻译结果另存为新字段"等模式。
本项目最大的技术亮点是将多个多模态大模型封装为 ComfyUI 节点,让用户无需写代码即可调用前沿视觉 AI:
Qwen3-VL(通义千问视觉模型):集成 Qwen2-VL-72B-Instruct 系列,支持图像内容分析、目标检测、OCR 文字识别。用户上传参考图,Qwen3-VL 节点自动生成描述性提示词或分析构图特点。
Florence2-Plus(微软视觉大模型):支持密集标注、图像描述、OCR 等任务。Florence2-Plus 节点提供 Basic 和 Advanced 两种模式——Basic 适合快速生成描述,Advanced 支持更精细的区域级分析。
这两个视觉模型节点的工作方式是:用户在 ComfyUI 界面中拖入节点 → 上传图片 → 配置参数(如置信度阈值、输出格式)→ 节点输出结构化的分析结果或提示词,可直接接入后续的图像生成节点。
图2:Florence2 Plus 节点提供 Basic 和 Advanced 两种模式,Advanced 模式下可对图像特定区域进行精细化标注与描述。
日常图像处理是最常用的辅助功能,本项目提供了比 ComfyUI 默认节点更友好的封装:
Image Aspect Ratio(图像宽高比):自动计算并显示图片宽高比,支持一键锁定比例裁剪(如 16:9 横幅、9:16 竖图),避免手动计算。
Image Format Converter(图像格式转换):在 PNG/JPG/WebP/BMP 等格式间批量转换,支持调整压缩质量参数。
Batch Loading of Images(批量图片加载):一次性导入多张图片,支持自定义排序规则(文件名/创建时间/分辨率),解决 ComfyUI 原生只支持单张加载的问题。
Color Removal(去色工具):智能移除图像中的指定颜色,常用于背景处理。
Latent 工具(Laplacian Sharpen / Sobel Sharpen / USM Sharpen):对 Latent 空间图像进行锐化处理,提升最终输出清晰度。
本项目还延伸到视频和音乐领域,覆盖了 AI 创作的全媒体链路:
WAN Prompt Generator(Wan 视频提示词生成器):针对视频生成模型(如 Wan2.1)的提示词语法进行专门优化,生成包含运动描述、时间线编排的视频提示词。
Suno Assisted(Suno 音乐辅助):结合 LM Studio 本地大模型,为音乐创作提供风格分析和歌词优化建议。
图3:宽高比节点自动标注当前图片比例,支持一键切换为常用社交媒体尺寸(如 Instagram 1:1、YouTube 16:9)。
从项目结构来看,这套节点包采用前后端分离的经典模式:
Nodes/ 目录:存放所有 Python 节点实现,遵循 ComfyUI 节点开发规范(继承 torch.nn.Module 或实现 NODE_CLASS_MAPPINGS)。
web/ 目录:存放 JavaScript 前端代码,为每个节点提供 ComfyUI 内置的 Web UI 界面(节点侧边栏参数面板)。
workflow/ 目录:提供 12 个预设工作流 JSON 文件,覆盖 Qwen3-VL 图像分析、水印去除、Suno 音乐辅助等典型场景,用户可直接导入 ComfyUI 使用。
Python 依赖涵盖了 AI 创作的完整技术栈:torch、transformers、opencv-python、Pillow、huggingface_hub、modelscope、qwen-vl-utils、bitsandbytes、timm 等约 22 个核心包,总依赖体积约 3-5 GB。
代码质量方面,Python 模块遵循 PEP 8 规范,重要模块(如 Florence2Plus、Qwen3VL)配有独立配置文件和详细注释。但测试覆盖率和文档完整性仍有提升空间——目前项目文档以 README 为主,缺少 API Reference 类型的结构化文档。
本项目不是独立应用,而是 ComfyUI 的扩展插件,因此安装流程有一定门槛:
前提条件:已有运行中的 ComfyUI 环境(支持 Windows/macOS/Linux)。
克隆节点包:将本仓库克隆到 ComfyUI 的 custom_nodes/ 目录下。
安装依赖:运行 pip install -r requirements.txt,需安装 PyTorch(支持 CUDA 的 NVIDIA 显卡)、Transformers 等约 22 个包,总体积约 3-5 GB(首次加载模型时额外下载)。
中文界面:下载 Chinese_Localization_Files/ 目录下的汉化文件,配合 ComfyUI-DD-Translation 扩展实现全中文界面。
硬件需求:由于集成了 Qwen3-VL 和 Florence2-Plus 等视觉大模型,推荐使用 NVIDIA 显卡(RTX 3060 及以上,8GB+ 显存)。纯 CPU 推理速度极慢,部分节点无法正常使用。内存建议 16GB+,磁盘空间 10GB+(包含模型权重)。
快速部署(quick_deploy):不支持。本项目无 Dockerfile 和 docker-compose,无法通过容器化方式一键启动,必须在已有 ComfyUI 环境中手动配置。
图4:图像格式转换节点支持批量转换多种格式,并可调整质量参数(压缩率、色彩空间等)。
任何技术工具都有其适用边界,这套节点包也不例外。
1. 许可证兼容性风险:项目整体采用 GPL-3.0,这意味着如果你的工作流包含 GPL 代码的衍生作品,整个工作流也必须开源。对于商业用户来说,这可能带来许可证合规风险,需要法务评估。
2. 大模型 API 密钥管理:Qwen3-VL、翻译节点等功能依赖阿里云/火山引擎等服务商 API,需要用户自行申请密钥并配置在 zhiai_api_keys.json 文件中。密钥一旦泄露或额度耗尽,相关节点将无法正常工作。
3. 显存占用问题:Florence2-Plus 和 Qwen3-VL 等视觉模型在 FP16 精度下占用显存较大(7B 模型约 14GB)。尽管 bitsandbytes 量化可以缓解,但项目文档对量化配置说明不足,部分用户可能在默认配置下遇到显存溢出。
4. 维护活跃度:作者 Binity 保持定期更新(最新版本 1.1.1),但部分节点(如 Kontext 预设增强版)的文档说明较为简略,需要用户自行探索参数含义。
从整个 AI 生成内容(AIGC)生态来看,这套节点包的意义不仅在于功能本身,更在于降低了中文用户的工具链整合成本。
长期以来,ComfyUI 的优质工作流和节点多由英文社区贡献,中文用户面临"找得到但用不明白"的困境。潪AI 节点包不仅提供了中文化界面,更重要的是将原本分散的工具(翻译 API、视觉模型、提示词优化)整合进统一的工作流框架,减少了用户在多个工具间切换的认知负担。
从 GitHub 趋势来看,多模态大模型(Qwen-VL、Florence2)与图像生成工具的深度整合正在成为 2025-2026 年的主流方向。本项目率先将这一趋势落地为 ComfyUI 节点生态中的具体实现,其设计思路对其他开发者有较强的参考价值。
如果你正在使用 ComfyUI 进行 AI 创作,不妨将这套节点包纳入工作流——即使只用到其中几个节点,也能在效率上获得可观的提升。项目完全免费,许可证允许在遵守 GPL-3.0 的前提下自由使用和修改。