ComfyUI-IF_LLM
在 ComfyUI 中直接调用任意 LLM(本地/Ollama/API)生成图像 Prompt,构建多模态 AI 工作流
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在 ComfyUI 中直接调用任意 LLM(本地/Ollama/API)生成图像 Prompt,构建多模态 AI 工作流
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你正在用 Stable Diffusion 生图,忽然想要一张「沙漠中废弃的蒸汽朋克飞船」的图像——但你不想跳出当前工作流去 ChatGPT 查 prompt,也不想手动复制粘贴。理想的状态是:LLM 直接给你的画图工具递材料、调整参数、甚至自动补全 prompt。 ComfyUI-IF_LLM 正是这样一座桥梁,它让几乎所有主流大语言模型都能直接在 ComfyUI 的节点画布里工作,把 LLM 的生成能力无缝嵌入图像生成流水线。
这不是一个孤立的工具,而是一套完整的节点生态。开发者 if-ai(账号 impactframes)构建了从文本生成、图片识别、多模态对话到 Agent 规划的全套自定义节点,让 ComfyUI 从一个纯图像生成工具,进化为真正的 「AI 全栈工作台」。
ComfyUI 是当前最流行的开源图像生成图形界面,以其高度模块化的节点系统著称。开发者可以像搭积木一样自由组合模型、采样器、VAE、ControlNet 等组件。然而长期以来,ComfyUI 的工作流编排完全依赖人工——用户需要手动输入 prompt、调整参数、串联节点。
大语言模型天然擅长理解自然语言、分解任务、自动生成 prompt。如果能将 LLM 接入 ComfyUI,就意味着:
这一思路在 2024 年逐渐成熟,ComfyUI-IF_LLM 就是其中的代表性实现,版本已迭代至 0.2.4,在 GitHub 上积累 158 个 star 和 17 个 fork。
ComfyUI-IF_LLM 的最大特点是广泛的模型兼容性。它不仅支持云端商业 API,还支持完全本地化的开源模型,堪称「LLM 瑞士军刀」。
云端 API 支持(商业模型):
本地模型支持(完全免费、私密):
ollama run llama3.2-vision 即可部署 vision 模型多模态与视觉能力: 支持 Gemini Flash、GPT-4o Mini、Qwen2-VL 等视觉模型,可以上传图片并让模型「看图说话」,生成的描述可直接传给图像生成节点,实现 图生文→文生图 的闭环工作流。
特色工具 Omost:这是项目最亮眼的创新之一。Omost 是一个结构化提示词工具,可以让 LLM 按照 Omost 规范生成图像 prompt,确保输出格式规范、构图描述精准。项目专门提供了 Ollama-Omost 优化模型 impactframes/dolphin_llama3_omost,比同类 Omost 模型快 2-3 倍。
Gemini 2 图像生成:集成 Google Gemini 2 的原生图像生成能力,用户可以在工作流中直接调用 Gemini 生成图像,而无需切换到其他平台。
IF_Profiles 系统提示词:支持自定义角色预设(SystemPrompts),包含推理模板(Reasoning)、反思模板(Reflection)、评分模板(Reward),可创建「角色扮演助手」风格的 Agent 配置。预设存储在 IF_AI/presets/ 目录,支持 JSON/YAML 格式。
从代码结构来看,ComfyUI-IF_LLM 遵循标准的 ComfyUI 插件规范,核心架构分为以下几层:
节点层(Custom Nodes):
IFLLMNode.py:主节点,注册 ComfyUI 的 LLM 调用节点,暴露出 IFLLM 等核心类IFDisplayOmniNode.py / IFLLMDisplayOmniNode.py:多格式输出节点(Omni 格式)IFDisplayTextNode.py / IFLLMDisplayTextNode.py:文本输出节点IFJoinTextNode.py / IFLLMJoinTextNode.py:文本拼接节点IFLLMLoadImagesNodeS.py:多图加载节点IFLLMSaveTextNode.py:文本保存节点ListModelsNode.py:动态获取可用模型列表agent_tool.py:Agent 工具框架,支持将节点封装为可复用的 Agent ToolAPI 层(各厂商适配器):
每个 LLM 厂商有独立的 API 文件:openai_api.py、anthropic_api.py、gemini_api.py、deepseek_api.py、ollama_api.py、llamacpp_api.py、kobold_api.py、textgen_api.py、transformers_api.py、vllm_api.py、groq_api.py、mistral_api.py、xai_api.py、huggingface_api.py、lms_api.py。这种模块化设计使得新增一个 LLM 厂商只需新增一个文件,不影响其他模块。
核心工具层:
send_request.py:统一的 HTTP 请求封装,处理 API 调用逻辑utils.py:工具函数集合(API Key 读取、图片处理、文本清理、设置存取等)agent_tool.py:Agent 框架的核心抽象omost.py:Omost 规范实现工作流与预设:
workflows/:预置工作流 JSON(GGUF 工作流、Gemini2 图像生成、IF_LLM 主工作流等)IF_AI/presets/:系统提示词预设(agents、assistants、embellishments、style_prompts 等)IF_AI/rag/:RAG(检索增强生成)设置,支持基于知识库的 LLM 问答依赖生态:
从 requirements.txt 和 pyproject.toml 可以看出,项目依赖非常广泛:
代码质量评估:
typing 类型注解,代码可读性良好agent_tool.py 的设计体现了对 Agent 范式的理解folder_paths、PromptServer),脱离了 ComfyUI 环境无法独立运行;README 有部分拼写错误,安装说明对新手不够友好。综合评分:75/100安装方式(两种):
方式一(推荐):ComfyUI Manager 在 ComfyUI Manager 中搜索 "IF_LLM",点击安装,依赖自动解决,最简单。
方式二(手动):
cd custom_nodes
git clone https://github.com/if-ai/ComfyUI-IF_LLM.git
cd ComfyUI-IF_LLM
pip install -r requirements.txt
如果是 ComfyUI Windows 便携版,双击 embedded_install.bat 或运行:
python_embeded\python.exe -m pip install -r requirements.txt
环境要求:
推荐本地模型配置: Ollama 是最推荐的本地后端。安装 Ollama 后,一条命令拉取模型:
ollama run llama3.2-vision # 多模态 vision 模型
ollama run impactframes/dolphin_llama3_omost # Omost 优化版,速度快 2-3 倍
ollama run llama3.2 # 轻量文本模型
API Key 配置:
支持环境变量:设置 OPENAI_API_KEY、ANTHROPIC_API_KEY、GOOGLE_API_KEY 等,或在项目根目录新建 .env 文件存储。
使用界面: 安装后,ComfyUI 节点栏会出现 "IF_LLM" 分组,包含所有自定义节点。用户通过拖拽节点、连接线构建工作流,每个节点内部封装了完整的 LLM 调用逻辑。
与 IF_AI_tools 的冲突:作者在 README 开头特别警告:IF_LLM 与 IF_AI_tools 可能产生冲突,如已安装 IF_AI_tools,需先卸载才能使用 IF_LLM。作者正致力于将两个工具合并为统一包,减少用户的选择困扰。
环境依赖复杂:requirements.txt 包含 triton(Linux 独有)、平台特定的 wheel 包,安装过程对 Windows 用户不够友好。部分可选依赖(如 autoawq、flash-attn)安装失败不影响核心功能,但会丧失量化加速能力。
文档质量参差:README 存在拼写错误,安装说明分散在多个章节,新手需要花费较多时间理解各个模型后端的配置方式。
GitHub Stars 较低:158 star 对于一个功能如此丰富的工具来说并不算多,说明目前主要在 ComfyUI 核心用户圈内传播,尚未出圈。
节点稳定性:作为自定义节点,版本更新可能带来节点接口变化,历史工作流文件可能在新版本中无法直接打开。
ComfyUI-IF_LLM 代表着 AI 工具发展的一个重要趋势:从单点工具向工作流平台演进。
传统的 AI 应用范式是「一个工具做一件事」——Midjourney 生成图、ChatGPT 对话、Claude 写作。但真实场景中的需求往往横跨多个模态和任务。ComfyUI 的节点架构天然适合这种需求,而 IF_LLM 则补全了「LLM 能力」这一关键缺口。
从更长远的角度看,这类 LLM 工作流节点的价值在于:
当前 AI 工具正处于「能力整合」的早期阶段,ComfyUI-IF_LLM 的思路——让 LLM 成为工作流的一等公民——值得所有 AI 工具开发者关注。如果你已经在用 ComfyUI,强烈建议花 15 分钟安装体验,感受一下「LLM + 图像生成」无缝融合的威力。

图1:ComfyUI-IF_LLM 工作流节点界面示例(来源:项目 workflows/Final)