ComfyUI-IF_AI_tools
为 ComfyUI 装上 LLM 大脑,支持多后端 LLM 调用、OCR-RAG、Omost 布局提
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
为 ComfyUI 装上 LLM 大脑,支持多后端 LLM 调用、OCR-RAG、Omost 布局提
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你正在用 ComfyUI 生成一张赛博朋克风格的城市夜景,AI 已经能画出霓虹灯和高楼,但画面氛围总觉得少了点什么——灯光不够压抑、人物眼神不够空洞、街道细节不够颓废。你需要用文字反复调整提示词,但每次微调都是一次盲人摸象般的试错。
现在有一个插件,能让本地运行的 GPT-4V 级别的视觉语言模型(VLM)直接「读」你的图片,告诉你哪些地方需要优化,然后生成精准的英文提示词,反馈给 ComfyUI——整个过程不需要切换任何界面,全部在节点之间自动流转。这就是 ComfyUI-IF_AI_tools 正在做的事情。
ComfyUI 是当前最强大的开源 AI 图像生成界面之一,它的节点式工作流设计让用户可以精细控制生成管道的每一个环节。然而,ComfyUI 原生并不具备对话式语言模型能力——用户要么手动写提示词,要么依赖外部工具生成后再粘贴进来。
IF_AI_tools 的作者 impactframes(IF_AI) 看到了这个痛点。他长期活跃在 ComfyUI 社区,专注于将各类 LLM(本地和云端)深度集成进 ComfyUI 工作流。项目于 2024 年 3 月上线,在一年内积累了 699 Stars 和 56 Forks,成为 ComfyUI 生态中关注度最高的 LLM 增强工具之一。项目被 Comfy 官方 Registry 收录,支持通过 ComfyUI-Manager 一键安装。
IF_AI_tools 并不是一个单一功能的节点,而是一套模块化 LLM 集成框架,包含以下核心能力:
1. 多后端 LLM 调用引擎
项目封装了几乎所有主流的 LLM 接入方式:
llama3_ifai_sd_prompt_mkr),发布在 HuggingFace 上。2. OCR-RAG:让 AI 读懂你的文档
集成 ColPali(基于 Qwen-VL 的多模态向量检索)和 ColQwen 模型,配合 nanoGraphRAG 知识图谱构建工具。用户可以上传 PDF 或图像,节点自动提取文字内容并建立向量索引,后续通过自然语言提问检索相关段落。ColPali 相比传统 OCR 的优势在于它用 VLM 直接理解图像布局和语义,不需要 OCR 文字识别后再做检索——检索精度大幅提升。
3. nanoGraphRAG:本地知识图谱问答
基于 Microsoft GraphRAG 的轻量实现版 nano-graphrag,支持对本地文档构建知识图谱。节点可以增量索引文档,回答需要跨文档推理的复杂问题。例如:「根据过去三个月的研究报告,提取我司产品市场份额的变化趋势」这类需要聚合多处信息的问题,GraphRAG 比纯向量检索更擅长。
4. Omost 工具:LLM 生成图像布局提示词
Omost 是一个革命性的概念——让 LLM 输出一套结构化的 Canvas 布局信息,包含前景、中景、背景、风格等九宫格区域描述,然后由 lib_omost 库解析为 ComfyUI 的 CanvasConditioning,直接作为 ControlNet 或 VAE Encode 的前置条件,精准控制画面空间布局。作者专门训练了 Dolphin+Omost 融合模型,在 Ollama 上的运行速度比同类模型快 2-3 倍。
5. Florence-2 目标检测与描述
内置 Florence-2 VLM(支持 OCR、目标检测、密集区域描述、指代表达分割等 10 种任务),通过 Supervision 库封装为 ComfyUI 节点。用户可以用它做图像自动化标注、目标计数、区域选择等下游任务,无需离开 ComfyUI 环境。
6. 预设角色系统
内置 IF_AI/presets 目录包含多种预设角色(如 Cortana 风格助手、游戏开发者 Yuka 等),用户可以定义自定义 AI 人设、系统提示词模板、推理/反思/奖励策略,甚至预设风格提示词库(wildcards)。这个设计让 AI 助手不只是一个问答机器,而是有「人格」的工作流参与者。
项目结构清晰,核心模块分为以下几层:
API 适配层(send_request.py):
作为统一调度中心,send_request() 接收 LLM 提供商名称、地址、端口、模型名、消息历史等参数,通过 asyncio + aiohttp 异步调用对应的 API 模块(ollama_api.py、openai_api.py、anthropic_api.py 等)。这种适配器模式让新增 LLM 后端只需要实现一个 API 模块,不需要改动核心逻辑。项目内置 TransformersModelManager 管理本地 HuggingFace 模型的生命周期(加载/缓存/卸载),配合 ComfyUI 的显存管理(comfy.model_management)避免 OOM。
节点注册层(__init__.py):
定义了 12 个 ComfyUI 自定义节点,通过 NODE_CLASS_MAPPINGS 和 NODE_DISPLAY_NAME_MAPPINGS 注册到 ComfyUI 节点系统。包括:IF Chat Prompt(对话式 LLM 调用)、IF Prompt Maker(提示词生成)、IF Image to Prompt(图像到提示词)、IF Display Omni(万用输出)、IF Text Typer(打字机效果)、IF Visualize Graph(知识图谱可视化)等。
工具层(agent_tool.py、web.py):
AgentTool 类将每个节点封装为可复用工具,支持动态加载外部 Python 类和函数,适合构建复杂的 Agent 工作流。web.py 提供 DuckDuckGo 搜索工具规范(基于 llama_index),可以给工作流接入实时网络搜索能力。
RAG 核心层(colpaliRAG_module.py、graphRAG_module.py):
colpaliRAGapp 集成 Byaldi(RAGMultiModalModel)做多模态检索,GraphRAGapp 基于 nano-graphrag 做知识图谱构建。两者都依赖 folder_paths 获取 ComfyUI 目录结构,RAG 数据默认存储在 custom_nodes/ComfyUI-IF_AI_tools/IF_AI/rag/ 下。
可视化层(lib_omost/、graph_visualize_tool.py):
lib_omost/canvas.py 实现了 Omost 的 Canvas 数据结构——将 LLM 输出的 JSON 解析为九宫格区域(前景、中景、背景、风格等),每块区域对应一组提示词和权重。graph_visualize_tool.py 用 networkx + matplotlib 将 GraphRAG 构建的知识图谱渲染为可视化图像。
前端/样式(IF_AI/presets/):
预设系统通过 JSON/YAML 文件定义 AI 人设,包含性格特征、专业领域、交互风格、规则和响应模式。这是一个数据驱动设计——预设本身是纯文本配置,不需要修改代码即可扩展。
安装:支持三种方式:
custom_nodes 目录embedded_install.bat依赖:Python 3.10+、poppler(PDF 支持)、各类 LLM 后端工具(Ollama/LM Studio 等)。API 型调用不需要 GPU,但完整功能(Florence-2、ColPali)需要 NVIDIA GPU(8GB+ VRAM)。
配置:支持环境变量(OPENAI_API_KEY、ANTHROPIC_API_KEY 等)和 .env 文件配置 API key。Ollama 默认 localhost:11434,其他本地服务通过 IP+端口配置。
容器化:项目没有 Dockerfile,不提供容器化部署。这意味着它天然依赖 ComfyUI 主程序环境,不适合独立部署或远程服务器使用——对于习惯 Docker 一键启动的用户来说是个门槛。
.env 文件管理 key,但项目没有提供完善的 key 隔离机制,在多人共享工作环境下存在 key 泄露风险。ComfyUI-IF_AI_PromptImaGen,现有项目已标记为 Archived(归档)。这意味着虽然现有代码仍可用,但不会再有新功能更新,用户应关注新项目动向。IF_AI_tools 代表的趋势是将 LLM 从「对话工具」升级为「工作流胶水」——不再是简单的问答,而是让语言模型深度参与图像生成的全流程:读图、理解、生成提示词、控制布局、检索知识。它的技术选型(ColPali、GraphRAG、Omost)都代表了 2024-2025 年 AI 图像+语言融合的前沿方向。
项目作者已迁移至 comfy-deploy/comfyui-llm-toolkit,继续维护类似功能。新项目的 Stars 增速值得关注。

图1:IF_AI_tools 典型工作流(来源:GitHub)