comfyui_LLM_party
在 ComfyUI 中构建 LLM Agent 工作流,一站式集成多模型调用、工具编排、RAG 知识
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在 ComfyUI 中构建 LLM Agent 工作流,一站式集成多模型调用、工具编排、RAG 知识
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有遇到过这样的场景:写了一段 Stable Diffusion 提示词,总觉得不够精准;想让 AI 自动生成角色设定,却不想切换到 ChatGPT 页面;团队有一个知识库,想用自然语言查询却不知道怎么接。每一个小需求,原本都要写一堆代码、配置一堆 API。
ComfyUI LLM Party 做的事,就是把这些"AI 能力"全部做成一个个拖拽即用的节点,嵌进你已有的 ComfyUI 工作流里。它不是一个聊天机器人,而是一套完整的 LLM Agent 工具包,涵盖了从多模型调用、工具编排、RAG 知识库、语音合成到多社交平台接入的整套能力。
图1:ComfyUI LLM Party 项目封面
项目作者 heshengtao 是一个资深的 ComfyUI 用户,日常大量使用 AI 图像生成工具。在持续使用过程中,他发现了一个痛点:ComfyUI 本身是图像生成领域的"超级工作站",但一旦涉及到文字生成、语音合成、OCR 识别等能力时,要么需要切换到外部工具,要么需要自己写代码接入。
他想要一个"一站式"的方案:在 ComfyUI 里就能完成 LLM 调用、MCP 工具编排、GraphRAG 知识库问答、TTS 语音生成全套流程。GitHub 记录显示项目从 2024 年开始活跃维护,star 数量快速增长到 2000+,在 ComfyUI 生态中属于增长速度最快的非官方插件之一。
作者同时活跃在 B 站(Bilibili)和 YouTube,发布了一系列从入门到进阶的视频教程,降低了国内用户的使用门槛。项目还提供了夸克网盘和百度网盘的高速下载链接,方便网络条件受限的用户获取模型文件。
很多人看到"ComfyUI 插件"会误以为这只是一个 API 调用的简单封装。实际上,ComfyUI LLM Party 的架构远比这个认知要复杂。它真正实现了一套 LLM Agent 工作流框架,包含以下几个核心模块:
MCP(Model Context Protocol)服务器节点 — 这是项目最新的重磅功能。MCP 是一个开放协议,允许大模型调用外部工具。项目内置了 MCP 客户端节点,用户只需在 mcp_config.json 中配置目标 MCP 服务器地址,就能将全球各种 MCP 工具接入到自己的 ComfyUI 工作流中。目前已测试支持 Everything 文件搜索等 MCP 服务器,且配置方式与官方推荐完全对齐。
多模型适配层 — 项目的底层通过 aisuite 和原生 API 两种方式支持几乎所有主流 LLM:OpenAI 全系列、Google Gemini、Anthropic Claude、DeepSeek、Qwen、GLM、Kimi、豆包、Spark 等云端模型;以及 Ollama 本地部署、llama.cpp GGUF 格式本地模型、本地 VLM(Janus-Pro、Qwen2.5-VL、Llama-3.2-Vision)等等。一套代码,兼容所有接口,这在同类项目中极为罕见。
Omost 提示词生成节点 — Omost 是 Lllyasviel 开发的一个专门用于优化 SD 提示词的模型,输出格式经过特殊设计,非常适合直接喂给 Stable Diffusion。项目内置了 Omost 模型加载器节点(支持 4bits 量化版本),用户可以直接用自然语言生成高质量的 SD 提示词。
GPT-SoVITS 和 ChatTTS 语音节点 — 分别对应文本转语音(TTS)的两种方案:GPT-SoVITS 是目前开源社区最流行的少样本声音克隆框架,ChatTTS 则是专门针对对话场景优化的神经网络 TTS。项目同时支持这两种方案,用户可以生成具有特定音色和说话风格的语音内容,配合 ComfyUI 的图像/视频生成能力,打造完整的 AIGC 内容生产流水线。
GOT-OCR2.0 节点 — OCR 识别能力,可以从图片中提取文本,识别结果直接作为 LLM 的输入,形成"图像-文字-生成"的完整链路。
GraphRAG 知识库节点 — 基于图结构的 RAG 方案,相比传统向量检索 RAG,能够更好地捕捉知识之间的关联关系。项目支持 Neo4j 作为图数据库后端,结合 sentence-transformers 构建知识向量索引,为垂直领域问答场景提供更高质量的检索结果。
从 pyproject.toml 和源码结构来看,项目采用了清晰的模块化架构:
核心依赖分为几大类:LLM 接入层(openai、aisuite、langchain-ollama、google-generativeai、llama-index)负责与各种大模型通信;向量数据库(faiss-cpu)提供本地高效检索;多媒体处理(librosa、pydub、sounddevice、moviepy、ffmpeg-python)支撑语音和视频能力;RAG 工具链(langchain、langchain-community、langchain-text-splitters)提供文档处理和检索能力;前端/可视化(streamlit)提供可选的 Web 管理界面。
web/ 目录下有完整的 JS 和源码结构,表明项目除 ComfyUI 原生节点外,还提供了一个独立的 Web UI 组件。用户可以通过 Streamlit 启动一个 Web 界面来管理和调试 LLM Party 的各项配置。
值得注意的是,项目提供了 only_api 分支,专门给只需要 API 调用能力的用户使用,大大降低了学习成本——如果不需要 ComfyUI 图形编辑器,只需把这个分支 clone 下来单独使用即可。
ComfyUI LLM Party 的部署分为两种路径:ComfyUI 用户可以通过 ComfyUI-Manager 搜索 comfyui_LLM_party 一键安装(推荐);或者手动 clone 到 custom_nodes 目录后执行 pip install -r requirements.txt。
主要的门槛在于 Python 环境依赖较多,requirements.txt 中包含了 60+ 个包,其中涉及音频处理(librosa、pydub)、机器学习(transformers、accelerate、bitsandbytes)、知识图谱(neo4j)等多个领域。首次安装需要一定的网络条件和磁盘空间(完整安装约需 10GB)。
如果遇到依赖冲突,项目还提供了 requirements_fixed.txt 作为备选方案。作者也提供了包含完整 LLM Party + ComfyUI Manager 的 Windows 便携版压缩包(夸克网盘下载),开箱即用,无需配置 Python 环境。
项目最大的局限在于门槛并不低。尽管作者尽力降低了安装难度,但 60+ 依赖、多个模型下载、大量参数配置,对完全没有 Python 和 AI 工具使用经验的小白用户来说,仍然存在相当的上手难度。
其次,作为一个 ComfyUI 插件,它的核心价值建立在 ComfyUI 生态之上——如果你不需要图像生成,只是想用 LLM 能力,这个项目反而不如直接用 LangChain 或 LlamaIndex 来得直接。
另外,项目目前没有 Docker 支持,对于需要在服务器环境快速部署的场景,需要用户自行处理 Python 环境。AGPL-3.0 协议也意味着如果你修改了源代码并分发,需要开源修改版本,商业使用需要注意合规。
ComfyUI LLM Party 的出现,本质上解决了 AI 工具链之间的"最后一公里"问题。它把原本分散在各个框架中的 LLM 能力,以节点的形式标准化、插件化,让用户可以在一个可视化工作流中自由编排。这种"积木式"的 Agent 构建方式,与 Dify、Flowise 等低代码 LLM 应用的思路一脉相承,但在与图像生成深度绑定这一点上,ComfyUI LLM Party 几乎没有任何竞品。
从技术演进看,项目从最初简单的 LLM API 调用,逐步演进到支持 MCP 协议(这意味着可以接入几乎所有 MCP 生态工具)、支持本地 VLM、支持 GraphRAG,每一步都踩在了技术热点上。未来如果能进一步集成更多多模态模型,将有望成为 ComfyUI 生态中最核心的 AI 能力中枢。
如果你是一个 ComfyUI 重度用户,想把文字生成、语音合成、知识库问答融入到自己的工作流里;或者你是一个 AI 应用开发者,希望快速验证"LLM + 图像"的多模态方案,ComfyUI LLM Party 都是目前最值得关注的解决方案之一。