ComfyUI-OmniGen2
OmniGen2 的 ComfyUI 节点实现,一个模型搞定文生图、图像编辑、主体驱动等全部任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
OmniGen2 的 ComfyUI 节点实现,一个模型搞定文生图、图像编辑、主体驱动等全部任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

如果可以只用一个模型完成"文生图、图生图、图像编辑、主体驱动生成"全部任务,还需要分别安装 SDXL、ControlNet、Inpainting 模型吗? OmniGen2 给出了肯定答案——而 ComfyUI-OmniGen2 让这个统一模型无缝嵌入你现有的 ComfyUI 工作流。
在 ComfyUI 的生态中,每一种生成任务几乎都对应一个专门的节点或模型:文生图用 SDXL / Flux,图像编辑用 SD Inpainting,主体驱动用 LoRA + IP-Adapter……这带来了一个现实困境——光管理这些模型权重就占用了大量磁盘空间(动辄 20~50GB),且不同模型之间的工作流难以串联。
OmniGen2 由北京智源人工智能研究院(BAAI)旗下的 VectorSpaceLab 团队提出,核心目标是 "一个模型、多模态统一"。它将文本指令、参考图像、主体图统一作为输入,输出图像或完成编辑任务。项目在 2025 年 6 月发布论文 arXiv:2506.18871,并在 HuggingFace 上提供了在线 Demo。
ComfyUI-OmniGen2 则是社区开发者 Yuan-ManX 将 OmniGen2 封装为 ComfyUI 自定义节点的实现,让你可以在熟悉的 ComfyUI 界面中直接调用这个统一多模态模型,无需脱离现有工作流。
OmniGen2 的架构由两大部分组成:
模型总参数量约 7GB(FP16),推理时显存占用约 12GB。相比分别维护 SDXL(6.5GB)+ ControlNet(1.5GB)+ Inpainting(4GB)的组合,OmniGen2 在功能覆盖上更具优势。
ComfyUI-OmniGen2 提供三个节点:
| 节点 | 功能 |
|---|---|
| Load OmniGen2 Image | 加载参考图像(支持多张) |
| Load OmniGen2 Model | 加载 OmniGen2 模型权重 |
| OmniGen2 | 核心推理节点,支持 text-to-image / image editing / subject-driven generation |
README 提供了详细的超参数说明:
text_guidance_scale:控制生成结果对文本指令的遵循程度(越高越严格遵循文字描述)。image_guidance_scale:最关键的参数。控制输出图像对参考图像的忠实度。图像编辑任务推荐 1.2max_pixels:自动缩放超大图像,控制分辨率与显存占用的平衡。
| 组件 | 版本要求 | 作用 |
|---|---|---|
| PyTorch | ≥2.6.0 | 深度学习框架 |
| Transformers | ≥4.51.3 | VLM 编码器(Qwen2-VL 系列架构) |
| Diffusers | 最新版 | 扩散模型推理管线 |
| Accelerate | - | 分布式推理与混合精度 |
| Flash Attention 2 | 2.7.4.post1 | 高效注意力计算,降低显存 |
| TIMM | - | 视觉 backbone |
| einops | - | 张量重排布 |
OmniGen2 支持两种调度器:DPM-Solver++(推荐)和 Flow-Match Euler(默认)。
显存不足时支持三种卸载策略:sequential_cpu_offload(逐层 CPU 卸载)、cpu_offload(智能模型卸载)、group_offload(实验性块级卸载)。
| 项目 | 要求 |
|---|---|
| Python | 3.11 |
| GPU | NVIDIA(CUDA 12.4+,推荐 12.6) |
| 显存 | ≥12GB(无卸载时) |
| 磁盘 | 模型权重约 7GB |
# 克隆到 ComfyUI custom_nodes
cd ComfyUI/custom_nodes
git clone https://github.com/Yuan-ManX/ComfyUI-OmniGen2.git
# 创建独立 conda 环境(推荐)
conda create -n omnigen2 python=3.11 && conda activate omnigen2
# 安装 PyTorch(CUDA 12.4)
pip install torch==2.6.0 torchvision --extra-index-url https://download.pytorch.org/whl/cu124
# 安装依赖
pip install -r requirements.txt
# 安装 flash-attention(需编译)
pip install flash-attn==2.7.4.post1 --no-build-isolation
# PyTorch 从上海交大镜像安装
pip install torch==2.6.0 torchvision --index-url https://mirror.sjtu.edu.cn/pytorch-wheels/cu124
# 其余依赖从清华镜像安装
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
pip install flash-attn==2.7.4.post1 --no-build-isolation -i https://pypi.tuna.tsinghua.edu.cn/simple
1. 显存门槛较高:7B 级别的模型对显存要求不低。CPU offload 速度极慢,GPU 仍是唯一实用的推理方式。
2. flash-attn 安装困难:flash-attn 依赖 ninja 编译,在部分网络环境下安装容易失败。
3. 仅支持英文提示词:由于 VLM 基于 Qwen2-VL 架构,英文理解效果最佳,中文提示词可能无法充分发挥模型能力。
4. 非"一键部署":需要预先搭建 ComfyUI 环境,对纯新手来说有一定门槛。
OmniGen2 体现了 2025 年 AI 生成模型的一个重要趋势——从"专模型专任务"走向"统一架构多任务"。这种范式降低了用户的管理成本,也为未来更强大的多模态智能体奠定了基础。
从社区反响看,VectorSpaceLab 在 2025 年 9 月进一步推出了 OmniGen2-EditScore(基于 RL 的图像编辑奖励模型),将编辑任务的质量推向新高度。ComfyUI-OmniGen2 作为桥接层,让开源社区能够以更低门槛接触这些前沿模型。
适合谁使用?
不适合谁?
本分析基于 2026 年 8 月采集的项目数据,模型版本和功能可能随更新变化。