Prompt-Free-Diffusion
用一张参考图片替代文字提示词,驱动 AI 生成全新图像
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用一张参考图片替代文字提示词,驱动 AI 生成全新图像
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你手中只有一张随手拍的照片——没有精确的英文词汇、没有复杂的提示词工程——却能让 AI 精准地生成风格迁移图、controlnet 条件控制图、甚至动漫化作品。这不是科幻,而是 2023 年 CVPR 论文 Prompt-Free Diffusion 已经在做的事情。
Text-to-Image(T2I)扩散模型在过去两年席卷 AI 创作圈,但它们有一个根本性痛点:用户必须用精确的英文文本描述目标图像。这不是普通用户的强项——用什么样的词汇描述光影?怎样描述艺术风格?提示词工程(Prompt Engineering)本身已经成为一门独立技能。
这项研究来自伊利诺伊大学香槟分校(UIUC)和 SHI Lab,论文于 2023 年 5 月发布在 arXiv,2024 年被 CVPR 接收。核心思想是:用**视觉上下文编码器(SeeCoder)**彻底替代 CLIP 文本编码器,让模型"看图说话"而非"读词生成"。
SeeCoder 是本项目的核心创新。它的本质是一个预训练的视觉编码器(基于 OpenCLIP),能够从用户输入的参考图像中提取丰富的语义信息:构图、风格、色彩分布、主体姿态……这些信息被注入扩散模型的 U-Net backbone,取代传统 CLIP text embedding 的位置。
从代码结构来看(lib/model_zoo/),项目实现了完整的扩散模型管线:
pfd.py:主模型,组合 SeeCoder + SD U-Netseecoder.py:视觉编码器实现,基于 OpenCLIPautokl.py / openaimodel.py:LDM 扩散模型的 VAE 和 UNet 实现ddim.py:DDIM 采样器(加速推理)controlnet.py:复用 ControlNet 条件控制模块
图1:Prompt-Free Diffusion 整体架构。SeeCoder 从输入图像提取视觉上下文,替代 CLIP 文本编码器注入 U-Net。
项目提供了完整的预训练模型库(pretrained/),包含:
| 模型类型 | 数量 | 说明 |
|---|---|---|
| SeeCoder 变体 | 3 | SeeCoder / SeeCoder-PA / SeeCoder-Anime |
| SD 底模 | 7 | SD-v1.5 / OpenJourney / Deliberate / RealisticVision 等 |
| ControlNet | 13+ | canny / depth / hed / openpose / mlsa / normal 等 |
tools/get_controlnet.py 和 tools/model_conversion.py 提供模型下载与格式转换工具,配合 Gradio WebUI(app.py)实现一站式图像生成。
图2:SeeCoder 视觉编码器结构。
项目的一大亮点是生态级复用能力。SeeCoder 可以与 ControlNet、LoRA、T2I-Adapter 等主流扩散模型扩展无缝组合,无需重新训练。
图3:SeeCoder 广泛复用性。支持主流 SD 底模、ControlNet、LoRA、T2I-Adapter 等。
图4:Prompt-Free Diffusion 在多种场景下的生成效果对比。
图5:SeeCoder-Anime 模型驱动的动漫风格生成效果。
项目提供了开箱即用的 Gradio 界面(app.py),支持:
部署步骤:
conda create -n prompt-free-diffusion python=3.10
conda activate prompt-free-diffusion
pip install torch==2.0.0+cu117 torchvision==0.15.1 \\
--extra-index-url https://download.pytorch.org/whl/cu117
pip install -r requirements.txt
python app.py # 启动 Gradio 服务
⚠️ 注意:必须安装 CUDA 版本的 PyTorch(项目依赖 torch.cuda.is_available() 做设备选择),且需下载总计约数 GB 的 safetensors 预训练权重。
app.py 中的 latent_size 参数。Prompt-Free Diffusion 填补了 T2I 领域的一个重要空白——让视觉创作者无需掌握提示词技巧也能享受 AI 生成的红利。其 SeeCoder 即插即用的设计理念(可复用到任意 SD 底模和 ControlNet)也影响了一众后来者。
从技术演进角度看,项目代表了 2023-2024 年扩散模型"去文本化"趋势的一个分支:其他方向包括多模态大模型(GPT-4V 直接理解图像)、World Model 直接从视频学习等。SeeCoder 的方法更轻量,适合工程落地。
总结:如果你想快速体验"看图生图"的能力,且手头有 NVIDIA GPU,Prompt-Free Diffusion 是一个值得一试的完整解决方案。