UniPic
一个模型搞定图像生成、编辑与理解,UniPic三代演进覆盖自回归、Diffusion后训练、CM+D
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一个模型搞定图像生成、编辑与理解,UniPic三代演进覆盖自回归、Diffusion后训练、CM+D
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:摄影师李明在外拍时拍到一组素材,其中一张照片里路人入镜,另一张构图完美但光线不足,还有一张的色彩风格正是他想要的。现在他不需要打开 Photoshop,不需要学习图层、蒙版、曲线,只需要用一句话描述他的想法——"把这张图里的路人去掉,把色调调成第二张的风格"——就能得到结果。这就是 Skywork AI 团队开发 UniPic 系列想要解决的核心问题。
UniPic 诞生于 2025-2026 年多模态大模型飞速发展的时期。传统的图像编辑工具(如 Photoshop)功能强大但门槛高;Diffusion 模型(如 Stable Diffusion)的局部编辑能力有限;商用图像编辑 API(如 DALL-E Image Editing)虽然体验好但不开源、不可私有部署。Skywork AI(昆仑万维团队)认为,真正的多模态统一应该让一个模型同时理解图像、生成图像、编辑图像,而不是三个独立模型拼接。于是从 2025 年 7 月开始,相继开源了 UniPic-1(自回归统一模型)、UniPic-2(Diffusion 后训练方案)、UniPic-3(多图编辑 SOTA)三代产品,GitHub 累计获得超过 870 颗星。

UniPic-1 是整个系列的起点,采用了**自回归(Autoregressive, AR)**架构,1.5B 参数的单一 Transformer 同时处理图像理解和图像生成任务。其核心设计理念来自"视觉 Token 化"思路:图像通过 VAE(Variational Autoencoder)编码为离散 Token,模型以类似 LLM 的方式逐个预测下一个视觉 Token。
从代码结构来看,UniPic-1 实现了三种模型变体:skywork_unipic_dev.py(开发版,模块化程度最高)、skywork_unipic_ori.py(原始版,稳定可靠)、skywork_unipic_sigclip.py(集成 SigLIP 视觉编码器的版本)。训练框架使用 mmengine(OpenMMLab 的训练框架)+ 自定义 DiffLoss(Diffusion Loss),在 gaussian_diffusion.py 中实现了完整的 DDPM 训练流程。数据层面,通过 multi_source_sampler.py 实现多源数据混合采样,同时支持 text-to-image 生成任务和 caption 生成(理解任务)。
在 GenEval 基准测试中,UniPic-1 的 Overall 得分为 0.75,超过了 Show-o、Lumina-Next 等竞品,验证了自回归统一建模的有效性。
UniPic-2 在 UniPic-1 的基础上,引入 SD3.5M(Stable Diffusion 3.5 Medium) 作为基础生成模型,通过后训练(Post-Training)技术实现图像生成与编辑的统一。核心创新在于两项技术:
PDTR(Progressive Dual-Task Reinforcement):渐进式双任务强化学习,通过分阶段 RL 让图像生成和图像编辑能力协同提升,而不产生任务间干扰。这是业界首次用强化学习同时提升生成质量和编辑一致性。
MetaQuery 范式:模块化的连接器架构,通过参数高效的适配器(基于 PEFT/LoRA)将预训练视觉编码器与 SD3 Transformer 对齐,无需从头训练即可复用多模态理解能力。

UniPic-2 的 Gradio Web UI(run_gradio.py)实现了完整的交互界面,支持 INT4 量化(BitsAndBytes)和 CPU Offload,降低了部署门槛——理论上 16GB 显存的 GPU 即可运行。
UniPic-3 是整个系列的核心亮点,开源 SOTA 多图编辑模型,arXiv:2601.15664,于 2026 年 1 月发布。
核心技术:一致性模型 + 分布匹配蒸馏(CM + DMD)
UniPic-3 基于 Qwen-Image-Edit 作为基础模型,采用两阶段蒸馏策略:
第一阶段:Consistency Model(CM)训练——将原始 50 步 Diffusion 模型蒸馏为 8 步的一致性模型(Consistency Model),直接学习从噪声到图像的映射,任意噪声起点都能一步到达生成轨迹上的同一点。
第二阶段:Distribution-Matching Distillation(DMD)训练——在 CM 基础上进一步蒸馏,通过分布匹配损失消除 CM 的累积误差,8 步推理即可达到原版 50 步的质量,实现 12.5 倍加速。
关键特性: 支持 1-6 张输入图像的灵活组合,支持任意输出分辨率;统一的架构同时处理单图编辑和多图合成;训练数据为 21.5 万条精选多图组合样本。
提供三个模型权重:Base Model(50 步推理)、Consistency Model(8 步)、DMD Model(8 步,推荐使用)。
从代码实现来看,UniPic 系列的技术栈非常清晰:
| 层级 | 技术选型 |
|---|---|
| 深度学习框架 | PyTorch 2.6.0, mmengine |
| Transformer 库 | transformers 4.45-4.56, accelerate |
| 扩散模型框架 | diffusers 0.36 (开发版) |
| 参数高效微调 | PEFT (LoRA/Adapter) |
| 视觉编码器 | SigLIP, Qwen-VL, CLIP (OpenAI + OpenCLIP) |
| 多模态大模型 | Qwen-Image-Edit, Qwen2-VL |
| Web UI | Gradio 4.44 |
| 训练加速 | Flash Attention 2.6/2.7, FSDP |
| 量化部署 | BitsAndBytes (INT4/INT8) |
整体项目以 Python 为核心,无 Dockerfile,需手动配置 Python 环境,适合有一定 ML 经验的开发者部署。
以 UniPic-3 为例:
git clone https://github.com/SkyworkAI/UniPic.git
cd UniPic/UniPic-3
conda create -n unipic3 python==3.10 && conda activate unipic3
# 安装 PyTorch(根据 CUDA 版本调整)
pip install torch==2.6.0+cu118 torchvision==0.21.0+cu118 --index-url https://download.pytorch.org/whl/cu118
pip install -r requirements.txt --no-deps
pip install transformers diffusers accelerate peft safetensors huggingface-hub
pip install gradio pillow opencv-python imageio mmengine einops flash-attn
# 运行 Web UI
cd gradio_demo && python app.py
GPU 需求:DMD 模型推理至少需要 16GB 显存(RTX 3090 或更高),完整训练需要 A100 80GB 多卡环境。
UniPic 的出现代表了 2025-2026 年图像生成领域几个重要趋势的交汇:
趋势一:统一多模态模型取代专用模型——从 Janus、Emu3 到 UniPic,业界越来越倾向于用一个模型同时处理理解和生成。
趋势二:Diffusion 蒸馏成为工程落地主流——UniPic-3 的 CM + DMD 两阶段蒸馏将 50 步推理压缩到 8 步,12.5 倍加速意味着在消费级 GPU 上实时交互成为可能。
趋势三:开源多图编辑填补空白——此前开源社区在多图编辑领域几乎没有可用的高质量方案,UniPic-3 填补了这一空白。
参考资源:论文 UniPic-1 (arXiv:2508.03320), UniPic-2 (arXiv:2509.04548), UniPic-3 (arXiv:2601.15664);模型权重:HuggingFace Collection;官网:https://unipic-v2.github.io/