SkyPaint-AI-Diffusion
原生支持中英文双语文本提示词的 Stable Diffusion 优化模型,基于 SkyCLIP 知识蒸馏技术实现,无需翻译直接生成现代艺术风格图像
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
原生支持中英文双语文本提示词的 Stable Diffusion 优化模型,基于 SkyCLIP 知识蒸馏技术实现,无需翻译直接生成现代艺术风格图像
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
如果让一个只会说英语的人突然用中文创作,他一定会感到束手无策——但 Stable Diffusion 曾经就面临这样的困境。2022 年,大多数文生图模型对中文提示词的理解能力几乎为零,用户必须先将中文翻译成蹩脚的英文才能勉强出图。由奇点智源(Singularity-AI)开发的 SkyPaint 正是为了解决这个痛点而生:它基于 Stable Diffusion 1.x 架构进行优化,让 AI 能够原生理解中英文双语提示词,生成具有现代艺术风格的高质量图像。
这个项目的核心价值不仅在于绘画本身,更在于其背后的 SkyCLIP 技术——一种高效蒸馏多语言 CLIP 模型的方法,可以让任何拥有普通算力的开发者训练出自己的中英双语 CLIP 模型。项目在 GitHub 已获得 646 Stars,HuggingFace 模型下载量持续增长,成为中文 AIGC 领域的重要开源资产。

图1:天工巧绘 SkyPaint 在线体验界面(来源:GitHub README)
SkyPaint 的技术架构由两个核心组件构成:提示词文本编码器(基于 SkyCLIP)和扩散生成模型(基于 Stable Diffusion)。理解 SkyCLIP 的设计思路,是掌握 SkyPaint 精髓的关键。
原始 Stable Diffusion 使用 OpenAI-CLIP 作为文本编码器,CLIP 的文本编码器基于 Transformer(GPT-2 架构),天然只支持英文。当用户输入中文时,CLIP 完全无法理解,导致生成的图像与预期不符。
解决这一问题的常规思路是训练一个全新的多语言 CLIP 模型,但这样做有两个显著缺点:
SkyCLIP 另辟蹊径,采用知识蒸馏策略:用已训练好的 OpenAI-CLIP 作为「教师模型」,仅训练一个多语言 BERT 作为「学生模型」,通过让学生模型的输出逐渐逼近教师模型来实现多语言能力的迁移。
SkyCLIP 的训练方法可以用一句话概括:冻结教师模型,训练学生模型,同时用翻译任务辅助对齐中英文。
具体来说:
这种方法的核心优势在于数据门槛大幅降低:训练数据只需要文本层面的中英文平行语料(不需要图文对),主要包括:

图2:SkyCLIP 技术框架(来源:GitHub README)
根据论文中的 Flickr30K-CN 零样本图文检索评测,SkyCLIP 在 R@1 指标上达到 58.8%(Text-to-Image),综合检索得分(MR)84.04,虽然略低于 CN-CLIP 的 87.87,但在训练数据量和算力消耗上具有显著优势。
在文本编码器优化完成后,SkyPaint 团队进一步优化了扩散模型本身。优化方向主要有两个:
用户只需在提示词前加上 sai-v1 art, 前缀,即可激活模型的现代艺术风格生成能力。
SkyPaint 的使用方式与标准 Stable Diffusion 完全兼容,核心依赖为 HuggingFace 的 diffusers 库。如果用户已有 SD 模型的运行经验,上手 SkyPaint 几乎零门槛。
from diffusers import StableDiffusionPipeline
device = 'cuda'
pipe = StableDiffusionPipeline.from_pretrained("path_to_SkyPaint_model").to(device)
prompts = [
'机械狗',
'城堡 大海 夕阳 宫崎骏动画',
'花落知多少',
'鸡你太美',
]
for prompt in prompts:
prompt = 'sai-v1 art, ' + prompt
image = pipe(prompt).images[0]
image.save("%s.jpg" % prompt)

图3:城堡 大海 夕阳 宫崎骏动画

图4:花落知多少

图5:半鸡半人,强壮

图6:鸡你太美
SkyPaint 作为基于 Stable Diffusion 的文生图模型,对硬件有明确要求:
| 配置项 | 最低要求 | 推荐配置 |
|---|---|---|
| GPU | NVIDIA GPU(4GB+ VRAM) | RTX 3090 / A100(8GB+ VRAM) |
| 内存 | 8GB RAM | 16GB+ RAM |
| 存储 | 5GB+ | 10GB+ |
| Python | 3.8+ | 3.10 |
| CUDA | 11.6+ | 11.8 / 12.x |
由于模型以 HuggingFace 权重形式发布,本地部署需要用户自行从 HuggingFace 下载约 4-5GB 的模型权重。对于没有足够硬件条件的用户,官方提供了两个替代方案:
sai-v1 art 前缀激活现代艺术风格生成,产出图像具有更强的艺术美感diffusers 库,需要稳定的网络环境访问 HuggingFace(国内可能需要代理)SkyPaint 的出现填补了中文开源文生图领域的一个重要空白。在其发布之前,中文用户如果想用 AI 生成符合中文语境的图像,通常需要依赖付费商业 API(如 Midjourney 中文版、文心一格等)或自行训练模型。SkyPaint 让普通开发者也有机会部署自己的中文文生图服务。
更重要的是,SkyCLIP 的训练方法具有更广泛的应用价值。知识蒸馏的思路可以被复制到其他语言对(如中日、中韩、中法等),为构建多语言多模态模型提供了可落地的工程方案。
奇点智源作为国内 AIGC 领域的重要参与者,除了 SkyPaint 之外,还在持续推进大模型、视频生成等多个方向的产品化。SkyPaint 作为其开源代表作之一,既是技术能力的展示,也是对开源社区的积极贡献。
本报告基于 GitHub 仓库 v1.0 版本分析,模型最新权重请参考 HuggingFace 官方页面。