BK-SDM
通过结构化剪枝+知识蒸馏,将Stable Diffusion模型体积压缩48%,可在消费级GPU上运
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
通过结构化剪枝+知识蒸馏,将Stable Diffusion模型体积压缩48%,可在消费级GPU上运
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你在一个预算有限的工作站上,想要生成一张精美的AI画作,却因为模型太大,显存爆满、程序崩溃。这种痛苦每一个研究Stable Diffusion的人都不陌生——原始SD-v1.4的U-Net模型参数量高达8.6亿,整个SD系统超过10亿参数,普通人根本玩不起。
2023年,韩国AI公司Nota(现NetsPresso)的团队决定做一件事:把Stable Diffusion"瘦"下来。他们提出了BK-SDM(Block-removed Knowledge-distilled Stable Diffusion),通过结构化剪枝与知识蒸馏的结合,在显著压缩模型的同时保持生成质量。这项成果最终发表于计算机视觉顶会ECCV 2024,并在ICCV 2023 Demo Track和ICML 2023 ES-FoMo Workshop上做了早期演示。

图1:BK-SDM 对 U-Net 架构的渐进式压缩策略(来源:论文官方MODEL_CARD)
Stable Diffusion的核心是U-Net,它负责去噪过程。BK-SDM团队发现,U-Net中的残差块(Residual Blocks)和注意力块(Attention Blocks)存在大量冗余——某些块去掉后,模型仍然能"凑合"工作。关键问题是如何优雅地裁剪这些块,同时保证输出质量。
BK-SDM设计了三种渐进式剪枝策略:
这种"层层剥皮"的策略,让开发者可以根据硬件条件灵活选择模型大小。
剪枝后的学生网络需要恢复能力。BK-SDM采用多层蒸馏策略:

图2:BK-SDM 的知识蒸馏预训练流程(来源:论文官方MODEL_CARD)
令人惊讶的是,训练数据量非常小——仅用21.3万对(LAION-Aesthetics V2 6.5+)图像-文本对,在单张A100 80GB GPU上训练5万步,就能得到一个可用的压缩模型。这意味着普通研究机构也能复现。
| 模型 | FID ↓ | IS ↑ | CLIP Score | 参数量 |
|---|---|---|---|---|
| SD v1.4(原始) | 12.21 | 32.71 | 0.2959 | 1.04B |
| BK-SDM-Base | 13.56 | 31.22 | 0.2911 | 0.76B |
| BK-SDM-Small | 13.90 | 31.01 | 0.2902 | 0.66B |
| BK-SDM-Tiny | 14.33 | 30.79 | 0.2891 | 0.50B |
BK-SDM-Tiny的参数量仅为原始SD的48%,但FID指标差距仅约2个点。对于iPhone 14上的Core ML部署场景(苹果官方4秒出图),这种精度损失完全可接受。
BK-SDM的代码库完全基于HuggingFace Diffusers构建,核心依赖为:
torch==2.0.1
transformers==4.27.4
diffusers==0.15.0
open_clip_torch==2.18.0
accelerate==0.18.0
peft==0.2.0
主要模块分工清晰:
kd_train_text_to_image.py:知识蒸馏训练核心,包含蒸馏损失计算和权重迁移逻辑count_macs_params.py:用thop库计算模型参数量和MACs,供对比分析generate.py / generate_single_prompt.py:推理脚本,调用自定义的InferencePipelinedreambooth_finetune.py:支持DreamBooth微调,使用PEFT(LoRA)做轻量微调eval_clip_score.py:用OpenCLIP评估CLIP分数(ViT-g/14)utils/inference_pipeline.py:封装Diffusers Pipeline,提供统一的推理接口权重发布在HuggingFace Hub:nota-ai/bk-sdm-base、nota-ai/bk-sdm-small、nota-ai/bk-sdm-tiny等系列。
diffusers==0.15.0等旧版本库,新版Diffusers可能有API不兼容问题BK-SDM的意义不仅在于论文本身,更在于它代表了一个方向——"大模型压缩以适配边缘设备"。从苹果Core ML4秒推理、到移动端部署、再到嵌入式设备,这条路正在被BK-SDM、LCM(Latent Consistency Models)等技术逐步打通。Nota公司后续还推出了EdgeFusion(CVPR 2024 Workshop),将BK-SDM-Tiny与LCM结合,进一步加速推理。
对于普通AI爱好者而言,BK-SDM-Small是一个很好的切入点:既能在消费级GPU上训练,又能以可接受的推理速度生成高质量图片。上手门槛比原始SD低很多,值得一试。