1import torch
2from diffusers import StableDiffusionPipeline
3
4pipe = StableDiffusionPipeline.from_pretrained("nota-ai/bk-sdm-tiny-2m", torch_dtype=torch.float16)
5pipe = pipe.to("cuda")
6
7prompt = "a black vase holding a bouquet of roses"
8image = pipe(prompt).images[0]
9
10image.save("example.png")| Model | FID↓ | IS↑ | CLIP Score↑ (ViT-g/14) | # Params, U-Net | # Params, Whole SDM |
|---|---|---|---|---|---|
| Stable Diffusion v1.4 | 13.05 | 36.76 | 0.2958 | 0.86B | 1.04B |
| BK-SDM-Base (Ours) | 15.76 | 33.79 | 0.2878 | 0.58B | 0.76B |
| BK-SDM-Base-2M (Ours) | 14.81 | 34.17 | 0.2883 | 0.58B | 0.76B |
| BK-SDM-Small (Ours) | 16.98 | 31.68 | 0.2677 | 0.49B | 0.66B |
| BK-SDM-Small-2M (Ours) | 17.05 | 33.10 | 0.2734 | 0.49B | 0.66B |
| BK-SDM-Tiny (Ours) | 17.12 | 30.09 | 0.2653 | 0.33B | 0.50B |
| BK-SDM-Tiny-2M (Ours) | 17.53 | 31.32 | 0.2690 | 0.33B | 0.50B |



1@article{kim2023architectural,
2 title={On Architectural Compression of Text-to-Image Diffusion Models},
3 author={Kim, Bo-Kyeong and Song, Hyoung-Kyu and Castells, Thibault and Choi, Shinkook},
4 journal={arXiv preprint arXiv:2305.15798},
5 year={2023},
6 url={https://arxiv.org/abs/2305.15798}
7}1@article{Kim_2023_ICMLW,
2 title={BK-SDM: Architecturally Compressed Stable Diffusion for Efficient Text-to-Image Generation},
3 author={Kim, Bo-Kyeong and Song, Hyoung-Kyu and Castells, Thibault and Choi, Shinkook},
4 journal={ICML Workshop on Efficient Systems for Foundation Models (ES-FoMo)},
5 year={2023},
6 url={https://openreview.net/forum?id=bOVydU0XKC}
7}