Views
No views yet
CompVis/stable-diffusion-v1-4 Stable Diffusion pipeline, trained using natural English captions from the Flickr8k dataset. It enhances generation quality for everyday, human-centered scenarios like actions, objects, and environmental scenes.✅ Only the U-Net was fine-tuned. The VAE, tokenizer, and text encoder remain from the original base model.
CompVis/stable-diffusion-v1-4unet only1from diffusers import StableDiffusionPipeline, UNet2DConditionModel, AutoencoderKL, DDPMScheduler
2from transformers import CLIPTextModel
3import torch
4import matplotlib.pyplot as plt
5
6# Load base components
7print("Loading VAE and text encoder from base SD...")
8vae = AutoencoderKL.from_pretrained("CompVis/stable-diffusion-v1-4", subfolder="vae", torch_dtype=torch.float16).to(device)
9text_encoder = CLIPTextModel.from_pretrained("openai/clip-vit-large-patch14", torch_dtype=torch.float16).to(device)
10
11# Load fine-tuned UNet from Hugging Face
12print("Loading fine-tuned UNet from Hugging Face (srishticrai/unet-flickr8k)...")
13fine_tuned_unet = UNet2DConditionModel.from_pretrained(
14 "srishticrai/unet-flickr8k",
15 torch_dtype=torch.float16
16).to(device)
17
18# Rebuild the pipeline
19pipe = StableDiffusionPipeline.from_pretrained(
20 "CompVis/stable-diffusion-v1-4",
21 unet=fine_tuned_unet,
22 vae=vae,
23 text_encoder=text_encoder,
24 torch_dtype=torch.float16
25).to(device)
26
27pipe.set_progress_bar_config(disable=False)
28pipe.enable_attention_slicing()
29
30# Ask for prompt
31prompt = input("Enter a prompt to generate an image: ")
32
33# Generate image
34image = pipe(
35 prompt,
36 guidance_scale=10.0,
37 num_inference_steps=50
38)
39
40image.show()