Views
No views yet
1from transformers import BlipProcessor, BlipForConditionalGeneration
2from PIL import Image
3import torch
4
5model_id = "muhammedaydiiinnn/blip-flickr8k-caption"
6
7processor = BlipProcessor.from_pretrained(model_id)
8model = BlipForConditionalGeneration.from_pretrained(model_id)
9
10image = Image.open("test.jpg").convert("RGB")
11inputs = processor(images=image, return_tensors="pt")
12
13with torch.inference_mode():
14 output = model.generate(**inputs, max_new_tokens=30)
15
16caption = processor.decode(output[0], skip_special_tokens=True)
17print(caption)