Views
No views yet
1import requests
2from PIL import Image
3from transformers import BlipProcessor, BlipForConditionalGeneration
4processor = BlipProcessor.from_pretrained("Revrse/icon-captioning-model")
5model = BlipForConditionalGeneration.from_pretrained("Revrse/icon-captioning-model")
6img_url = 'https://storage.googleapis.com/sfr-vision-language-research/BLIP/demo.jpg'
7raw_image = Image.open(requests.get(img_url, stream=True).raw).convert('RGB')
8# conditional image captioning
9text = "a photography of"
10inputs = processor(raw_image, text, return_tensors="pt")
11out = model.generate(**inputs)
12print(processor.decode(out[0], skip_special_tokens=True))
13# unconditional image captioning
14inputs = processor(raw_image, return_tensors="pt")
15out = model.generate(**inputs)
16print(processor.decode(out[0], skip_special_tokens=True))