Views
No views yet
1import torch
2import requests
3
4from PIL import Image
5from transformers import AutoProcessor, PaliGemmaForConditionalGeneration
6
7pretrained_model_id = "google/paligemma-3b-pt-224"
8finetuned_model_id = "pyimagesearch/finetuned_paligemma_vqav2_small"
9
10processor = AutoProcessor.from_pretrained(pretrained_model_id)
11finetuned_model = PaliGemmaForConditionalGeneration.from_pretrained(finetuned_model_id)
12
13prompt = "What is behind the cat?"
14image_file = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/cat.png?download=true"
15raw_image = Image.open(requests.get(image_file, stream=True).raw)
16
17inputs = processor(raw_image.convert("RGB"), prompt, return_tensors="pt")
18output = finetuned_model.generate(**inputs, max_new_tokens=20)
19
20print(processor.decode(output[0], skip_special_tokens=True)[len(prompt):])
21# gramophone