Views
No views yet
1from transformers import AutoProcessor, PaliGemmaForConditionalGeneration
2from PIL import Image
3import requests
4
5model_id = "merve/paligemma2-3b-vqav2"
6model = PaliGemmaForConditionalGeneration.from_pretrained(model_id)
7processor = AutoProcessor.from_pretrained("google/paligemma2-3b-pt-224")
8
9prompt = "What is behind the cat?"
10image_file = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/cat.png?download=true"
11raw_image = Image.open(requests.get(image_file, stream=True).raw)
12
13inputs = processor(prompt, raw_image.convert("RGB"), return_tensors="pt")
14output = model.generate(**inputs, max_new_tokens=20)
15
16print(processor.decode(output[0], skip_special_tokens=True)[len(prompt):])
17# gramophone