Views
No views yet
1import torch
2from transformers import VisionEncoderDecoderModel, ViTImageProcessor, AutoTokenizer
3from PIL import Image
4
5device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
6model_id = "atasoglu/vit-base-patch16-224-turkish-gpt2"
7img = Image.open("example.jpg")
8
9feature_extractor = ViTImageProcessor.from_pretrained(model_id)
10tokenizer = AutoTokenizer.from_pretrained(model_id)
11model = VisionEncoderDecoderModel.from_pretrained(model_id)
12model.to(device)
13
14features = feature_extractor(images=[img], return_tensors="pt")
15pixel_values = features.pixel_values.to(device)
16
17generated_captions = tokenizer.batch_decode(
18 model.generate(pixel_values, max_new_tokens=20),
19 skip_special_tokens=True,
20)
21
22print(generated_captions)