Views
No views yet
facebook/deit-base-distilled-patch16-224NlpHUST/gpt2-vietnameseVisionEncoderDecoderModel1from PIL import Image
2import torch
3from transformers import AutoImageProcessor, AutoTokenizer, VisionEncoderDecoderModel
4
5model_id = "slyviee/vietnamese-image-captioning"
6device = "cuda" if torch.cuda.is_available() else "cpu"
7
8tokenizer = AutoTokenizer.from_pretrained(model_id, use_fast=True)
9image_processor = AutoImageProcessor.from_pretrained("facebook/deit-base-distilled-patch16-224")
10model = VisionEncoderDecoderModel.from_pretrained(model_id).to(device)
11model.eval()
12
13image = Image.open("image.jpg").convert("RGB")
14pixel_values = image_processor(images=image, return_tensors="pt").pixel_values.to(device)
15
16with torch.no_grad():
17 output_ids = model.generate(pixel_values, max_new_tokens=40, num_beams=4)
18
19caption = tokenizer.decode(output_ids[0], skip_special_tokens=True)
20print(caption)