Views
No views yet
1from transformers import VisionEncoderDecoderModel, ViTFeatureExtractor, GPT2Tokenizer
2from PIL import Image
3
4model = VisionEncoderDecoderModel.from_pretrained("lokibots/vit-patch16-1280-gpt2-large-image-summary")
5feature_extractor = ViTFeatureExtractor.from_pretrained("lokibots/vit-patch16-1280-gpt2-large-image-summary")
6tokenizer = GPT2Tokenizer.from_pretrained('gpt2-large')
7
8image = Image.open("image_file").convert("RGB")
9pixel_values = feature_extractor(images=image, return_tensors="pt").pixel_values
10
11gen_kwargs = {"max_length": 1024, "num_beams": 4}
12output_ids = model.generate(pixel_values, **gen_kwargs)
13preds = tokenizer.batch_decode(output_ids, skip_special_tokens=True)