Views
No views yet
1from transformers import VisionEncoderDecoderModel, ViTFeatureExtractor, AutoTokenizer
2from PIL import Image
3
4pretrained = "snzhang/FilmTitle-Beit-GPT2"
5model = VisionEncoderDecoderModel.from_pretrained(pretrained)
6feature_extractor = ViTFeatureExtractor.from_pretrained(pretrained)
7tokenizer = AutoTokenizer.from_pretrained(pretrained)
8
9image_path = "your image path"
10image = Image.open(image_path)
11if image.mode != "RGB":
12 image = image.convert("RGB")
13pixel_values = feature_extractor(images=image, return_tensors="pt").pixel_values
14
15output_ids = model.generate(pixel_values, **gen_kwargs)
16preds = tokenizer.batch_decode(output_ids, skip_special_tokens=True)
17preds = [pred.strip() for pred in preds]
18print(preds)