Views
No views yet
1from transformers import AutoModelForVision2Seq, AutoImageProcessor, AutoTokenizer
2from PIL import Image
3import numpy as np
4
5
6model_id = "grascii/gregg-vision-v0.2.1"
7model = AutoModelForVision2Seq.from_pretrained(model_id)
8processor = AutoImageProcessor.from_pretrained(model_id)
9tokenizer = AutoTokenizer.from_pretrained(model_id)
10
11
12def generate_grascii(image: Image):
13 # convert image to a single channel
14 grayscale = image.convert("L")
15
16 # prepare processor input
17 images = np.array([grayscale])
18
19 # preprocess image
20 pixel_values = processor(images, return_tensors="pt").pixel_values
21
22 # generate token ids
23 ids = model.generate(pixel_values, max_new_tokens=12)[0]
24
25 # decode ids and return grascii
26 return tokenizer.decode(ids, skip_special_tokens=True)transformers v4.47.0, the model is incompatible with pipeline due to the
model's single channel image input.