Views
No views yet
1from transformers import AutoModelForCausalLM, AutoProcessor
2from PIL import Image
3import re
4
5model = AutoModelForCausalLM.from_pretrained("sadasd67/florence2-coordinates", trust_remote_code=True)
6processor = AutoProcessor.from_pretrained("sadasd67/florence2-coordinates", trust_remote_code=True)
7
8image = Image.open("captcha.png")
9inputs = processor(text="<COORDINATE>", images=image, return_tensors="pt")
10generated = model.generate(**inputs, max_new_tokens=64)
11result = processor.batch_decode(generated, skip_special_tokens=False)[0]
12
13# Parse coordinates
14locs = [int(x) for x in re.findall(r'<loc_(\d+)>', result)]
15w, h = image.size
16coords = [(locs[i] * w / 999, locs[i+1] * h / 999) for i in range(0, len(locs), 2)]
17print(coords)<loc_XXX> (normalized 0-999)pixel_x = loc_value * image_width / 999