Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer, AutoProcessor
2from PIL import Image
3import torch
4
5# Load the specialized OMDA architecture
6model = AutoModelForCausalLM.from_pretrained("BINOMDA/OMDA-PROMPTER", trust_remote_code=True)
7tokenizer = AutoTokenizer.from_pretrained("BINOMDA/OMDA-PROMPTER")
8processor = AutoProcessor.from_pretrained("google/siglip-base-patch16-224") # The vision processor is for SigLIP
9
10# Generate description
11image = Image.open("your-image.jpg").convert("RGB")
12pixel_values = processor(images=image, return_tensors="pt").pixel_values.to(model.device)
13generated_ids = model.generate(pixel_values, max_new_tokens=800, pad_token_id=tokenizer.pad_token_id, eos_token_id=tokenizer.eos_token_id)
14description = tokenizer.decode(generated_ids[0], skip_special_tokens=True)
15print(description)