Views
No views yet
1import torch
2from PIL import Image
3from transformers import Qwen3VLForConditionalGeneration, AutoProcessor
4REPO_ID = "Geologi/qwen3vl-caption-imregis"
5model = Qwen3VLForConditionalGeneration.from_pretrained(
6 REPO_ID,
7 torch_dtype=torch.bfloat16,
8 device_map="auto",
9)
10processor = AutoProcessor.from_pretrained(REPO_ID)
11image = Image.open("example.png").convert("RGB")
12messages = [{
13 "role": "user",
14 "content": [
15 {"type": "image", "image": image},
16 {"type": "text", "text": "Descreva esta imagem em português"},
17 ],
18}]
19text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
20inputs = processor(text=[text], images=[image], return_tensors="pt").to(model.device)
21output = model.generate(**inputs, max_new_tokens=128)
22print(processor.batch_decode(output, skip_special_tokens=True)[0])peft import is required.