Views
No views yet
1from transformers import AutoProcessor, AutoModelForVision2Seq
2from peft import PeftModel
3from PIL import Image
4import torch
5
6base_id = "Qwen/Qwen3-VL-2B-Instruct"
7adapter_id = "graahand/qwen-vl-2b-lora"
8
9model = AutoModelForVision2Seq.from_pretrained(base_id, device_map="auto")
10model = PeftModel.from_pretrained(model, adapter_id)
11processor = AutoProcessor.from_pretrained(adapter_id, trust_remote_code=True)
12
13image = Image.open("your_image.png").convert("RGB")
14messages = [
15 {"role": "system", "content": "You are a helpful assistant."},
16 {
17 "role": "user",
18 "content": [
19 {"type": "image"},
20 {"type": "text", "text": "Extract all key-value pairs from this document."},
21 ],
22 },
23]
24
25prompt = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
26inputs = processor(text=[prompt], images=[image], return_tensors="pt").to(model.device)
27
28with torch.no_grad():
29 out = model.generate(**inputs, max_new_tokens=128)
30
31print(processor.tokenizer.decode(out[0], skip_special_tokens=True))image_path<TAB>key: value