Views
No views yet
1from transformers import AutoModelForImageTextToText, AutoProcessor
2
3model = AutoModelForImageTextToText.from_pretrained(
4 "h2oai/Qwen3-VL-2B-Instruct-GPTQ-Int4",
5 torch_dtype="auto",
6 device_map="auto",
7)
8processor = AutoProcessor.from_pretrained("h2oai/Qwen3-VL-2B-Instruct-GPTQ-Int4")
9
10messages = [
11 {"role": "user", "content": [
12 {"type": "image", "image": "https://example.com/image.png"},
13 {"type": "text", "text": "Describe this image."},
14 ]}
15]
16
17text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
18inputs = processor(text=[text], images=[image], return_tensors="pt", padding=True).to(model.device)
19output = model.generate(**inputs, max_new_tokens=128)
20print(processor.batch_decode(output, skip_special_tokens=True))