Views
No views yet
1import torch
2from transformers import Qwen2_5_VLForConditionalGeneration, AutoTokenizer, AutoProcessor
3from qwen_vl_utils import process_vision_info
4
5model = Qwen2_5_VLForConditionalGeneration.from_pretrained(
6 "jihyoung/AQuA-Qwen",
7 torch_dtype=torch.bfloat16,
8 attn_implementation="flash_attention_2",
9 device_map="auto",
10)
11
12processor = AutoProcessor.from_pretrained("jihyoung/AQuA-Qwen")
13
14messages = [
15 {
16 "role": "user",
17 "content": [
18 {
19 "type": "image",
20 "image": "http://images.cocodataset.org/train2017/000000539311.jpg",
21 },
22 {"type": "text", "text": "What color is this bat?"},
23 ],
24 }
25]
26
27text = processor.apply_chat_template(
28 messages, tokenize=False, add_generation_prompt=True
29)
30image_inputs, video_inputs = process_vision_info(messages)
31inputs = processor(
32 text=[text],
33 images=image_inputs,
34 videos=video_inputs,
35 padding=True,
36 return_tensors="pt",
37)
38inputs = inputs.to("cuda")
39
40generated_ids = model.generate(**inputs, max_new_tokens=512)
41generated_ids_trimmed = [
42 out_ids[len(in_ids):] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)
43]
44output_text = processor.batch_decode(
45 generated_ids_trimmed, skip_special_tokens=True, clean_up_tokenization_spaces=False
46)
47print(output_text[0].strip())1@inproceedings{
2 jang2026aqua,
3 title={{AQ}uA: Toward Strategic Response Generation for Ambiguous Visual Questions},
4 author={Jihyoung Jang and Hyounghun Kim},
5 booktitle={The Fourteenth International Conference on Learning Representations},
6 year={2026},
7 url={https://openreview.net/forum?id=7b1MpD6IF8}
8}