Views
No views yet
| Model | Params | HF Link |
|---|---|---|
| MultiHopSpatial-Qwen3-VL-4B-Instruct | 4B | 🤗 etri-vilab/MultiHopSpatial-Qwen3-VL-4B-Instruct |
| MultiHopSpatial-Qwen3-VL-8B-Instruct | 8B | 🤗 etri-vilab/MultiHopSpatial-Qwen3-VL-8B-Instruct |
| MultiHopSpatial-Qwen3-VL-32B-Instruct | 32B | 🤗 etri-vilab/MultiHopSpatial-Qwen3-VL-32B-Instruct |
| Base Model | Qwen3-VL-4B-Instruct |
| Architecture | Qwen3VLForConditionalGeneration |
| Training Method | GRPO (Group Relative Policy Optimization) |
| Training Data | MultihopSpatial-Train (6,791 samples) |
| Precision | bfloat16 |

1from transformers import Qwen3VLForConditionalGeneration, AutoProcessor
2from qwen_vl_utils import process_vision_info
3
4model = Qwen3VLForConditionalGeneration.from_pretrained(
5 "etri-vilab/MultiHopSpatial-Qwen3-VL-4B-Instruct",
6 torch_dtype="auto",
7 device_map="auto",
8)
9processor = AutoProcessor.from_pretrained("etri-vilab/MultiHopSpatial-Qwen3-VL-4B-Instruct")
10
11messages = [
12 {
13 "role": "user",
14 "content": [
15 {"type": "image", "image": "your_image.jpg"},
16 {"type": "text", "text": "From the perspective of the person wearing a red shirt, which object is on their left? (a) chair (b) table (c) lamp (d) bookshelf. And provide the bounding box coordinate of the region related to your answer."},
17 ],
18 }
19]
20
21text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
22image_inputs, video_inputs = process_vision_info(messages)
23inputs = processor(
24 text=[text],
25 images=image_inputs,
26 videos=video_inputs,
27 padding=True,
28 return_tensors="pt",
29).to(model.device)
30
31generated_ids = model.generate(**inputs, max_new_tokens=2048)
32output_text = processor.batch_decode(
33 generated_ids[:, inputs.input_ids.shape[1]:], skip_special_tokens=True
34)
35print(output_text[0])1@inproceedings{lee2026multihopspatial,
2 title={MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Models},
3 author={Lee, Youngwan and Jang, Soojin and Cho, Yoorhim and Lee, Seunghwan and Lee, Yong-Ju and Hwang, Sung Ju},
4 booktitle={European Conference on Computer Vision (ECCV)},
5 year={2026}
6}