Views
No views yet
1pip install torch transformers accelerate qwen-vl-utils pillow
2git clone https://github.com/HusseinLezzaik/Qwen-Click-DiT.git
3cd Qwen-Click-DiT1import torch
2from PIL import Image
3from transformers import AutoProcessor, AutoConfig
4from qwen_vl_utils import process_vision_info
5
6# Clone the repo first to get the model class
7from src.model import Qwen2_5_VLForClickPrediction
8
9# Load model
10model_id = "TESS-Computer/qwen-click-dit"
11config = AutoConfig.from_pretrained("Qwen/Qwen2.5-VL-3B-Instruct")
12config.dit_hidden_size = 512
13config.dit_num_layers = 6
14config.dit_num_heads = 8
15config.dit_dropout = 0.1
16config.num_inference_steps = 16
17
18model = Qwen2_5_VLForClickPrediction.from_pretrained(
19 model_id, config=config, torch_dtype=torch.bfloat16
20)
21model = model.to("cuda").eval()
22processor = AutoProcessor.from_pretrained("Qwen/Qwen2.5-VL-3B-Instruct")
23
24# Prepare input
25image = Image.open("screenshot.png").convert("RGB")
26prompt = "Click on the search button"
27
28messages = [{
29 "role": "user",
30 "content": [
31 {"type": "image", "image": image, "min_pixels": 200704, "max_pixels": 401408},
32 {"type": "text", "text": prompt},
33 ],
34}]
35
36text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
37image_inputs, video_inputs, video_kwargs = process_vision_info(messages, return_video_kwargs=True)
38inputs = processor(text=text, images=image_inputs, videos=video_inputs, return_tensors="pt", **video_kwargs)
39inputs = {k: v.to("cuda") if torch.is_tensor(v) else v for k, v in inputs.items()}
40
41# Predict click coordinates
42with torch.no_grad():
43 click_xy = model.predict(**inputs)
44
45x, y = click_xy[0].cpu().tolist()
46print(f"Normalized: ({x:.4f}, {y:.4f})")
47print(f"Pixels: ({int(x * image.width)}, {int(y * image.height)})")| Component | Value |
|---|---|
| DiT Hidden Size | 512 |
| DiT Layers | 6 |
| DiT Heads | 8 |
| Inference Steps | 16 |
1@misc{lezzaik2026qwenclickdit,
2 title = {Qwen-Click-DiT: Vision-Language Model with Diffusion Transformer for GUI Click Prediction},
3 author = {Lezzaik, Hussein},
4 year = {2026},
5 howpublished = {\url{https://github.com/HusseinLezzaik/Qwen-Click-DiT}},
6}