Views
No views yet
pip install transformers peft torch qwen-vl-utils1import torch
2from transformers import Qwen2VLForConditionalGeneration, AutoProcessor, BitsAndBytesConfig
3from peft import PeftModel
4from qwen_vl_utils import process_vision_info
5
6# Load base model
7bnb_config = BitsAndBytesConfig(
8 load_in_4bit=True,
9 bnb_4bit_quant_type="nf4",
10 bnb_4bit_compute_dtype=torch.float16,
11 bnb_4bit_use_double_quant=True
12)
13
14base_model = Qwen2VLForConditionalGeneration.from_pretrained(
15 "Qwen/Qwen2-VL-7B-Instruct",
16 quantization_config=bnb_config,
17 device_map="auto"
18)
19
20# Load LoRA adapter
21model = PeftModel.from_pretrained(base_model, "muk0644/Urban-Traffic-Qwen2-VL2")
22
23# Load processor
24processor = AutoProcessor.from_pretrained("Qwen/Qwen2-VL-7B-Instruct")
25
26# Inference
27messages = [
28 {
29 "role": "user",
30 "content": [
31 {"type": "image", "image": "image.jpg"},
32 {"type": "text", "text": "Count the visible Objects"}
33 ]
34 }
35]
36
37text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
38image_inputs, video_inputs = process_vision_info(messages)
39inputs = processor(text=[text], images=image_inputs, videos=video_inputs, padding=True, return_tensors="pt").to(model.device)
40
41with torch.no_grad():
42 output_ids = model.generate(**inputs, max_new_tokens=512)
43
44generated_ids = [output_ids[len(input_ids):] for input_ids, output_ids in zip(inputs.input_ids, output_ids)]
45response = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
46print(response)