qwen2.5-vl-gqa-ru-lora-v3 — русскоязычная visual question answering (VQA) модель на базе
Qwen2.5-VL-3B-Instruct. Модель дообучена методом LoRA на 30 000 примерах
train_balanced из
GQA-ru. В этой версии использованы русскоязычный обучающий промпт, больший LoRA-rank и дополнительные vision-проекции.
Это полная модель: LoRA-адаптер уже объединён с базовыми весами. Отдельно загружать Qwen/Qwen2.5-VL-3B-Instruct или подключать PEFT-адаптер не нужно.
1import torch
2from PIL import Image
3from transformers import AutoProcessor, Qwen2_5_VLForConditionalGeneration
4
5MODEL_ID = "qwen2.5-vl-gqa-ru-lora-v3" # или путь к локальной папке
6
7model = Qwen2_5_VLForConditionalGeneration.from_pretrained(
8 MODEL_ID,
9 torch_dtype=torch.bfloat16,
10 device_map="auto",
11).eval()
12processor = AutoProcessor.from_pretrained(MODEL_ID)
13
14image = Image.open("image.jpg").convert("RGB")
15question = "Какого цвета автомобиль?"
16
17messages = [{
18 "role": "user",
19 "content": [
20 {"type": "image", "image": image},
21 {
22 "type": "text",
23 "text": (
24 "Ответь на вопрос, используя изображение.\n"
25 "Дай только краткий ответ без объяснений.\n"
26 f"Вопрос: {question}\nОтвет:"
27 ),
28 },
29 ],
30}]
31
32text = processor.apply_chat_template(
33 messages,
34 tokenize=False,
35 add_generation_prompt=True,
36)
37inputs = processor(
38 text=[text],
39 images=[image],
40 padding=True,
41 return_tensors="pt",
42).to(model.device)
43
44with torch.inference_mode():
45 generated_ids = model.generate(
46 **inputs,
47 max_new_tokens=32,
48 do_sample=False,
49 )
50
51generated_ids = generated_ids[:, inputs.input_ids.shape[1]:]
52answer = processor.batch_decode(
53 generated_ids,
54 skip_special_tokens=True,
55 clean_up_tokenization_spaces=False,
56)[0]
57print(answer.strip())
Базовые веса были заморожены; во время обучения обновлялись только LoRA-параметры. Использовались gradient checkpointing и seed 42.
Модель предназначена для экспериментального и исследовательского русскоязычного VQA. Она лучше всего подходит для коротких фактических ответов об объектах, их атрибутах и отношениях на изображении.
Модель распространяется на условиях
Qwen Research License. Перед использованием также проверьте условия лицензий GQA-ru и MMBench-ru.