Views
No views yet
1max_pixels 401408
2per_device_train_batch_size: 1
3gradient_accumulation_steps: 1
4learning_rate: 1.0e-5
5
6num_train_epochs: 1.0
7lr_scheduler_type: cosine
8bf16: true
9flash_attn: fa2transformers library:1from transformers import AutoProcessor, Qwen2_5_VLForConditionalGeneration
2import torch
3from qwen_vl_utils import process_vision_info
4
5MODEL_ID = "Curr-ReFT-3B"
6processor = AutoProcessor.from_pretrained(MODEL_ID, trust_remote_code=True)
7model = Qwen2_5_VLForConditionalGeneration.from_pretrained(
8 MODEL_ID,
9 trust_remote_code=True,
10 torch_dtype=torch.bfloat16
11).to("cuda").eval()
12
13messages = [
14 {
15 "role": "user",
16 "content": [
17 {"type": "image", "image": "<your image path>"},
18 {"type": "text", "text": "Hint: Please answer the question and provide the final answer at the end. Question: Which number do you have to write in the last daisy?"},
19 ],
20 }
21]
22
23# Preparation for inference
24text = processor.apply_chat_template(
25 messages, tokenize=False, add_generation_prompt=True
26)
27image_inputs, video_inputs = process_vision_info(messages)
28inputs = processor(
29 text=[text],
30 images=image_inputs,
31 videos=video_inputs,
32 padding=True,
33 return_tensors="pt",
34)
35inputs = inputs.to(model.device)
36
37generated_ids = model.generate(**inputs, max_new_tokens=4096)
38generated_ids_trimmed = [
39 out_ids[len(in_ids) :] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)
40]
41output_text = processor.batch_decode(
42 generated_ids_trimmed, skip_special_tokens=True, clean_up_tokenization_spaces=False
43)
44print(output_text)