Views
No views yet
1image_resolution: 518
2cutoff_len: 8192
3per_device_train_batch_size: 1
4gradient_accumulation_steps: 16
5learning_rate: 1.0e-5
6
7num_train_epochs: 1.0
8lr_scheduler_type: cosine
9warmup_ratio: 0.05
10bf16: true
11flash_attn: fa2
transformers library:1from transformers import AutoProcessor, Qwen2_5_VLForConditionalGeneration
2import torch
3from qwen_vl_utils import process_vision_info
4
5MODEL_ID = "Fancy-MLLM/R1-Onevision-7B"
6processor = AutoProcessor.from_pretrained(MODEL_ID, trust_remote_code=True)
7model = Qwen2_5_VLForConditionalGeneration.from_pretrained(
8 MODEL_ID,
9 trust_remote_code=True,
10 torch_dtype=torch.bfloat16
11).to("cuda").eval()
12
13messages = [
14 {
15 "role": "user",
16 "content": [
17 {"type": "image", "image": "<your image path>"},
18 {"type": "text", "text": "Hint: Please answer the question and provide the final answer at the end. Question: Which number do you have to write in the last daisy?"},
19 ],
20 }
21]
22
23# Preparation for inference
24text = processor.apply_chat_template(
25 messages, tokenize=False, add_generation_prompt=True
26)
27image_inputs, video_inputs = process_vision_info(messages)
28inputs = processor(
29 text=[text],
30 images=image_inputs,
31 videos=video_inputs,
32 padding=True,
33 return_tensors="pt",
34)
35inputs = inputs.to(model.device)
36
37generated_ids = model.generate(**inputs, max_new_tokens=4096)
38generated_ids_trimmed = [
39 out_ids[len(in_ids) :] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)
40]
41output_text = processor.batch_decode(
42 generated_ids_trimmed, skip_special_tokens=True, clean_up_tokenization_spaces=False
43)
44print(output_text)