Views
No views yet

#load model
from unsloth import FastVisionModel
import torch
model, tokenizer = FastVisionModel.from_pretrained(
"manifestasi/Manifestasi-Qwen-VL-2b-ft",
load_in_4bit=True,
use_gradient_checkpointing="unsloth"
)
FastVisionModel.for_inference(model)
#run inference
from time import time
t1 = time()
#image kamu
image = img_resized
instruction = "apa tulisan ini ?"
messages = [
{"role": "user", "content": [
{"type": "image"},
{"type": "text", "text": instruction}
]}
]
input_text = tokenizer.apply_chat_template(messages, add_generation_prompt=True)
inputs = tokenizer(
image,
input_text,
add_special_tokens=False,
return_tensors="pt"
).to("cuda")
generated_ids = model.generate(
**inputs,
max_new_tokens=128,
use_cache=True,
temperature=1.5,
min_p=0.1
)
#Decode token yang dihasilkan menjadi string
output_text = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
t2 = time()
#Simpan output ke dalam string dan cetak hasilnya
print("Output text:", output_text)
print("waktu : ", (t2-t1))