Views
No views yet
1import torch
2from PIL import Image
3from transformers import AutoModelForCausalLM, AutoProcessor
4
5repo = "TrishanuDas/tayavision-multilingual"
6
7model = AutoModelForCausalLM.from_pretrained(repo, torch_dtype=torch.bfloat16, trust_remote_code=True)
8model = model.to("cuda").eval()
9
10processor = AutoProcessor.from_pretrained(repo, trust_remote_code=True)
11
12image = Image.open("your_image.jpg").convert("RGB")
13
14messages = [
15 {"role": "user", "content": [
16 {"type": "image"},
17 {"type": "text", "text": "Describe this image in detail."},
18 ]},
19]
20
21inputs = processor.apply_chat_template(
22 messages,
23 images=image,
24 add_generation_prompt=True,
25 tokenize=True,
26 return_tensors="pt",
27)
28inputs = {key: value.to("cuda") for key, value in inputs.items()}
29
30with torch.inference_mode():
31 output_ids = model.generate(
32 **inputs,
33 max_new_tokens=256,
34 do_sample=False,
35 use_cache=True,
36 )
37
38response = processor.tokenizer.decode(
39 output_ids[0, inputs["input_ids"].shape[1]:],
40 skip_special_tokens=True,
41)
42print(response)