Views
No views yet
1import torch
2from PIL import Image
3from transformers import AutoModelForCausalLM, AutoProcessor
4
5repo = "TrishanuDas/tayavision-alignment"
6
7model = AutoModelForCausalLM.from_pretrained(repo, torch_dtype=torch.bfloat16, trust_remote_code=True)
8model = model.to("cuda").eval()
9
10processor = AutoProcessor.from_pretrained(repo, trust_remote_code=True)
11
12image = Image.open("your_image.jpg").convert("RGB")
13
14messages = [
15 {"role": "user", "content": [
16 {"type": "image"},
17 {"type": "text", "text": "Describe this image in detail."},
18 ]},
19]
20
21inputs = processor.apply_chat_template(
22 messages, images=image, add_generation_prompt=True, return_tensors="pt",
23)
24inputs = {k: v.to("cuda") for k, v in inputs.items()}
25
26with torch.no_grad():
27 output_ids = model.generate(**inputs, max_new_tokens=256)
28
29response = processor.tokenizer.decode(
30 output_ids[0, inputs["input_ids"].shape[1]:], skip_special_tokens=True,
31)
32print(response)