Views
No views yet
1from transformers import AutoModelForVision2Seq, AutoTokenizer, AutoProcessor
2from peft import PeftModel
3from PIL import Image
4import torch
5
6model = PeftModel.from_pretrained(
7 AutoModelForVision2Seq.from_pretrained("meta-llama/Llama-3.2-11B-Vision-Instruct", device_map="auto", load_in_4bit=True),
8 "pdufour/Llama-3.2-11B-Vision-WebSight"
9)
10tokenizer = AutoTokenizer.from_pretrained("pdufour/Llama-3.2-11B-Vision-WebSight")
11processor = AutoProcessor.from_pretrained("meta-llama/Llama-3.2-11B-Vision-Instruct")
12
13inputs = processor(text="Generate code for a web page that looks exactly like this. <|image|>", images=Image.open("fashion.jpg"), return_tensors="pt").to(model.device)
14
15with torch.no_grad():
16 outputs = model.generate(input_ids=inputs['input_ids'], max_new_tokens=4096, do_sample=True, temperature=0.7, top_p=0.9)
17
18print(tokenizer.decode(outputs[0], skip_special_tokens=True))