Views
No views yet
trust_remote_code=True when loading the model.1import torch
2from PIL import Image
3from transformers import AutoModel, AutoFeatureExtractor, AutoTokenizer
4
5model = AutoModel.from_pretrained("calpt/CLIP-ViT-B-32-xlm-roberta-base-laion5B-s13B-b90k", trust_remote_code=True)
6
7processor = AutoFeatureExtractor.from_pretrained("laion/CLIP-ViT-B-32-laion2B-s34B-b79K")
8tokenizer = AutoTokenizer.from_pretrained("xlm-roberta-base")
9
10image_input = processor(Image.open("CLIP.png"), return_tensors="pt")
11text_input = tokenizer(["a diagram", "a dog", "a cat"], return_tensors="pt", padding=True)
12
13with torch.no_grad():
14 outputs = model(**image_input, **text_input)
15 text_probs = (100.0 * outputs.logits_per_image.softmax(dim=-1))
16
17print("Label probs:", text_probs)