Views
No views yet
max_position_embeddings=512 (vs the usual 77).1import torch
2from PIL import Image
3from transformers import CLIPModel, CLIPProcessor
4
5model_id = "AlpachinoNLP/LongCLIP-ViT-B-32"
6model = CLIPModel.from_pretrained(model_id)
7processor = CLIPProcessor.from_pretrained(model_id)
8
9image = Image.open("path/to/image.jpg").convert("RGB")
10texts = ["a short caption", "a much longer caption ..."]
11
12inputs = processor(
13 text=texts,
14 images=image,
15 return_tensors="pt",
16 padding=True,
17 truncation=True,
18 max_length=512,
19)
20
21with torch.no_grad():
22 outputs = model(**inputs)
23 probs = outputs.logits_per_image.softmax(dim=-1) # shape: [num_images, num_texts]
24print(probs[0].tolist())1import torch
2from PIL import Image
3import requests
4from transformers import CLIPModel, CLIPProcessor
5
6model_id = "AlpachinoNLP/LongCLIP-ViT-B-32" # or "<your-hf-org>/<your-model-repo>"
7model = CLIPModel.from_pretrained(model_id)
8processor = CLIPProcessor.from_pretrained(model_id)
9
10url = "https://huggingface.co/datasets/mishig/sample_images/resolve/main/cat-dog-music.png"
11image = Image.open(requests.get(url, stream=True).raw).convert("RGB")
12labels = ["cat", "dog", "playing music"]
13
14inputs = processor(text=labels, images=image, return_tensors="pt", padding=True, truncation=True, max_length=512)
15with torch.no_grad():
16 probs = model(**inputs).logits_per_image.softmax(dim=-1)[0]
17print({label: float(p) for label, p in zip(labels, probs)})1import torch
2from transformers import CLIPModel, CLIPProcessor
3
4model_id = "AlpachinoNLP/LongCLIP-ViT-B-32" # or "<your-hf-org>/<your-model-repo>"
5model = CLIPModel.from_pretrained(model_id)
6processor = CLIPProcessor.from_pretrained(model_id)
7
8inputs = processor(text=["a caption"], return_tensors="pt", padding=True, truncation=True, max_length=512)
9with torch.no_grad():
10 text_features = model.get_text_features(**inputs) # [B, 512]truncation=True.