Views
No views yet
1from transformers import ViTModel, ViTImageProcessor
2from PIL import Image
3
4model = ViTModel.from_pretrained("BiliSakura/last-vit-clip-vitb16")
5processor = ViTImageProcessor.from_pretrained("BiliSakura/last-vit-clip-vitb16")
6
7image = Image.open("your_image.jpg").convert("RGB")
8inputs = processor(images=image, return_tensors="pt")
9outputs = model(**inputs)
10
11# Image embeddings (CLS token)
12embeddings = outputs.last_hidden_state[:, 0, :] # (batch, 768)