Views
No views yet
1from transformers import ViTModel, ViTImageProcessor
2from PIL import Image
3
4model = ViTModel.from_pretrained("BiliSakura/last-vit-dino-vitb16")
5processor = ViTImageProcessor.from_pretrained("BiliSakura/last-vit-dino-vitb16")
6
7image = Image.open("your_image.jpg").convert("RGB")
8inputs = processor(images=image, return_tensors="pt")
9outputs = model(**inputs)
10
11# Pooled output (CLS token)
12pooled = outputs.last_hidden_state[:, 0, :] # (batch, 768)
13# Or all patch tokens
14patch_tokens = outputs.last_hidden_state[:, 1:, :] # (batch, 196, 768)