Views
No views yet
1from transformers import MobileViTv2FeatureExtractor, MobileViTv2ForImageClassification
2from PIL import Image
3import requests
4
5url = "http://images.cocodataset.org/val2017/000000039769.jpg"
6image = Image.open(requests.get(url, stream=True).raw)
7
8feature_extractor = MobileViTv2FeatureExtractor.from_pretrained("shehan97/mobilevitv2-1.0-imagenet1k-256")
9model = MobileViTv2ForImageClassification.from_pretrained("shehan97/mobilevitv2-1.0-imagenet1k-256")
10
11inputs = feature_extractor(images=image, return_tensors="pt")
12
13outputs = model(**inputs)
14logits = outputs.logits
15
16# model predicts one of the 1000 ImageNet classes
17predicted_class_idx = logits.argmax(-1).item()
18print("Predicted class:", model.config.id2label[predicted_class_idx])1@inproceedings{vision-transformer,
2title = {Separable Self-attention for Mobile Vision Transformers},
3author = {Sachin Mehta and Mohammad Rastegari},
4year = {2022},
5URL = {https://arxiv.org/abs/2206.02680}
6}