Views
No views yet

1from transformers import AutoFeatureExtractor, SwinForImageClassification
2from PIL import Image
3import requests
4
5url = "http://images.cocodataset.org/val2017/000000039769.jpg"
6image = Image.open(requests.get(url, stream=True).raw)
7
8feature_extractor = AutoFeatureExtractor.from_pretrained("microsoft/swin-base-patch4-window12-384")
9model = SwinForImageClassification.from_pretrained("microsoft/swin-base-patch4-window12-384")
10
11inputs = feature_extractor(images=image, return_tensors="pt")
12outputs = model(**inputs)
13logits = outputs.logits
14# model predicts one of the 1000 ImageNet classes
15predicted_class_idx = logits.argmax(-1).item()
16print("Predicted class:", model.config.id2label[predicted_class_idx])1@article{DBLP:journals/corr/abs-2103-14030,
2 author = {Ze Liu and
3 Yutong Lin and
4 Yue Cao and
5 Han Hu and
6 Yixuan Wei and
7 Zheng Zhang and
8 Stephen Lin and
9 Baining Guo},
10 title = {Swin Transformer: Hierarchical Vision Transformer using Shifted Windows},
11 journal = {CoRR},
12 volume = {abs/2103.14030},
13 year = {2021},
14 url = {https://arxiv.org/abs/2103.14030},
15 eprinttype = {arXiv},
16 eprint = {2103.14030},
17 timestamp = {Thu, 08 Apr 2021 07:53:26 +0200},
18 biburl = {https://dblp.org/rec/journals/corr/abs-2103-14030.bib},
19 bibsource = {dblp computer science bibliography, https://dblp.org}
20}