Views
No views yet
1from transformers import AutoImageProcessor, ViTMAEForPreTraining
2from PIL import Image
3import requests
4
5url = 'http://images.cocodataset.org/val2017/000000039769.jpg'
6image = Image.open(requests.get(url, stream=True).raw)
7
8processor = AutoImageProcessor.from_pretrained('facebook/vit-mae-large')
9model = ViTMAEForPreTraining.from_pretrained('facebook/vit-mae-large')
10
11inputs = processor(images=image, return_tensors="pt")
12outputs = model(**inputs)
13loss = outputs.loss
14mask = outputs.mask
15ids_restore = outputs.ids_restore1@article{DBLP:journals/corr/abs-2111-06377,
2 author = {Kaiming He and
3 Xinlei Chen and
4 Saining Xie and
5 Yanghao Li and
6 Piotr Doll{\'{a}}r and
7 Ross B. Girshick},
8 title = {Masked Autoencoders Are Scalable Vision Learners},
9 journal = {CoRR},
10 volume = {abs/2111.06377},
11 year = {2021},
12 url = {https://arxiv.org/abs/2111.06377},
13 eprinttype = {arXiv},
14 eprint = {2111.06377},
15 timestamp = {Tue, 16 Nov 2021 12:12:31 +0100},
16 biburl = {https://dblp.org/rec/journals/corr/abs-2111-06377.bib},
17 bibsource = {dblp computer science bibliography, https://dblp.org}
18}