Views
No views yet
1from urllib.request import urlopen
2from PIL import Image
3import timm
4
5img = Image.open(urlopen(
6 'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png'
7))
8
9model = timm.create_model('hiera_small_224.mae', pretrained=True)
10model = model.eval()
11
12# get model specific transforms (normalization, resize)
13data_config = timm.data.resolve_model_data_config(model)
14transforms = timm.data.create_transform(**data_config, is_training=False)
15
16output = model(transforms(img).unsqueeze(0)) # unsqueeze single image into batch of 1
17
18top5_probabilities, top5_class_indices = torch.topk(output.softmax(dim=1) * 100, k=5)1from urllib.request import urlopen
2from PIL import Image
3import timm
4
5img = Image.open(urlopen(
6 'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png'
7))
8
9model = timm.create_model(
10 'hiera_small_224.mae',
11 pretrained=True,
12 features_only=True,
13)
14model = model.eval()
15
16# get model specific transforms (normalization, resize)
17data_config = timm.data.resolve_model_data_config(model)
18transforms = timm.data.create_transform(**data_config, is_training=False)
19
20output = model(transforms(img).unsqueeze(0)) # unsqueeze single image into batch of 1
21
22for o in output:
23 # print shape of each feature map in output
24 # e.g.:
25 # torch.Size([1, 96, 56, 56])
26 # torch.Size([1, 192, 28, 28])
27 # torch.Size([1, 384, 14, 14])
28 # torch.Size([1, 768, 7, 7])
29
30 print(o.shape)1from urllib.request import urlopen
2from PIL import Image
3import timm
4
5img = Image.open(urlopen(
6 'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png'
7))
8
9model = timm.create_model(
10 'hiera_small_224.mae',
11 pretrained=True,
12 num_classes=0, # remove classifier nn.Linear
13)
14model = model.eval()
15
16# get model specific transforms (normalization, resize)
17data_config = timm.data.resolve_model_data_config(model)
18transforms = timm.data.create_transform(**data_config, is_training=False)
19
20output = model(transforms(img).unsqueeze(0)) # output is (batch_size, num_features) shaped tensor
21
22# or equivalently (without needing to set num_classes=0)
23
24output = model.forward_features(transforms(img).unsqueeze(0))
25# output is unpooled, a (1, 49, 768) shaped tensor
26
27output = model.forward_head(output, pre_logits=True)
28# output is a (1, num_features) shaped tensor| model | top1 | top5 | param_count |
|---|---|---|---|
| hiera_huge_224.mae_in1k_ft_in1k | 86.834 | 98.01 | 672.78 |
| hiera_large_224.mae_in1k_ft_in1k | 86.042 | 97.648 | 213.74 |
| hiera_base_plus_224.mae_in1k_ft_in1k | 85.134 | 97.158 | 69.9 |
| hiera_small_abswin_256.sbb2_e200_in12k_ft_in1k | 84.912 | 97.260 | 35.01 |
| hiera_small_abswin_256.sbb2_pd_e200_in12k_ft_in1k | 84.560 | 97.106 | 35.01 |
| hiera_base_224.mae_in1k_ft_in1k | 84.49 | 97.032 | 51.52 |
| hiera_small_224.mae_in1k_ft_in1k | 83.884 | 96.684 | 35.01 |
| hiera_tiny_224.mae_in1k_ft_in1k | 82.786 | 96.204 | 27.91 |
1@article{ryali2023hiera,
2 title={Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles},
3 author={Ryali, Chaitanya and Hu, Yuan-Ting and Bolya, Daniel and Wei, Chen and Fan, Haoqi and Huang, Po-Yao and Aggarwal, Vaibhav and Chowdhury, Arkabandhu and Poursaeed, Omid and Hoffman, Judy and Malik, Jitendra and Li, Yanghao and Feichtenhofer, Christoph},
4 journal={ICML},
5 year={2023}
6}1@Article{MaskedAutoencoders2021,
2 author = {Kaiming He and Xinlei Chen and Saining Xie and Yanghao Li and Piotr Doll{'a}r and Ross Girshick},
3 journal = {arXiv:2111.06377},
4 title = {Masked Autoencoders Are Scalable Vision Learners},
5 year = {2021},
6}