Views
No views yet
1from urllib.request import urlopen
2from PIL import Image
3import timm
4
5img = Image.open(urlopen(
6 'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png'
7))
8
9model = timm.create_model('nextvit_large.bd_in1k_384', pretrained=True)
10model = model.eval()
11
12# get model specific transforms (normalization, resize)
13data_config = timm.data.resolve_model_data_config(model)
14transforms = timm.data.create_transform(**data_config, is_training=False)
15
16output = model(transforms(img).unsqueeze(0)) # unsqueeze single image into batch of 1
17
18top5_probabilities, top5_class_indices = torch.topk(output.softmax(dim=1) * 100, k=5)1from urllib.request import urlopen
2from PIL import Image
3import timm
4
5img = Image.open(urlopen(
6 'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png'
7))
8
9model = timm.create_model(
10 'nextvit_large.bd_in1k_384',
11 pretrained=True,
12 features_only=True,
13)
14model = model.eval()
15
16# get model specific transforms (normalization, resize)
17data_config = timm.data.resolve_model_data_config(model)
18transforms = timm.data.create_transform(**data_config, is_training=False)
19
20output = model(transforms(img).unsqueeze(0)) # unsqueeze single image into batch of 1
21
22for o in output:
23 # print shape of each feature map in output
24 # e.g.:
25 # torch.Size([1, 96, 96, 96])
26 # torch.Size([1, 256, 48, 48])
27 # torch.Size([1, 512, 24, 24])
28 # torch.Size([1, 1024, 12, 12])
29
30 print(o.shape)1from urllib.request import urlopen
2from PIL import Image
3import timm
4
5img = Image.open(urlopen(
6 'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png'
7))
8
9model = timm.create_model(
10 'nextvit_large.bd_in1k_384',
11 pretrained=True,
12 num_classes=0, # remove classifier nn.Linear
13)
14model = model.eval()
15
16# get model specific transforms (normalization, resize)
17data_config = timm.data.resolve_model_data_config(model)
18transforms = timm.data.create_transform(**data_config, is_training=False)
19
20output = model(transforms(img).unsqueeze(0)) # output is (batch_size, num_features) shaped tensor
21
22# or equivalently (without needing to set num_classes=0)
23
24output = model.forward_features(transforms(img).unsqueeze(0))
25# output is unpooled, a (1, 1024, 12, 12) shaped tensor
26
27output = model.forward_head(output, pre_logits=True)
28# output is a (1, num_features) shaped tensor| model | top1 | top1_err | top5 | top5_err | param_count |
|---|---|---|---|---|---|
| nextvit_large.bd_ssld_6m_in1k_384 | 86.542 | 13.458 | 98.142 | 1.858 | 57.87 |
| nextvit_base.bd_ssld_6m_in1k_384 | 86.352 | 13.648 | 98.04 | 1.96 | 44.82 |
| nextvit_small.bd_ssld_6m_in1k_384 | 85.964 | 14.036 | 97.908 | 2.092 | 31.76 |
| nextvit_large.bd_ssld_6m_in1k | 85.48 | 14.52 | 97.696 | 2.304 | 57.87 |
| nextvit_base.bd_ssld_6m_in1k | 85.186 | 14.814 | 97.59 | 2.41 | 44.82 |
| nextvit_large.bd_in1k_384 | 84.924 | 15.076 | 97.294 | 2.706 | 57.87 |
| nextvit_small.bd_ssld_6m_in1k | 84.862 | 15.138 | 97.382 | 2.618 | 31.76 |
| nextvit_base.bd_in1k_384 | 84.706 | 15.294 | 97.224 | 2.776 | 44.82 |
| nextvit_small.bd_in1k_384 | 84.022 | 15.978 | 96.99 | 3.01 | 31.76 |
| nextvit_large.bd_in1k | 83.626 | 16.374 | 96.694 | 3.306 | 57.87 |
| nextvit_base.bd_in1k | 83.472 | 16.528 | 96.656 | 3.344 | 44.82 |
| nextvit_small.bd_in1k | 82.61 | 17.39 | 96.226 | 3.774 | 31.76 |
1@article{li2022next,
2 title={Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios},
3 author={Li, Jiashi and Xia, Xin and Li, Wei and Li, Huixia and Wang, Xing and Xiao, Xuefeng and Wang, Rui and Zheng, Min and Pan, Xin},
4 journal={arXiv preprint arXiv:2207.05501},
5 year={2022}
6}