Views
No views yet
1@misc{wu2020visual,
2 title={Visual Transformers: Token-based Image Representation and Processing for Computer Vision},
3 author={Bichen Wu and Chenfeng Xu and Xiaoliang Dai and Alvin Wan and Peizhao Zhang and Zhicheng Yan and Masayoshi Tomizuka and Joseph Gonzalez and Kurt Keutzer and Peter Vajda},
4 year={2020},
5 eprint={2006.03677},
6 archivePrefix={arXiv},
7 primaryClass={cs.CV}
8}{
"epochs": "5",
"train_batch_size": "32",
"eval_batch_size": "8",
"fp16": "true",
"learning_rate": "1e-05",
}1from transformers import ViTFeatureExtractor, ViTModel
2from PIL import Image
3import requests
4
5url = 'http://images.cocodataset.org/val2017/000000039769.jpg'
6image = Image.open(requests.get(url, stream=True).raw)
7
8feature_extractor = ViTFeatureExtractor.from_pretrained('google/vit-base-patch16-224-in21k')
9model = ViTModel.from_pretrained('edumunozsala/vit_base-224-in21k-ft-cifar10')
10inputs = feature_extractor(images=image, return_tensors="pt")
11
12outputs = model(**inputs)
13last_hidden_states = outputs.last_hidden_state