Views
No views yet
google/vit-base-patch16-224, quantized to FP16 for efficient inference, and delivers high accuracy in multi-class image classification tasks.google/vit-base-patch16-224 (Vision Transformer)tanganke/cifar1001from datasets import load_dataset
2
3dataset = load_dataset("tanganke/cifar100")1from PIL import Image
2import torch
3
4def predict(image_path):
5 image = Image.open(image_path).convert("RGB")
6 inputs = feature_extractor(images=image, return_tensors="pt").to("cuda")
7 outputs = model(**inputs)
8 logits = outputs.logits
9 predicted_class = logits.argmax(-1).item()
10 return dataset["train"].features["fine_label"].int2str(predicted_class)
11
12print(predict("sample_image.jpg"))