Đây là mô hình Vision Transformer (ViT) được fine-tuned từ mô hình khác trên tập dữ liệu CIFAR-10. Mô hình được huấn luyện để phân loại ảnh vào 10 lớp khác nhau, mỗi lớp đại diện cho một danh mục đối tượng cụ thể.
Loại bài toán: Phân loại ảnh (Image Classification)
Số lớp: 10 (Tương ứng nhãn) CIFAR-10
Định dạng: Xác suất cho mỗi lớp (logits)
Kiểu dữ liệu: Tensor có kích thước [batch_size, 10]
Ý nghĩa: Xác suất dự đoán cho từng lớp trong 10 lớp của CIFAR-10
1import torch
2from transformers import ViTForImageClassification, ViTImageProcessor
3from PIL import Image
4
5# Tải ảnh cần phân loại
6image = Image.open("path_to_your_image.jpg")
7
8# Tải processor và mô hình từ Hugging Face
9processor = ViTImageProcessor.from_pretrained("zhaospei/Model_7")
10model = ViTForImageClassification.from_pretrained("zhaospei/Model_7")
11
12# Xử lý đầu vào
13inputs = processor(images=image, return_tensors="pt")
14
15# Dự đoán với mô hình
16with torch.no_grad():
17 outputs = model(**inputs)
18 logits = outputs.logits
19 predicted_label = logits.argmax(-1).item()
20
21print(f"Nhãn dự đoán: {model.config.id2label[predicted_label]}")