Đây là một mô hình phân loại ảnh được huấn luyện để nhận diện các chữ số viết tay (từ 0 đến 9) trong ảnh màu. Mô hình sử dụng kiến trúc Vision Transformer (ViT) và được huấn luyện với tập dữ liệu gồm các chữ số viết tay được chụp hoặc scan dưới dạng ảnh màu.
1from transformers import ViTForImageClassification, ViTImageProcessor
2from PIL import Image
3import torch
4
5model_name = "thanhtlx/image_classification_01"
6model = ViTForImageClassification.from_pretrained(model_name)
7processor = ViTImageProcessor.from_pretrained(model_name)
8
9# Đọc ảnh cần phân loại
10image = Image.open("images.png")
11
12# Xử lý ảnh đầu vào
13inputs = processor(images=image, return_tensors="pt")
14
15# Dự đoán với mô hình
16with torch.no_grad():
17 outputs = model(**inputs)
18
19# Lấy kết quả dự đoán
20predicted_class = outputs.logits.argmax(-1).item()
21print(f"prediction: {predicted_class}")