Mô hình này là phiên bản fine-tuned của google/vit-base-patch16-224-in21k trên bộ dữ liệu CIFAR-10 (60.000 ảnh màu 32×32, 10 lớp).
Trên tập đánh giá, mô hình đạt:
Loss: 0.2564
Accuracy: 97.88
📌 Ứng dụng
Phân loại ảnh CIFAR-10 (10 lớp như: airplane, automobile, bird, cat, …)
Dùng để transfer learning cho các tập dữ liệu nhỏ hơn
Làm nền tảng cho các thử nghiệm về fine-tuning ViT trên dữ liệu màu sắc nhỏ
📥 Chuẩn bị đầu vào
Ảnh màu RGB
Thư viện sẽ xử lý bằng ViTImageProcessor:
Resize hình về 224×224
Chuẩn hóa theo mean/std của ImageNet
📤 Đầu ra
Logits tensor kích thước [batch_size, 10]
Dùng argmax(-1) để nhận nhãn dự đoán