This model is a fine-tuned version of google/vit-base-patch16-224 on the pcuenq/oxford-pets dataset.
It achieves the following results on the evaluation set:
Loss: 0.2111
Accuracy: 0.9499
Model description
Based on the ViT model google/vit-base-patch16-224.
Performance on Test Set
eval_loss: 0.21107521653175354
eval_accuracy: 0.9519323410013532
eval_runtime: 12.1289
eval_samples_per_second: 73.032
eval_steps_per_second: 9.191
epoch: 6.0
Compared to Zero Shot
Accuracy: 0.8800
Precision: 0.8768
Recall: 0.8800
checkpoint = "openai/clip-vit-large-patch14"
Training and evaluation data
per_device_train_batch_size=16,
evaluation_strategy="epoch",
save_strategy="epoch",
logging_steps=100,
num_train_epochs=6,
learning_rate=3e-4,
save_total_limit=2,
remove_unused_columns=False,
push_to_hub=True,
report_to='tensorboard',
load_best_model_at_end=True,
Training procedure
Training hyperparameters
The following hyperparameters were used during training:
learning_rate: 0.0003
train_batch_size: 16
eval_batch_size: 8
seed: 42
optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments