The following hyperparameters were used during training:
learning_rate: 2.1106713456200193e-05
train_batch_size: 8
eval_batch_size: 8
seed: 42
gradient_accumulation_steps: 2
total_train_batch_size: 16
optimizer: Use OptimizerNames.PAGED_ADAMW with betas=(0.9348819720458172,0.9285998615546803) and epsilon=1.9972958061508847e-07 and optimizer_args=No additional optimizer arguments