The IMDb dataset is tokenized, and words are masked with 0.2 probability. The resulting dataset is downsampled, resulting in 10,000 training samples and 1,000 validation samples.
Training procedure
Training hyperparameters
The following hyperparameters were used during training:
learning_rate: 2e-05
train_batch_size: 64
eval_batch_size: 64
seed: 42
optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments