Views
No views yet
per_device_train_batch_size=4,
per_device_eval_batch_size=4,
gradient_accumulation_steps=4,
eval_strategy="steps",
eval_steps=200,
logging_steps=100,
num_train_epochs=2,
learning_rate=2e-4,
fp16=True,
save_steps=500,
save_total_limit=2,