Views
No views yet
@Update : 2024-11-27 'loss': 2.1778, 'grad_norm': 5.742631912231445, 'learning_rate': 1.831713150322434e-07, 'epoch': 4.86Trainargument
epochs : 5
batch_size : 2
gradient_accumulation_steps : 32
weight_decay : 0.02
optim : paged_adamw_32bit
learning_rate: 1e-5