Views
No views yet
1{
2 "per_device_train_batch_size": 1,
3 "gradient_accumulation_steps": 2,
4 "num_train_epochs": 1,
5 "lora_rank": 2,
6 "lora_alpha": 4,
7 "lora_dropout": 0.1,
8 "learning_rate": 5e-07,
9 "warmup_ratio": 0.2,
10 "eval_steps": 5,
11 "save_steps": 5,
12 "early_stopping_patience": 2,
13 "max_grad_norm": 0.1,
14 "weight_decay": 0.03,
15 "lr_scheduler_type": "cosine_with_restarts",
16 "adam_beta1": 0.9,
17 "adam_beta2": 0.95
18}