Views
No views yet
1 # 데이터셋과 훈련 횟수와 관련된 하이퍼 파라미터
2 batch_size = 16
3 num_epochs = 1
4 micro_batch = 1
5 gradient_accumulation_steps = batch_size // micro_batch
6
7 # 훈련 방법에 대한 하이퍼 파라미터
8 cutoff_len = 4096
9 lr_scheduler = 'cosine'
10 warmup_ratio = 0.06 # warmup_steps = 100
11 learning_rate = 4e-4
12 optimizer = 'adamw_torch'
13 weight_decay = 0.01
14 max_grad_norm = 1.0
15
16 # LoRA config
17 lora_r = 16
18 lora_alpha = 16
19 lora_dropout = 0.05
20 lora_target_modules = ["gate_proj", "down_proj", "up_proj"]
21
22 # Tokenizer에서 나오는 input값 설정 옵션
23 train_on_inputs = False
24 add_eos_token = False
25
26 # NEFTune params
27 noise_alpha: int = 5