1adapter: lora
2base_model: Qwen/Qwen2.5-7B-Instruct
3bf16: auto
4
5lora_model_dir: injazsmart/thoth_text_v2
6
7datasets:
8 - path: ./data/injaz.json
9 type: alpaca
10
11sequence_len: 4096
12micro_batch_size: 16
13gradient_accumulation_steps: 1
14num_epochs: 2
15learning_rate: 0.0001
16optimizer: adamw_bnb_8bit
17
18load_in_8bit: true
19lora_r: 8
20lora_alpha: 16
21lora_dropout: 0.05
22lora_target_modules:
23 - q_proj
24 - v_proj
25 - k_proj
26 - o_proj
27 - gate_proj
28 - down_proj
29 - up_proj
30
31train_on_inputs: false
32output_dir: ./outputs/thoth_text_v3