Views
No views yet
0.13.0.dev01adapter: lora
2base_model: meta-llama/Llama-3.1-8B-Instruct
3
4datasets:
5- path: mariiazhiv/Cybersecurity_messages
6 split: train
7 type: chat_template
8 field_messages: messages
9 chat_template: llama3
10
11test_datasets:
12- path: mariiazhiv/Cybersecurity_messages
13 split: validation
14 type: chat_template
15 field_messages: messages
16 chat_template: llama3
17
18dataset_prepared_path: last_run_prepared
19output_dir: ./outputs/mymodel
20
21sequence_len: 1024
22
23lora_r: 16
24lora_alpha: 32
25lora_dropout: 0.05
26lora_target_modules:
27 - q_proj
28 - v_proj
29 - k_proj
30 - o_proj
31 - gate_proj
32 - down_proj
33 - up_proj
34
35gradient_accumulation_steps: 8
36micro_batch_size: 4
37num_epochs: 2
38optimizer: adamw_bnb_8bit
39learning_rate: 0.0001
40load_in_8bit: false
41train_on_inputs: false
42bf16: true
43fp16: false
44gradient_checkpointing: true
45
46special_tokens:
47 pad_token: "<|pad|>"
48