1base_model: Undi95/Meta-Llama-3-8B-hf
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9datasets:
10 - path: Pbug/bftest
11 type: sharegpt
12dataset_prepared_path:
13val_set_size: 0.05
14output_dir: ./lora-out
15
16sequence_len: 8192
17sample_packing: true
18pad_to_sequence_len: true
19
20wandb_project:
21wandb_entity:
22wandb_watch:
23wandb_name:
24wandb_log_model:
25
26gradient_accumulation_steps: 8
27micro_batch_size: 1
28num_epochs: 10
29optimizer: paged_adamw_8bit
30lr_scheduler: cosine
31learning_rate: 2e-5
32
33train_on_inputs: false
34group_by_length: false
35bf16: auto
36fp16:
37tf32: false
38
39gradient_checkpointing: true
40gradient_checkpointing_kwargs:
41 use_reentrant: false
42early_stopping_patience:
43resume_from_checkpoint:
44logging_steps: 1
45xformers_attention:
46flash_attention: true
47
48warmup_steps: 100
49evals_per_epoch: 2
50eval_table_size:
51eval_sample_packing: False
52saves_per_epoch: 1
53debug:
54deepspeed:
55weight_decay: 0.0
56fsdp:
57fsdp_config:
58special_tokens:
59 pad_token: <|end_of_text|>