1base_model: meta-llama/Meta-Llama-3.1-8B
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer
4chat_template: llama3
5
6load_in_8bit: false
7load_in_4bit: false
8strict: false
9main_process_port: 0
10
11datasets:
12 - path: Magpie-Align/MagpieLM-SFT-Data-v0.1
13 type: sharegpt
14 conversation: llama3
15
16dataset_prepared_path: last_run_prepared
17val_set_size: 0.001
18output_dir: axolotl_out/MagpieLM-8B-SFT-v0.1
19
20sequence_len: 8192
21sample_packing: true
22eval_sample_packing: false
23pad_to_sequence_len: true
24
25wandb_project: SynDa
26wandb_entity:
27wandb_watch:
28wandb_name: MagpieLM-8B-SFT-v0.1
29wandb_log_model:
30hub_model_id: Magpie-Align/MagpieLM-8B-SFT-v0.1
31
32gradient_accumulation_steps: 32
33micro_batch_size: 1
34num_epochs: 2
35optimizer: paged_adamw_8bit
36lr_scheduler: cosine
37learning_rate: 2e-5
38
39train_on_inputs: false
40group_by_length: false
41bf16: auto
42fp16:
43tf32: false
44
45gradient_checkpointing: true
46gradient_checkpointing_kwargs:
47 use_reentrant: false
48early_stopping_patience:
49resume_from_checkpoint:
50logging_steps: 1
51xformers_attention:
52flash_attention: true
53
54warmup_ratio: 0.1
55evals_per_epoch: 5
56eval_table_size:
57saves_per_epoch:
58debug:
59deepspeed:
60weight_decay: 0.0
61fsdp:
62fsdp_config:
63special_tokens:
64 pad_token: <|end_of_text|>
65