Views
No views yet
user and assistant.<|start_header_id|>Bob<|end_header_id|>
Hello.<|eot_id|><|start_header_id|>Joe<|end_header_id|>
Hey. How are you?<|eot_id|>


1# Weights and Biases logging config
2wandb_project: L3-OpenCAI-v2-8B
3wandb_entity:
4wandb_watch:
5wandb_name: SFT-QLoRA-run_3-OpenCAI-v2
6wandb_log_model:
7
8# Model architecture config
9base_model: meta-llama/Meta-Llama-3-8B-Instruct
10model_type: AutoModelForCausalLM
11tokenizer_type: AutoTokenizer
12
13# Hugging Face saving config
14hub_model_id:
15hub_strategy:
16push_dataset_to_hub:
17hf_use_auth_token:
18
19# Model checkpointing config
20output_dir: ./L3-OpenCAI-v2-run_3-SFT-8B-QLoRA
21resume_from_checkpoint:
22save_steps:
23saves_per_epoch: 50
24save_safetensors: true
25save_total_limit: 3
26
27# Mixed precision training config
28bf16: true
29fp16: false
30tf32: false
31
32# Model loading config
33load_in_8bit: false
34load_in_4bit: true
35strict: false
36
37# Sequence config
38sequence_len: 6008
39s2_attention: false
40sample_packing: true
41eval_sample_packing: true
42pad_to_sequence_len: true
43train_on_inputs: false
44group_by_length: false
45
46# QLoRA adapter config
47adapter: qlora
48lora_model_dir:
49lora_r: 128
50lora_alpha: 128
51lora_dropout: 0.125
52lora_fan_in_fan_out:
53lora_target_linear:
54save_embedding_layers:
55peft_layers_to_transform:
56peft_use_dora:
57peft_use_rslora:
58peft_layer_replication:
59lora_target_modules:
60 - gate_proj
61 - down_proj
62 - up_proj
63 - q_proj
64 - v_proj
65 - k_proj
66 - o_proj
67lora_modules_to_save:
68
69# Unfrozen parameters for FFT
70unfrozen_parameters:
71
72# Dataset config
73datasets:
74 - path: ./local_datasets/OpenCAI-v2-6000-CustomShareGPT.json
75 type: customllama3
76val_set_size: 0.01
77evaluation_strategy:
78eval_steps:
79evals_per_epoch: 50
80test_datasets:
81dataset_prepared_path: ./OpenCAI-v2-seed42-l3
82shuffle_merged_datasets: true
83
84# Training hyperparameters
85num_epochs: 1
86gradient_accumulation_steps: 16
87micro_batch_size: 1
88eval_batch_size: 1
89warmup_steps: 25
90optimizer: paged_adamw_8bit
91lr_scheduler: cosine
92learning_rate: 0.00002
93loraplus_lr_ratio: 8
94loraplus_lr_embedding:
95cosine_min_lr_ratio: 0.1
96weight_decay: 0.1
97max_grad_norm: 1
98logging_steps: 1
99
100# Model optimization
101gradient_checkpointing: unsloth
102xformers_attention: false
103flash_attention: false
104sdp_attention: true
105
106# Loss monitoring config
107early_stopping_patience: false
108loss_watchdog_threshold: 100.0
109loss_watchdog_patience: 3
110
111# Debug config
112debug: true
113seed: 42
114
115# DeepSpeed and FSDP config
116deepspeed:
117fsdp:
118fsdp_config:
119
120# Token config
121special_tokens:
122 bos_token: "<|begin_of_text|>"
123 eos_token: "<|end_of_text|>"
124 pad_token: "<|end_of_text|>"
125tokens:
126
127# Don't mess with this, it's here for accelerate and torchrun
128local_rank: