Views
No views yet
0.8.0.dev01base_model: meta-llama/Llama-3.1-8B-Instruct
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4trust_remote_code: true
5
6load_in_8bit: false
7load_in_4bit: true
8strict: false
9
10datasets:
11 - path: ugaoo/meta_wrong_instruct
12 type: alpaca
13val_set_size: 0
14output_dir: ./out/meta_llama_Llama_3.1_8B_Instruct_ugaoo_meta_wrong_instruct
15
16sequence_len: 4000
17sample_packing: true
18pad_to_sequence_len: true
19
20adapter: qlora
21lora_r: 256
22lora_alpha: 512
23lora_dropout: 0.05
24lora_target_linear: true
25lora_target_modules:
26 - q_proj
27 - k_proj
28 - v_proj
29 - o_proj
30 - up_proj
31 - down_proj
32 - gate_proj
33lora_modules_to_save:
34 - embed_tokens
35 - lm_head
36
37wandb_project: testsearch
38wandb_entity:
39wandb_watch:
40wandb_name: meta_llama_Llama_3.1_8B_Instruct_ugaoo_meta_wrong_instruct
41wandb_log_model:
42
43gradient_accumulation_steps: 3
44micro_batch_size: 4
45num_epochs: 6
46optimizer: adamw_torch
47lr_scheduler: cosine
48learning_rate: 5e-6
49
50train_on_inputs: false
51group_by_length: false
52bf16: auto
53fp16: false
54tf32: false
55
56gradient_checkpointing: true
57early_stopping_patience:
58resume_from_checkpoint:
59logging_steps: 1
60xformers_attention:
61flash_attention: true
62
63warmup_steps: 100
64evals_per_epoch: 6
65eval_table_size:
66saves_per_epoch: 1
67debug:
68deepspeed:
69weight_decay: 0.0
70fsdp:
71fsdp_config:
72save_total_limit: 6
73special_tokens:
74 pad_token: <|end_of_text|>