Views
No views yet
0.4.01base_model: meta-llama/Meta-Llama-3-8B
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9datasets:
10 - path: awilliamson/horses-long
11 type: alpaca
12dataset_prepared_path: last_run_prepared
13val_set_size: 0
14output_dir: ./no-inputs
15
16sequence_len: 8192
17sample_packing: false
18pad_to_sequence_len: true
19
20wandb_project: derby
21wandb_entity: willfulbytes
22wandb_watch:
23wandb_name:
24wandb_log_model:
25
26gradient_accumulation_steps: 1
27micro_batch_size: 1
28num_epochs: 5
29optimizer: adamw_torch
30lr_scheduler: cosine
31learning_rate: 2e-5
32
33train_on_inputs: false
34group_by_length: false
35bf16: auto
36fp16:
37tf32: false
38
39gradient_checkpointing: true
40gradient_checkpointing_kwargs:
41 use_reentrant: false
42early_stopping_patience:
43resume_from_checkpoint:
44logging_steps: 1
45xformers_attention:
46flash_attention: true
47
48warmup_steps: 25
49evals_per_epoch:
50eval_table_size:
51saves_per_epoch: 1
52debug:
53deepspeed:
54weight_decay: 0.0
55fsdp:
56 - full_shard
57 - auto_wrap
58fsdp_config:
59 fsdp_offload_params: true
60 fsdp_state_dict_type: FULL_STATE_DICT
61 fsdp_transformer_layer_cls_to_wrap: LlamaDecoderLayer
62special_tokens:
63 pad_token: <|end_of_text|>
64tokens:
65 - <|start_St|>
66 - <|end_St|>
67 - <|start_1/4|>
68 - <|end_1/4|>
69 - <|start_1/2|>
70 - <|end_1/2|>
71 - <|start_3/8|>
72 - <|end_3/8|>
73 - <|start_3/4|>
74 - <|end_4/4|>
75 - <|start_Str|>
76 - <|end_Str|>
77 - <|start_Fin|>
78 - <|end_Fin|>
79 - PP1
80 - PP2
81 - PP3
82 - PP4
83 - PP5
84 - PP6
85 - PP7
86 - PP8
87 - PP9
88 - PP10
89 - PP11
90 - PP12
91 - PP13
92 - PP14
93 - PP15
94 - PP16
95 - PP17
96 - PP18
97 - PP19
98 - PP20
99