Views
No views yet
0.4.11base_model: meta-llama/Meta-Llama-3.1-8B
2
3model_type: LlamaForCausalLM
4tokenizer_type: AutoTokenizer
5
6load_in_8bit: false
7load_in_4bit: false
8strict: false
9
10datasets:
11 - path: ericflo/SyntheticPython-Pretrain-v1
12 type: completion
13# max_steps: 200
14# pretraining_dataset:
15# - path: ericflo/SyntheticPython-Pretrain-v1
16# name: default
17# type: pretrain
18dataset_prepared_path: last_run_prepared2
19val_set_size: 0.0
20output_dir: ./outputs/model-out
21
22sequence_len: 8192
23sample_packing: false
24
25wandb_project: syntheticpython
26wandb_entity:
27wandb_watch:
28wandb_name:
29wandb_log_model:
30
31gradient_accumulation_steps: 4
32micro_batch_size: 2
33num_epochs: 4
34optimizer: adamw_bnb_8bit
35lr_scheduler: cosine
36learning_rate: 0.0002
37
38train_on_inputs: false
39group_by_length: false
40bf16: auto
41fp16:
42tf32: false
43
44gradient_checkpointing: true
45early_stopping_patience:
46resume_from_checkpoint:
47local_rank:
48logging_steps: 1
49xformers_attention:
50flash_attention: true
51
52warmup_steps: 10
53evals_per_epoch:
54eval_table_size:
55saves_per_epoch: 1
56debug:
57deepspeed:
58weight_decay: 0.0
59fsdp:
60fsdp_config:
61special_tokens:
62 pad_token: <|end_of_text|>