Views
No views yet
0.4.11base_model: ssyok/NanoLlama-v0-6HL-1024D
2
3model_type: LlamaForCausalLM
4tokenizer_type: LlamaTokenizer
5
6load_in_8bit: false
7load_in_4bit: false
8strict: false
9
10max_steps: 200000
11chat_template: llama3
12datasets:
13 - path: HuggingFaceH4/ultrachat_200k
14 type: chat_template
15 chat_template: llama3
16 field_messages: messages
17 message_field_role: role
18 message_field_content: content
19 roles:
20 user:
21 - user
22 assistant:
23 - assistant
24 split: train_sft
25
26dataset_prepared_path:
27val_set_size: 0.0
28output_dir: ./outputs/model-out
29
30sequence_len: 2048
31sample_packing: true
32pad_to_sequence_len: true
33
34wandb_project:
35wandb_entity:
36wandb_watch:
37wandb_name:
38wandb_log_model:
39
40gradient_accumulation_steps: 4
41micro_batch_size: 2
42num_epochs: 3
43optimizer: adamw_bnb_8bit
44lr_scheduler: cosine
45learning_rate: 0.0002
46
47train_on_inputs: false
48group_by_length: false
49bf16: auto
50fp16:
51tf32: false
52
53gradient_checkpointing: true
54early_stopping_patience:
55resume_from_checkpoint:
56local_rank:
57logging_steps: 1
58xformers_attention:
59flash_attention: true
60
61warmup_steps: 10
62evals_per_epoch:
63eval_table_size:
64saves_per_epoch: 1
65debug:
66deepspeed:
67weight_decay: 0.0
68fsdp:
69fsdp_config:
70special_tokens:
71 pad_token: <|end_of_text>
72