Views
No views yet
0.13.0.dev01base_model: meta-llama/Llama-3.1-8B-Instruct
2tokenizer_type: AutoTokenizer
3trust_remote_code: true
4is_llama_derived_model: true
5
6datasets:
7 - path: nvidia/Llama-Nemotron-Post-Training-Dataset
8 type:
9 system_prompt: ""
10 field_instruction: input
11 field_input: ""
12 field_output: output
13 format: |-
14 {instruction}
15 split: chat
16
17val_set_size: 0.01
18
19micro_batch_size: 1
20gradient_accumulation_steps: 8
21
22sequence_len: 8192
23eval_sequence_len: 8192
24pad_to_sequence_len: true
25sample_packing: true
26
27
28optimizer: adamw_torch_fused
29learning_rate: 2.0e-5
30weight_decay: 0.0
31betas: [0.9, 0.999]
32eps: 1.0e-8
33
34lr_scheduler: cosine
35warmup_steps: 100
36
37bf16: true
38tf32: true
39gradient_checkpointing: true
40
41special_tokens:
42 eos_token: "<|eot_id|>"
43 pad_token: "<|eot_id|>"
44
45eot_tokens:
46 - "<|eot_id|>"
47
48roles_to_train:
49 - assistant
50
51train_on_eos: last
52
53save_strategy: steps
54save_steps: 100
55save_total_limit: 3
56save_safetensors: true
57load_best_model_at_end: true
58metric_for_best_model: eval_loss
59greater_is_better: false
60
61logging_steps: 10
62output_dir: ./outputs/llama31_full_sft_instruct_data_nemotron
63seed: 42
64