Views
No views yet
0.4.01base_model: meta-llama/Meta-Llama-3-8B-Instruct
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9chat_template: llama3
10datasets:
11 - path: augmxnt/ultra-orca-boros-en-ja-v1
12 type: sharegpt
13dataset_prepared_path: last_run_prepared
14val_set_size: 0.05
15output_dir: ./outputs/neftune
16
17sequence_len: 8192
18sample_packing: true
19pad_to_sequence_len: true
20
21use_wandb: true
22wandb_project: shisa-v2
23wandb_entity: augmxnt
24wandb_name: shisa-v1-llama3-8b.neftune
25
26neftune_noise_alpha: 5
27
28gradient_accumulation_steps: 8
29micro_batch_size: 1
30num_epochs: 3
31optimizer: paged_adamw_8bit
32lr_scheduler: linear
33learning_rate: 2e-5
34
35train_on_inputs: false
36group_by_length: false
37bf16: auto
38fp16:
39tf32: false
40
41gradient_checkpointing: true
42gradient_checkpointing_kwargs:
43 use_reentrant: false
44early_stopping_patience:
45resume_from_checkpoint:
46logging_steps: 1
47xformers_attention:
48flash_attention: true
49
50warmup_steps: 100
51evals_per_epoch: 2
52eval_table_size:
53saves_per_epoch: 1
54debug:
55deepspeed: axolotl/deepspeed_configs/zero2.json
56weight_decay: 0.0
57fsdp:
58fsdp_config:
59special_tokens:
60 pad_token: <|end_of_text|>
61| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 1.3955 | 0.0064 | 1 | 0.8645 |
| 0.8892 | 0.5020 | 79 | 0.5718 |
| 0.8728 | 1.0040 | 158 | 0.5392 |
| 0.7356 | 1.4853 | 237 | 0.5191 |
| 0.7075 | 1.9873 | 316 | 0.5032 |
| 0.6447 | 2.4694 | 395 | 0.5048 |