Views
No views yet
0.4.01base_model: beomi/Llama-3-Open-Ko-8B
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9datasets:
10 - path: sosoai/mixed_dataset
11 type: alpaca
12dataset_prepared_path: last_run_prepared
13val_set_size: 0.05
14output_dir: ./beomi-llama3-8b-64k
15save_safetensors: true
16
17sequence_len: 8192
18sample_packing: true
19pad_to_sequence_len: false
20use_pose: true
21pose_max_context_len: 65536
22
23overrides_of_model_config:
24 rope_theta: 500000.0
25 max_position_embeddings: 65536
26
27wandb_project:
28wandb_entity:
29wandb_watch:
30wandb_name:
31wandb_log_model:
32
33gradient_accumulation_steps: 8
34micro_batch_size: 1
35num_epochs: 3
36optimizer: paged_adamw_8bit
37lr_scheduler: cosine
38learning_rate: 2e-5
39
40train_on_inputs: false
41group_by_length: false
42bf16: true
43fp16:
44tf32: true
45
46gradient_checkpointing: true
47gradient_checkpointing_kwargs:
48 use_reentrant: false
49early_stopping_patience:
50resume_from_checkpoint:
51logging_steps: 1
52xformers_attention:
53flash_attention: true
54
55warmup_steps: 100
56eval_sample_packing: False
57evals_per_epoch: 2
58eval_table_size:
59saves_per_epoch: 1
60debug:
61deepspeed:
62weight_decay: 0.0
63fsdp:
64fsdp_config:
65special_tokens:
66 pad_token: <|end_of_text|>
67| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 1.6869 | 0.06 | 1 | 1.7410 |
| 1.6246 | 0.52 | 9 | 1.6575 |
| 1.4583 | 1.01 | 18 | 1.4841 |
| 1.3375 | 1.53 | 27 | 1.3299 |
| 1.171 | 2.01 | 36 | 1.1744 |
| 1.0133 | 2.53 | 45 | 0.9960 |