Views
No views yet
0.4.01base_model: meta-llama/Meta-Llama-3-8B
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: false
6load_in_4bit: true
7strict: false
8
9datasets:
10 - path: OdiaGenAIdata/culturax-odia
11 type: completion
12 field: text
13dataset_prepared_path:
14val_set_size: 0.1
15output_dir: ./llama_3_8b_pretrain_v2
16hub_model_id: sam2ai/llama3_8b_odia_v2
17
18adapter: qlora
19lora_model_dir:
20
21sequence_len: 4096
22sample_packing: true
23pad_to_sequence_len: true
24
25lora_r: 64
26lora_alpha: 128
27lora_dropout: 0.05
28lora_target_modules:
29lora_target_linear: true
30#lora_modules_to_save:
31# - embed_tokens
32# - lm_head
33lora_fan_in_fan_out:
34
35wandb_project: llama-3-8b-pretrain-odia-plain
36wandb_entity:
37wandb_watch:
38wandb_name:
39wandb_log_model:
40
41gradient_accumulation_steps: 8
42micro_batch_size: 2
43num_epochs: 4
44optimizer: paged_adamw_32bit
45lr_scheduler: cosine
46learning_rate: 0.0002
47
48train_on_inputs: false
49group_by_length: false
50bf16: auto
51fp16:
52tf32: false
53
54gradient_checkpointing: true
55early_stopping_patience:
56resume_from_checkpoint:
57local_rank:
58logging_steps: 1
59xformers_attention:
60flash_attention: false
61
62warmup_steps: 10
63evals_per_epoch: 4
64eval_table_size:
65saves_per_epoch: 1
66debug:
67deepspeed:
68weight_decay: 0.0
69fsdp:
70fsdp_config:
71special_tokens:
72 pad_token: "<|end_of_text|>"
73save_safetensors: True
74| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 13.7841 | 0.0007 | 1 | nan |
| 0.0 | 0.25 | 384 | nan |
| 0.0 | 0.5 | 768 | nan |
| 0.0 | 0.75 | 1152 | nan |
| 0.0 | 1.0 | 1536 | nan |
| 0.0 | 1.2362 | 1920 | nan |
| 0.0 | 1.4862 | 2304 | nan |
| 0.0 | 1.7362 | 2688 | nan |
| 0.0 | 1.9862 | 3072 | nan |
| 0.0 | 2.2220 | 3456 | nan |
| 0.0 | 2.4720 | 3840 | nan |
| 0.0 | 2.7220 | 4224 | nan |
| 0.0 | 2.9720 | 4608 | nan |
| 0.0 | 3.2078 | 4992 | nan |
| 0.0 | 3.4578 | 5376 | nan |
| 0.0 | 3.7078 | 5760 | nan |
| 0.0 | 3.9578 | 6144 | nan |