Views
No views yet
0.10.01base_model: meta-llama/Llama-3.1-8B-Instruct
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer
4gradient_accumulation_steps: 2
5micro_batch_size: 2
6num_epochs: 4
7optimizer: adamw_bnb_8bit
8lr_scheduler: cosine
9learning_rate: 0.0001
10load_in_8bit: true
11load_in_4bit: false
12adapter: lora
13lora_model_dir: null
14lora_r: 8
15lora_alpha: 16
16lora_dropout: 0.05
17lora_target_modules:
18- q_proj
19- v_proj
20- k_proj
21dataset_prepared_path: null
22val_set_size: 0.02
23output_dir: /workspace/FinLoRA/lora/axolotl-output/buffett_agent_llama_3_1_8b_8bits_r8_lora_original
24peft_use_dora: false
25peft_use_rslora: false
26sequence_len: 4096
27sample_packing: false
28pad_to_sequence_len: false
29wandb_project: finlora_models
30wandb_entity: null
31wandb_watch: gradients
32wandb_name: buffett_agent_llama_3_1_8b_8bits_r8_lora_original
33wandb_log_model: 'false'
34bf16: auto
35tf32: false
36gradient_checkpointing: true
37resume_from_checkpoint: null
38logging_steps: 500
39flash_attention: false
40deepspeed: deepspeed_configs/zero1.json
41warmup_steps: 10
42evals_per_epoch: 4
43saves_per_epoch: 1
44weight_decay: 0.0
45special_tokens:
46 pad_token: <|end_of_text|>
47chat_template: llama3
48| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| No log | 0 | 0 | 2.1737 |
| No log | 0.2506 | 307 | 1.4929 |
| 1.5172 | 0.5012 | 614 | 1.4560 |
| 1.5172 | 0.7518 | 921 | 1.4359 |
| 1.4306 | 1.0024 | 1228 | 1.4188 |
| 1.3799 | 1.2531 | 1535 | 1.4068 |
| 1.3799 | 1.5037 | 1842 | 1.3995 |
| 1.3501 | 1.7543 | 2149 | 1.3907 |
| 1.3501 | 2.0049 | 2456 | 1.3864 |
| 1.3422 | 2.2555 | 2763 | 1.3859 |
| 1.3064 | 2.5061 | 3070 | 1.3781 |
| 1.3064 | 2.7567 | 3377 | 1.3746 |
| 1.2952 | 3.0073 | 3684 | 1.3738 |
| 1.2952 | 3.2580 | 3991 | 1.3738 |
| 1.2749 | 3.5086 | 4298 | 1.3740 |
| 1.2713 | 3.7592 | 4605 | 1.3731 |