Views
No views yet
0.4.11base_model: meta-llama/Llama-3.1-8B-Instruct
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: true
6load_in_4bit: false
7strict: false
8
9datasets:
10 - path: data.jsonl
11 ds_type: json
12 type: alpaca
13
14dataset_prepared_path:
15val_set_size: 0.05
16output_dir: ./outputs/lora-out
17hub_model_id: femT-data/llama-3.1-Instruct-finetuned-NER
18deepspeed: /workspace/axolotl/deepspeed_configs/zero3_bf16.json
19
20sequence_len: 4096
21sample_packing: false
22pad_to_sequence_len: true
23
24adapter: lora
25lora_model_dir:
26lora_r: 32
27lora_alpha: 16
28lora_dropout: 0.05
29lora_target_linear: true
30lora_fan_in_fan_out:
31
32gradient_accumulation_steps: 4
33micro_batch_size: 4
34num_epochs: 1
35optimizer: adamw_bnb_8bit
36lr_scheduler: cosine
37learning_rate: 0.0002
38
39train_on_inputs: false
40group_by_length: false
41bf16: auto
42fp16:
43tf32: false
44
45gradient_checkpointing: true
46early_stopping_patience:
47resume_from_checkpoint:
48local_rank:
49logging_steps: 1
50xformers_attention:
51flash_attention: true
52s2_attention:
53
54warmup_steps: 10
55evals_per_epoch: 1
56eval_table_size:
57eval_max_new_tokens: 128
58saves_per_epoch: 1
59debug:
60deepspeed:
61weight_decay: 0.0
62fsdp:
63fsdp_config:
64special_tokens:
65 pad_token: <|end_of_text|>
66| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 0.0206 | 0.9993 | 366 | 0.0448 |