Views
No views yet
0.6.01
2
3base_model: meta-llama/Llama-3.2-1B
4hub_model_id: minpeter/Alpaca-Llama-3.2-1B-Instruct
5
6load_in_8bit: false
7load_in_4bit: false
8strict: false
9
10datasets:
11 - path: tatsu-lab/alpaca
12 type: alpaca
13dataset_prepared_path: last_run_prepared
14dataset_processes: 1000
15val_set_size: 0.05
16output_dir: ./outputs/out
17
18sequence_len: 8192
19sample_packing: true
20pad_to_sequence_len: true
21
22wandb_project: "axolotl"
23wandb_entity: "kasfiekfs-e"
24wandb_watch:
25wandb_name:
26wandb_log_model:
27
28gradient_accumulation_steps: 8
29micro_batch_size: 1
30num_epochs: 1
31optimizer: paged_adamw_8bit
32lr_scheduler: cosine
33learning_rate: 2e-5
34
35train_on_inputs: false
36group_by_length: false
37bf16: auto
38fp16:
39tf32: false
40
41gradient_checkpointing: true
42gradient_checkpointing_kwargs:
43 use_reentrant: false
44early_stopping_patience:
45resume_from_checkpoint:
46logging_steps: 1
47xformers_attention:
48flash_attention: true
49
50warmup_steps: 100
51evals_per_epoch: 2
52eval_table_size:
53saves_per_epoch: 1
54debug:
55deepspeed:
56weight_decay: 0.0
57fsdp:
58fsdp_config:
59special_tokens:
60 pad_token: <|end_of_text|>
61| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 1.5628 | 0.0127 | 1 | 1.5941 |
| 1.4085 | 0.4960 | 39 | 1.4333 |
| 1.3727 | 0.9921 | 78 | 1.3881 |