Views
No views yet
0.4.01
2base_model: ai21labs/Jamba-v0.1
3trust_remote_code: true
4
5load_in_8bit: false
6load_in_4bit: true
7strict: false
8
9datasets:
10 - path: mhenrichsen/alpaca_2k_test
11 type: alpaca
12chat_template: chatml
13dataset_prepared_path:
14val_set_size: 0.01
15output_dir: ./out
16
17sequence_len: 4096
18sample_packing: true
19pad_to_sequence_len: true
20eval_sample_packing: false
21
22use_wandb: true
23wandb_project: axolotl
24wandb_entity:
25wandb_watch:
26wandb_name: Jambalpaca-v0.1
27wandb_log_model:
28
29adapter: qlora
30lora_r: 32
31lora_alpha: 64
32lora_dropout: 0.05
33lora_target_linear: true
34
35low_cpu_mem_usage: true
36gradient_accumulation_steps: 8
37micro_batch_size: 1
38num_epochs: 1
39optimizer: adamw_bnb_8bit
40adam_beta2: 0.95
41adam_epsilon: 0.00001
42max_grad_norm: 1.0
43lr_scheduler: cosine
44learning_rate: 0.0002
45
46train_on_inputs: false
47group_by_length: false
48bf16: auto
49fp16:
50tf32: false
51
52gradient_checkpointing: true
53gradient_checkpointing_kwargs:
54 use_reentrant: false
55early_stopping_patience:
56resume_from_checkpoint:
57local_rank:
58logging_steps: 1
59xformers_attention:
60flash_attention: true
61
62warmup_steps: 10
63evals_per_epoch: 4
64saves_per_epoch: 4
65save_total_limit: 2
66debug:
67deepspeed:
68weight_decay: 0.0
69special_tokens:
70| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 0.9332 | 0.17 | 1 | 1.0365 |
| 0.9677 | 0.35 | 2 | 1.0337 |
| 0.9337 | 0.7 | 4 | 0.9899 |