Views
No views yet
0.13.0.dev01base_model: /home/alex/Workspace/sllama/out_5/checkpoint-1722000
2trust_remote_code: true
3resize_token_embeddings_to_32x: true
4plugins:
5 - axolotl.integrations.cut_cross_entropy.CutCrossEntropyPlugin
6 - axolotl.integrations.liger.LigerPlugin
7liger_rope: true
8liger_rms_norm: true
9liger_glu_activation: true
10liger_layer_norm: true
11
12unfrozen_parameters:
13 - ^(?![\s\S]*embed_tokens)[\s\S]+$
14
15datasets:
16 - path: fw_merged
17 type: input_output
18 shards: 8
19 shards_idx: 0
20
21dataloader_num_workers: 0
22group_by_length: false
23dataset_prepared_path: data_prep
24output_dir: ./out_6
25dataloader_pin_memory: true
26shuffle_merged_datasets: false
27
28sequence_len: 2048
29sample_packing: false
30eval_sample_packing: false
31pad_to_sequence_len: true
32
33use_tensorboard: true
34use_wandb: true
35wandb_project: sllama
36
37gradient_accumulation_steps: 16
38
39micro_batch_size: 1
40num_epochs: 1
41#max_steps: 1_000_000
42save_steps: 500
43save_total_limit: 2
44save_only_model: true
45optimizer: sgd
46optim_args:
47 momentum: 0.98
48lr_scheduler: constant
49learning_rate: 0.1
50#embedding_lr: 5e-7
51#cosine_constant_lr_ratio: 0.1
52max_grad_norm: 1.0
53
54bf16: auto
55fp8: false
56
57gradient_checkpointing: false
58gradient_checkpointing_kwargs:
59 use_reentrant: false
60
61logging_steps: 10
62torch_compile: false
63torch_compile_backend: inductor
64torch_compile_mode: default
65flash_attention: true
66
67#warmup_ratio: 0.05
68weight_decay: 0.01
69