Views
No views yet
0.6.01base_model: /workspace/models/llama-3.2-3b-wizard
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9chat_template: llama3
10datasets:
11 - path: json
12 data_files:
13 - /workspace/data/numina-20k/train.jsonl
14 type: chat_template
15 field_messages: messages
16 message_field_role: role
17 message_field_content: content
18
19val_set_size: 0.0
20output_dir: /workspace/models/llama-3.2-3b-math
21
22sequence_len: 4096
23sample_packing: true
24pad_to_sequence_len: true
25
26wandb_project:
27wandb_entity:
28wandb_watch:
29wandb_name:
30wandb_log_model:
31
32gradient_accumulation_steps: 8
33micro_batch_size: 2
34num_epochs: 3
35optimizer: paged_adamw_8bit
36lr_scheduler: constant
37learning_rate: 2e-5
38
39train_on_inputs: false
40group_by_length: false
41bf16: auto
42fp16:
43tf32: false
44
45gradient_checkpointing: true
46gradient_checkpointing_kwargs:
47 use_reentrant: false
48early_stopping_patience:
49resume_from_checkpoint:
50logging_steps: 2
51xformers_attention:
52flash_attention: true
53
54warmup_steps: 100
55evals_per_epoch: 2
56eval_table_size:
57saves_per_epoch: 1
58save_total_limit: 10
59debug:
60deepspeed: /workspace/axolotl-0.6.0/deepspeed_configs/zero3_bf16.json
61weight_decay: 0.0
62fsdp:
63fsdp_config:
64special_tokens:
65 pad_token: <|end_of_text|>
66