Views
No views yet
0.5.01base_model: mistralai_Mistral-Nemo-Instruct-2407
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4
5plugins:
6 - axolotl.integrations.liger.LigerPlugin
7liger_rope: true
8liger_rms_norm: true
9liger_swiglu: true
10liger_fused_linear_cross_entropy: true
11
12load_in_8bit: false
13load_in_4bit: false
14strict: false
15
16datasets:
17 - path: NewEden/OpenCAI-ShareGPT
18 type: chat_template
19# chat_template: mistralv3tekken
20 roles_to_train: ["gpt"]
21 field_messages: conversations
22 message_field_role: from
23 message_field_content: value
24 train_on_eos: turn
25 - path: NewEden/vanilla-backrooms-claude-sharegpt
26 type: chat_template
27# chat_template: mistralv3tekken
28 roles_to_train: ["gpt"]
29 field_messages: conversations
30 message_field_role: from
31 message_field_content: value
32 train_on_eos: turn
33 - path: anthracite-org/kalo_opus_misc_240827
34 type: chat_template
35# chat_template: mistralv3tekken
36 roles_to_train: ["gpt"]
37 field_messages: conversations
38 message_field_role: from
39 message_field_content: value
40 train_on_eos: turn
41 - path: anthracite-org/kalo_misc_part2
42 type: chat_template
43# chat_template: mistralv3tekken
44 roles_to_train: ["gpt"]
45 field_messages: conversations
46 message_field_role: from
47 message_field_content: value
48 train_on_eos: turn
49 - path: NewEden/Roleplay-Logs-V2
50 type: chat_template
51# chat_template: mistralv3tekken
52 roles_to_train: ["gpt"]
53 field_messages: conversations
54 message_field_role: from
55 message_field_content: value
56 train_on_eos: turn
57dataset_prepared_path: dataset_prepared
58val_set_size: 0.0
59output_dir: 12b-out-r3
60
61sequence_len: 16384
62sample_packing: true
63pad_to_sequence_len: true
64
65adapter: lora
66lora_model_dir:
67lora_r: 32
68lora_alpha: 16
69lora_dropout: 0.05
70 #lora_target_linear:
71 #lora_fan_in_fan_out: true
72peft_use_rslora: true
73lora_target_modules:
74 - gate_proj
75 - down_proj
76 - up_proj
77 - q_proj
78 - v_proj
79 - k_proj
80 - o_proj
81
82lora_modules_to_save:
83 - embed_tokens
84 - lm_head
85
86
87wandb_project: 12b-control
88wandb_entity:
89wandb_watch:
90wandb_name: 12b-control-r3
91wandb_log_model:
92
93gradient_accumulation_steps: 2
94micro_batch_size: 1
95num_epochs: 4
96optimizer: paged_adamw_8bit
97lr_scheduler: cosine
98learning_rate: 0.00001
99
100train_on_inputs: false
101group_by_length: false
102bf16: auto
103fp16:
104tf32: false
105
106gradient_checkpointing: unsloth
107 #gradient_checkpointing_kwargs:
108 # use_reentrant: false
109early_stopping_patience:
110resume_from_checkpoint:
111local_rank:
112logging_steps: 1
113xformers_attention:
114flash_attention: true
115
116warmup_steps: 40
117evals_per_epoch:
118eval_table_size:
119eval_max_new_tokens:
120saves_per_epoch: 1
121debug:
122deepspeed: /workspace/axolotl/deepspeed_configs/zero3_bf16.json
123weight_decay: 0.03
124fsdp:
125fsdp_config:
126special_tokens:
127 pad_token: <pad>
128
129