AlphaMonarch-laser is a DPO fine-tuned of
mlabonne/NeuralMonarch-7B using the
argilla/OpenHermes2.5-dpo-binarized-alpha preference dataset but achieves better performance then
mlabonne/AlphaMonarch-7B using LaserQLoRA. I have fine-tuned this model only on half of the projections, but have achieved better results as compared to the version released by Maximme Labonne. I have trained this model for 1080 steps.
AlphaMonarch-laser is ranking 1 on YALL -
Yet Another LLM Leaderboard .
image/png
1 base_model : mlabonne/NeuralMonarch - 7B
2 model_type : MistralForCausalLM
3 tokenizer_type : LlamaTokenizer
4 is_mistral_derived_model : true
5 load_in_8bit : false
6 load_in_4bit : true
7 strict : false
8 rl : dpo
9 chat_template : chatml
10 datasets :
11 - path : mlabonne/chatml - OpenHermes2.5 - dpo - binarized - alpha
12 split : train
13 type : chatml.intel
14 dataset_prepared_path :
15 val_set_size : 0.01
16 output_dir : ./out
17 adapter : qlora
18 lora_model_dir :
19 sequence_len : 1800
20 sample_packing : false
21 pad_to_sequence_len : false
22 lora_r : 16
23 lora_alpha : 16
24 lora_dropout : 0.05
25 lora_target_linear : true
26 lora_fan_in_fan_out :
27 lora_target_modules :
28 - layers.1.self_attn.q_proj
29 - layers.0.self_attn.q_proj
30 - layers.15.self_attn.q_proj
31 - layers.12.self_attn.q_proj
32 - layers.11.self_attn.q_proj
33 - layers.14.self_attn.q_proj
34 - layers.9.self_attn.q_proj
35 - layers.16.self_attn.q_proj
36 - layers.30.self_attn.q_proj
37 - layers.18.self_attn.q_proj
38 - layers.13.self_attn.q_proj
39 - layers.10.self_attn.q_proj
40 - layers.7.self_attn.q_proj
41 - layers.8.self_attn.q_proj
42 - layers.4.self_attn.q_proj
43 - layers.19.self_attn.q_proj
44 - layers.27.self_attn.k_proj
45 - layers.24.self_attn.k_proj
46 - layers.25.self_attn.k_proj
47 - layers.22.self_attn.k_proj
48 - layers.26.self_attn.k_proj
49 - layers.29.self_attn.k_proj
50 - layers.23.self_attn.k_proj
51 - layers.28.self_attn.k_proj
52 - layers.21.self_attn.k_proj
53 - layers.31.self_attn.k_proj
54 - layers.30.self_attn.k_proj
55 - layers.20.self_attn.k_proj
56 - layers.5.self_attn.k_proj
57 - layers.19.self_attn.k_proj
58 - layers.17.self_attn.k_proj
59 - layers.18.self_attn.k_proj
60 - layers.19.self_attn.v_proj
61 - layers.24.self_attn.v_proj
62 - layers.18.self_attn.v_proj
63 - layers.5.self_attn.v_proj
64 - layers.3.self_attn.v_proj
65 - layers.16.self_attn.v_proj
66 - layers.23.self_attn.v_proj
67 - layers.27.self_attn.v_proj
68 - layers.25.self_attn.v_proj
69 - layers.26.self_attn.v_proj
70 - layers.20.self_attn.v_proj
71 - layers.6.self_attn.v_proj
72 - layers.15.self_attn.v_proj
73 - layers.17.self_attn.v_proj
74 - layers.29.self_attn.v_proj
75 - layers.22.self_attn.v_proj
76 - layers.12.self_attn.o_proj
77 - layers.9.self_attn.o_proj
78 - layers.14.self_attn.o_proj
79 - layers.0.self_attn.o_proj
80 - layers.6.self_attn.o_proj
81 - layers.8.self_attn.o_proj
82 - layers.10.self_attn.o_proj
83 - layers.11.self_attn.o_proj
84 - layers.13.self_attn.o_proj
85 - layers.24.self_attn.o_proj
86 - layers.7.self_attn.o_proj
87 - layers.15.self_attn.o_proj
88 - layers.5.self_attn.o_proj
89 - layers.17.self_attn.o_proj
90 - layers.25.self_attn.o_proj
91 - layers.4.self_attn.o_proj
92 - layers.31.mlp.gate_proj
93 - layers.30.mlp.gate_proj
94 - layers.4.mlp.gate_proj
95 - layers.3.mlp.gate_proj
96 - layers.29.mlp.gate_proj
97 - layers.28.mlp.gate_proj
98 - layers.6.mlp.gate_proj
99 - layers.27.mlp.gate_proj
100 - layers.5.mlp.gate_proj
101 - layers.26.mlp.gate_proj
102 - layers.25.mlp.gate_proj
103 - layers.7.mlp.gate_proj
104 - layers.2.mlp.gate_proj
105 - layers.24.mlp.gate_proj
106 - layers.23.mlp.gate_proj
107 - layers.10.mlp.gate_proj
108 - layers.6.mlp.up_proj
109 - layers.4.mlp.up_proj
110 - layers.5.mlp.up_proj
111 - layers.27.mlp.up_proj
112 - layers.25.mlp.up_proj
113 - layers.26.mlp.up_proj
114 - layers.17.mlp.up_proj
115 - layers.24.mlp.up_proj
116 - layers.7.mlp.up_proj
117 - layers.10.mlp.up_proj
118 - layers.3.mlp.up_proj
119 - layers.11.mlp.up_proj
120 - layers.23.mlp.up_proj
121 - layers.9.mlp.up_proj
122 - layers.14.mlp.up_proj
123 - layers.18.mlp.up_proj
124 - layers.19.mlp.down_proj
125 - layers.20.mlp.down_proj
126 - layers.18.mlp.down_proj
127 - layers.21.mlp.down_proj
128 - layers.29.mlp.down_proj
129 - layers.1.mlp.down_proj
130 - layers.22.mlp.down_proj
131 - layers.28.mlp.down_proj
132 - layers.23.mlp.down_proj
133 - layers.30.mlp.down_proj
134 - layers.17.mlp.down_proj
135 - layers.4.mlp.down_proj
136 - layers.2.mlp.down_proj
137 - layers.15.mlp.down_proj
138 - layers.5.mlp.down_proj
139 wandb_project : axolotl
140 wandb_entity :
141 wandb_watch :
142 wandb_name :
143 wandb_log_model :
144 gradient_accumulation_steps : 8
145 micro_batch_size : 1
146 num_epochs : 1
147 optimizer : paged_adamw_32bit
148 lr_scheduler : cosine
149 learning_rate : 5e-7
150 train_on_inputs : false
151 group_by_length : false
152 bf16 : true
153 fp16 : false
154 tf32 : true
155 gradient_checkpointing : true
156 early_stopping_patience :
157 resume_from_checkpoint :
158 local_rank :
159 logging_steps : 1
160 xformers_attention :
161 flash_attention : true
162 warmup_steps : 100
163 evals_per_epoch : 1
164 eval_table_size :
165 eval_table_max_new_tokens : 128
166 save_steps : 1080
167 max_steps : 1080
168 debug :
169 deepspeed :
170 weight_decay : 0.0
171 fsdp :
172 fsdp_config :
173 special_tokens :