Views
No views yet

Template: Llama 3
Temperature: 0.8-1
Min P: 0.1-0.12
Repeat Penalty: 1-1.05
Repeat Penalty Tokens: 256epsilon and lambda, but setting them give you more control over the resulting merge so it doesn't hurt to test. All of this is my opinion and flawed testing, ymmv.epsilon dictates the range of what parameters will be 'nulled' per say, which is useful to avoid interference and slop. This is a double edge sword though as the the bigger the range that is, the more 'nulled' the model parameters will be when merging into base. Keep in mind that epsilon is half of that range since the drop probabilities are assigned between density - epsilon to density + epsilon. In my experimenting, anything above an a total of 0.05 per model runs the risk of creating a stylistically duller model and higher then a 0.1 total becomes a noticeably dumber model. I've made epsilon: 0.0175 my personal default value to start.lambda is less complicated as it's just the multiplication factor of the final parameters after the drop probabilities are assigned from the above range. Setting lambda: 1 (I think this is the default setting too) keep things simple and this is usually the best value to keep it at. But, there is a tiny amount of wiggle room. If lambda > 1, you'll get a more expressive merge but lacks creativity with exponential diminishing returns. If lambda <1, the merge gets repetitive yet retains more sanity somehow. There's a time and place for either option. For me, lambda: 1 for the base model and lambda: 1-1.1 or lambda: 0.9-1 for additional models depending the intended purposes.o_proj and down_proj). The others still hold value therefore they still effect the final merge, though to a lesser extent. By being able to split and place where these layers go, I can keep similar layers closer to each other and limit problems down the line.1models:
2 - model: Delta-Vector/Baldur-8B+kromcomp/L3.1-Spark-r64-LoRA
3 - model: NarrativAI/Cakrawala-Llama-3.1-8B
4 - model: maximalists/BRAG-Llama-3.1-8b-v0.1
5base_model: Delta-Vector/Baldur-8B+kromcomp/L3.1-Spark-r64-LoRA
6parameters:
7 normalize: false
8merge_method: model_stock
9chat_template: llama3
10tokenizer:
11 source: union
12dtype: float32
13name: soda
14---
15slices:
16- sources:
17 - layer_range: [0, 12]
18 model: soda
19- sources:
20 - layer_range: [8, 12]
21 model: soda
22 parameters:
23 scale:
24 - filter: o_proj
25 value: 0
26 - filter: down_proj
27 value: 0
28 - value: 1
29- sources:
30 - layer_range: [12, 20]
31 model: soda
32- sources:
33 - layer_range: [16, 20]
34 model: soda
35 parameters:
36 scale:
37 - filter: o_proj
38 value: 0
39 - filter: down_proj
40 value: 0
41 - value: 1
42- sources:
43 - layer_range: [20, 28]
44 model: soda
45- sources:
46 - layer_range: [24, 28]
47 model: soda
48 parameters:
49 scale:
50 - filter: o_proj
51 value: 0
52 - filter: down_proj
53 value: 0
54 - value: 1
55- sources:
56 - layer_range: [28, 32]
57 model: soda
58parameters:
59 int8_mask: true
60merge_method: passthrough
61dtype: float32
62name: pop
63---
64models:
65 - model: NeverSleep/Lumimaid-v0.2-8B+kromcomp/L3.1-Aura-r32-LoRA
66 - model: grimjim/BadApple-o1-Llama-3.1-8B
67 - model: crestf411/L3.1-8B-Slush-v1.1
68base_model: crestf411/L3.1-8B-Slush-v1.1
69parameters:
70 normalize: false
71merge_method: model_stock
72chat_template: llama3
73tokenizer:
74 source: union
75dtype: float32
76name: cider
77---
78slices:
79- sources:
80 - layer_range: [0, 12]
81 model: cider
82- sources:
83 - layer_range: [8, 12]
84 model: cider
85 parameters:
86 scale:
87 - filter: o_proj
88 value: 0
89 - filter: down_proj
90 value: 0
91 - value: 1
92- sources:
93 - layer_range: [12, 20]
94 model: cider
95- sources:
96 - layer_range: [16, 20]
97 model: cider
98 parameters:
99 scale:
100 - filter: o_proj
101 value: 0
102 - filter: down_proj
103 value: 0
104 - value: 1
105- sources:
106 - layer_range: [20, 28]
107 model: cider
108- sources:
109 - layer_range: [24, 28]
110 model: cider
111 parameters:
112 scale:
113 - filter: o_proj
114 value: 0
115 - filter: down_proj
116 value: 0
117 - value: 1
118- sources:
119 - layer_range: [28, 32]
120 model: cider
121parameters:
122 int8_mask: true
123merge_method: passthrough
124dtype: float32
125name: float
126---
127```yaml
128models:
129 - model: float
130 parameters:
131 select_topk: 0.6
132 - model: pop
133 parameters:
134 select_topk: 0.6
135base_model: float
136merge_method: sce
137chat_template: llama3
138tokenizer:
139 source: union
140parameters:
141 int8_mask: true
142dtype: float32
143name: syrup
144---
145models:
146 - model: SicariusSicariiStuff/LLAMA-3_8B_Unaligned_BETA
147 - model: ArliAI/Llama-3.1-8B-ArliAI-RPMax-v1.3+kromcomp/L3-T900-r64-LoRA
148 - model: invisietch/L3.1-EtherealRainbow-v1.0-rc1-8B
149base_model: invisietch/L3.1-EtherealRainbow-v1.0-rc1-8B
150parameters:
151 normalize: false
152merge_method: model_stock
153chat_template: llama3
154tokenizer:
155 source: union
156dtype: float32
157name: semialign
158---
159slices:
160- sources:
161 - layer_range: [0, 12]
162 model: semialign
163- sources:
164 - layer_range: [8, 12]
165 model: semialign
166 parameters:
167 scale:
168 - filter: o_proj
169 value: 0
170 - filter: down_proj
171 value: 0
172 - value: 1
173- sources:
174 - layer_range: [12, 20]
175 model: semialign
176- sources:
177 - layer_range: [16, 20]
178 model: semialign
179 parameters:
180 scale:
181 - filter: o_proj
182 value: 0
183 - filter: down_proj
184 value: 0
185 - value: 1
186- sources:
187 - layer_range: [20, 28]
188 model: semialign
189- sources:
190 - layer_range: [24, 28]
191 model: semialign
192 parameters:
193 scale:
194 - filter: o_proj
195 value: 0
196 - filter: down_proj
197 value: 0
198 - value: 1
199- sources:
200 - layer_range: [28, 32]
201 model: semialign
202parameters:
203 int8_mask: true
204merge_method: passthrough
205dtype: float32
206name: midal
207---
208models:
209 - model: midal
210 parameters:
211 weight: [0.2, 0.8]
212 density: 0.7
213 epsilon: 0.0125
214 lambda: 1.05
215 - model: syrup
216 parameters:
217 weight: [0.8, 0.2]
218 density: 0.7
219 epsilon: 0.0175
220 lambda: 1
221base_model: syrup
222merge_method: della
223chat_template: llama3
224tokenizer:
225 source: midal
226parameters:
227 normalize: false
228 int8_mask: true
229dtype: float32
230name: ir