This is a merge of pre-trained language models created using
mergekit.
This model was merged using the
SLERP merge method.
1slices:
2 - sources:
3 - model: Theros/Qwen2.5-ColdBrew-R1-test3
4 layer_range: [0, 28]
5 - model: bunnycore/Qwen-2.5-7B-Stock-Deep-Bespoke-v2
6 layer_range: [0, 28]
7merge_method: slerp
8base_model: Theros/Qwen2.5-ColdBrew-R1-test3
9parameters:
10 t:
11 - filter: self_attn
12 value: [0.3, 0.5, 0.6, 0.6, 0.7] # Avoids extreme low/high fluctuations
13 - filter: mlp
14 value: [0.7, 0.6, 0.5, 0.4, 0.3] # Gradual shift, avoiding an early MLP spike
15 - value: 0.5
16dtype: bfloat16
17tokenizer_source: union