This is a merge of pre-trained language models created using
mergekit.
I tried to merge two of the best Italian LLMs using Mergekit. The results are acceptable, but I could not improve on the best existing model.
This model was merged using the SLERP merge method.
1
2slices:
3- sources:
4 - model: swap-uniba/LLaMAntino-3-ANITA-8B-Inst-DPO-ITA
5 layer_range:
6 - 0
7 - 32
8 - model: DeepMount00/Llama-3-8b-Ita
9 layer_range:
10 - 0
11 - 32
12merge_method: slerp
13base_model: swap-uniba/LLaMAntino-3-ANITA-8B-Inst-DPO-ITA
14parameters:
15 t:
16 - filter: self_attn
17 value:
18 - 0
19 - 0.5
20 - 0.3
21 - 0.7
22 - 1
23 - filter: mlp
24 value:
25 - 1
26 - 0.5
27 - 0.7
28 - 0.3
29 - 0
30 - value: 0.5
31dtype: bfloat16
32