This is a merge of pre-trained language models created using
mergekit.
This model was merged using the
SLERP merge method.
1base_model: YOYO-AI/Qwen2.5-14B-1M-YOYO-V3
2dtype: bfloat16
3merge_method: slerp
4parameters:
5 t:
6 - filter: self_attn
7 value: [0.8, 0.7, 0.6, 0.5, 0.4] # More weight to YOYO (IFEval is instruction following)
8 - filter: mlp
9 value: [0.4, 0.5, 0.6, 0.7, 0.8] # More weight to MegaFusion (MuSR + GPQA need better reasoning)
10 - filter: input_layernorm|post_attention_layernorm
11 value: 0.6
12 - value: 0.5
13slices:
14- sources:
15 - layer_range: [0, 48] # Early layers focused on IFEval
16 model: YOYO-AI/Qwen2.5-14B-1M-YOYO-V3
17 - layer_range: [0, 48] # Later layers focused on reasoning (MuSR + GPQA)
18 model: Lunzima/NQLSG-Qwen2.5-14B-MegaFusion-v8
19