Views
No views yet
1
2# models:
3# - model: /home/fractal_admin/shreyas/Reasoning/models/FV-30B-A3B
4# - model: /home/fractal_admin/shreyas/Reasoning/models/tongyi-deepresearch
5# merge_method: slerp
6# base_model: /home/fractal_admin/shreyas/Reasoning/models/FV-30B-A3B
7# parameters:
8# t:
9# - filter: self_attn
10# value: [0, 0.5, 0.3, 0.7, 1]
11# - filter: mlp
12# value: [1, 0.5, 0.7, 0.3, 0]
13# - value: 0.5 # fallback for rest of tensors
14# dtype: float16
15
16models:
17 - model: /home/fractal_admin/shreyas/Reasoning/models/FV-30B-A3B
18 - model: /home/fractal_admin/shreyas/Reasoning/models/tongyi-deepresearch
19
20merge_method: slerp
21base_model: /home/fractal_admin/shreyas/Reasoning/models/tongyi-deepresearch
22parameters:
23 t:
24 # Attention = keep more DeepResearch (reasoning patterns live here)
25 - filter: self_attn
26 value: 0.8
27
28 # MLP = keep more HealthBench (knowledge + domain tuning)
29 - filter: mlp
30 value: 0.2
31
32 # fallback
33 - value: 0.5
34
35dtype: bfloat16
36
37
38# mergekit-yaml \
39# /home/fractal_admin/shreyas/Reasoning/mergekit/examples/gradient-slerp.yml \
40# /home/fractal_admin/shreyas/Reasoning/mergekit/merges/gradient_slerp_tongyi_base_attn_0.8_mlp_0.2 \
41# --cuda --lazy-unpickle \
42# --allow-crimes
43