This is a merge of pre-trained language models created using
mergekit.
This model was merged using the Passthrough merge method.
1chat_template: llama3
2dtype: float32
3merge_method: passthrough
4modules:
5 default:
6 slices:
7 - sources:
8 - layer_range: [0, 8]
9 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
10 - sources:
11 - layer_range: [4, 8]
12 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
13 parameters:
14 scale:
15 - filter: o_proj
16 value: 0.0
17 - filter: down_proj
18 value: 0.0
19 - value: 1.0
20 - sources:
21 - layer_range: [8, 12]
22 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
23 - sources:
24 - layer_range: [8, 12]
25 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
26 parameters:
27 scale:
28 - filter: o_proj
29 value: 0.0
30 - filter: down_proj
31 value: 0.0
32 - value: 1.0
33 - sources:
34 - layer_range: [12, 16]
35 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
36 - sources:
37 - layer_range: [12, 16]
38 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
39 parameters:
40 scale:
41 - filter: o_proj
42 value: 0.0
43 - filter: down_proj
44 value: 0.0
45 - value: 1.0
46 - sources:
47 - layer_range: [16, 28]
48 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
49 - sources:
50 - layer_range: [24, 28]
51 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
52 parameters:
53 scale:
54 - filter: o_proj
55 value: 0.0
56 - filter: down_proj
57 value: 0.0
58 - value: 1.0
59 - sources:
60 - layer_range: [28, 32]
61 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
62 - sources:
63 - layer_range: [30, 32]
64 model: Jackrong/gpt-oss-120b-Distill-Llama3.1-8B-v2+kromcomp/L3.1-Epos-r32-LoRA
65 parameters:
66 scale:
67 - filter: o_proj
68 value: 0.0
69 - filter: down_proj
70 value: 0.0
71 - value: 1.0