Views
No views yet

1merge_method: model_stock
2base_model: Instruction Model
3models:
4 - model: Instruction Fine-tuning Model 1
5 - model: Instruction Fine-tuning Model 2
6 - model: Inference Fine-tuning Model 1
7 - model: Inference Fine-tuning Model 2
8dtype: bfloat16
9tokenizer_source: base
10int8_mask: true
11normalize: true | Metric | Value |
|---|---|
| Avg. | 43.14 |
| IFEval (0-Shot) | 83.65 |
| BBH (3-Shot) | 50.27 |
| MATH Lvl 5 (4-Shot) | 53.93 |
| GPQA (0-shot) | 8.61 |
| MuSR (0-shot) | 15.66 |
| MMLU-PRO (5-shot) | 46.71 |
1models:
2 - model: Qwen/Qwen2.5-14B-Instruct
3 parameters:
4 density: 1
5 weight: 1
6 lambda: 0.9
7 - model: Qwen/Qwen2.5-14B-Instruct-1M
8 parameters:
9 density: 1
10 weight: 1
11 lambda: 0.9
12merge_method: della
13base_model: Qwen/Qwen2.5-14B
14parameters:
15 density: 1
16 weight: 1
17 lambda: 0.9
18 normalize: true
19 int8_mask: true
20dtype: bfloat16
21tokenizer_source: base
22name: Qwen2.5-14B-della-base1models:
2 - model: Qwen/Qwen2.5-14B-Instruct
3 parameters:
4 density: 1
5 weight: 1
6 lambda: 0.9
7 - model: Qwen/Qwen2.5-14B-Instruct-1M
8 parameters:
9 density: 1
10 weight: 1
11 lambda: 0.9
12merge_method: della
13base_model: arcee-ai/Virtuoso-Small-v2
14parameters:
15 density: 1
16 weight: 1
17 lambda: 0.9
18 normalize: true
19 int8_mask: true
20dtype: bfloat16
21tokenizer_source: base
22name: Qwen2.5-14B-della-v21models:
2 - model: Qwen/Qwen2.5-14B-Instruct
3 parameters:
4 density: 1
5 weight: 1
6 lambda: 0.9
7 - model: Qwen/Qwen2.5-14B-Instruct-1M
8 parameters:
9 density: 1
10 weight: 1
11 lambda: 0.9
12merge_method: della
13base_model: arcee-ai/SuperNova-Medius
14parameters:
15 density: 1
16 weight: 1
17 lambda: 0.9
18 normalize: true
19 int8_mask: true
20dtype: bfloat16
21tokenizer_source: base
22name: Qwen2.5-14B-della-Nova1models:
2 - model: Qwen/Qwen2.5-14B-Instruct
3 parameters:
4 density: 1
5 weight: 1
6 lambda: 0.9
7 - model: Qwen/Qwen2.5-14B-Instruct-1M
8 parameters:
9 density: 1
10 weight: 1
11 lambda: 0.9
12merge_method: della
13base_model: Azure99/Blossom-V6-14B
14parameters:
15 density: 1
16 weight: 1
17 lambda: 0.9
18 normalize: true
19 int8_mask: true
20dtype: bfloat16
21tokenizer_source: base
22name: Qwen2.5-14B-della-V61models:
2 - model: Qwen/Qwen2.5-Coder-14B-Instruct
3 parameters:
4 density: 1
5 weight: 1
6 lambda: 0.9
7merge_method: della
8base_model: Qwen/Qwen2.5-Coder-14B
9parameters:
10 density: 1
11 weight: 1
12 lambda: 0.9
13 normalize: true
14 int8_mask: true
15dtype: bfloat16
16tokenizer_source: base
17name: Qwen2.5-Coder-14B-della1merge_method: model_stock
2base_model: Qwen2.5-14B-della-base
3models:
4 - model: Qwen2.5-Coder-14B-della
5 - model: Qwen2.5-14B-della-v2
6 - model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
7 - model: huihui-ai/DeepSeek-R1-Distill-Qwen-14B-abliterated-v2
8dtype: bfloat16
9tokenizer_source: base
10int8_mask: true
11normalize: true
12name: Qwen2.5-14B-mst-Coder1merge_method: model_stock
2base_model: Qwen2.5-14B-della-base
3models:
4 - model: Qwen2.5-14B-della-V6
5 - model: Qwen2.5-14B-della-v2
6 - model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
7 - model: huihui-ai/DeepSeek-R1-Distill-Qwen-14B-abliterated-v2
8dtype: bfloat16
9tokenizer_source: base
10int8_mask: true
11normalize: true
12name: Qwen2.5-14B-mst-V61merge_method: model_stock
2base_model: Qwen2.5-14B-della-base
3models:
4 - model: Qwen2.5-14B-della-Nova
5 - model: Qwen2.5-14B-della-v2
6 - model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
7 - model: huihui-ai/DeepSeek-R1-Distill-Qwen-14B-abliterated-v2
8dtype: bfloat16
9tokenizer_source: base
10int8_mask: true
11normalize: true
12name: Qwen2.5-14B-mst-Nova1merge_method: model_stock
2base_model: Qwen2.5-14B-della-base
3models:
4 - model: Qwen2.5-14B-della-Nova
5 - model: Qwen2.5-14B-della-v2
6 - model: Qwen2.5-14B-della-V6
7dtype: bfloat16
8tokenizer_source: base
9int8_mask: true
10normalize: true
11name: Qwen2.5-14B-mst-it1merge_method: sce
2models:
3 # Pivot model
4 - model: Qwen/Qwen2.5-14B-Instruct-1M
5 # Target models
6 - model: Qwen/Qwen2.5-14B
7base_model: Qwen/Qwen2.5-14B-Instruct-1M
8parameters:
9 select_topk: 1
10dtype: bfloat16
11tokenizer_source: base
12normalize: true
13int8_mask: true
14name: Qwen2.5-14B-1M1models:
2 - model: Qwen/Qwen2.5-14B-Instruct
3 parameters:
4 density: 1
5 weight: 1
6 lambda: 0.9
7 - model: Qwen/Qwen2.5-14B-Instruct-1M
8 parameters:
9 density: 1
10 weight: 1
11 lambda: 0.9
12merge_method: della
13base_model: Qwen2.5-14B-1M
14parameters:
15 density: 1
16 weight: 1
17 lambda: 0.9
18 normalize: true
19 int8_mask: true
20dtype: bfloat16
21tokenizer_source: base
22name: Qwen2.5-14B-della-1M1merge_method: model_stock
2base_model: Qwen2.5-14B-della-1M
3models:
4 - model: Qwen2.5-14B-mst-Coder
5 - model: Qwen2.5-14B-mst-V6
6 - model: Qwen2.5-14B-mst-Nova
7 - model: Qwen2.5-14B-mst-it
8dtype: bfloat16
9tokenizer_source: base
10int8_mask: true
11normalize: true
12name: ZYH-LLM-Qwen2.5-14B-V4