This is a merge of pre-trained language models created using
mergekit.
This model was merged using the
Linear DELLA merge method using
deepseek-ai/DeepSeek-R1-Distill-Llama-70B as a base.
1merge_method: della_linear
2base_model: deepseek-ai/DeepSeek-R1-Distill-Llama-70B
3tokenizer_source: "unsloth/Llama-3.3-70B-Instruct"
4dtype: float16
5parameters:
6 epsilon: 0.05 # Fine-grain scaling for precision.
7 lambda: 1.6 # Strong emphasis on top-performing models.
8 normalize: true # Stable parameter integration across models.
9adaptive_merge_parameters:
10 task_weights:
11 tinyArc: 2.0 # Увеличиваем вес для логического рассуждения.
12 tinyHellaswag: 1.75 # Увеличиваем для контекстных предсказаний.
13 tinyMMLU: 2.0 # Увеличиваем для доменных знаний.
14 tinyTruthfulQA: 2.2 # Увеличиваем приоритет правдивого рассуждения.
15 tinyTruthfulQA_mc1: 2.0 # Поддерживаем высокий приоритет для многоразовых вопросов.
16 tinyWinogrande: 2.0 # Увеличиваем для сложного рассуждения и предсказаний.
17 IFEval: 2.1 # Поддерживаем высокий приоритет для выполнения инструкций и многозадачности.
18 BBH: 2.0 # Увеличиваем для комплексного рассуждения.
19 MATH: 2.5 # Увеличиваем вес математического рассуждения для акцента на точности.
20 GPQA: 2.3 # Увеличиваем вес для фактического QA.
21 MUSR: 2.1 # Поддерживаем высокий приоритет для многошагового рассуждения.
22 MMLU-PRO: 2.3 # Поддерживаем высокие показатели в многозадачности по доменам.
23 smoothing_factor: 0.1 # Сглаживание остается прежним для плавного смешивания.
24
25models:
26 - model: nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
27 parameters:
28 weight: 1
29 density: 1
30 - model: deepseek-ai/DeepSeek-R1-Distill-Llama-70B
31 parameters:
32 weight: 1
33 density: 1
34