Views
No views yet
SYSTEM: {system_message}
USER: {prompt}
ASSISTANT:max_position_embeddings in config.json to a lower value than 200,000, otherwise you will OOM! I do not recommend running high context without context-efficient backends like exllamav2 or unsloth.1models:
2 - model: /home/alpha/Storage/Models/Raw/chargoddard_Yi-34B-200K-Llama
3 # No parameters necessary for base model
4 - model: /home/alpha/Storage/Models/Raw/migtissera_Tess-34B-v1.4
5 parameters:
6 weight: [0.23, 0.125, 0.125, 0.125, 0.125, 0.125]
7 density: 0.59
8 - model: /home/alpha/Models/Raw/Mihaiii_Pallas-0.5
9 parameters:
10 weight: [0.23, 0.125, 0.125, 0.125, 0.125, 0.125]
11 density: 0.59
12 - model: /home/alpha//Storage/Models/Raw/bhenrym14_airoboros-3_1-yi-34b-200k
13 parameters:
14 weight: [0.02, 0.106, 0.106, 0.106, 0.106, 0.106]
15 density: 0.59
16 - model: /home/alpha/Storage/Models/Raw/jondurbin_bagel-34b-v0.2
17 #Only the SFT in the main merge since the DPO version seems to have no long context ability at all
18 parameters:
19 weight: [0.02, 0.100, 0.100, 0.100, 0.100, 0.100]
20 density: 0.4
21 - model: /home/alpha/Storage/Models/Raw/kyujinpy_PlatYi-34B-200k-Q-FastChat
22 parameters:
23 weight: [0.02, 0.100, 0.100, 0.100, 0.100, 0.100]
24 density: 0.59
25 #- model: /home/alpha/Storage/Models/Raw/ehartford_dolphin-2.2-yi-34b-200k
26 # Dolphin 200K seems to be funky according to multiple leaderboards and perplexity tests?
27 # parameters:
28 # weight: 0.15
29 # density: 0.6
30 - model: /home/alpha/Models/Raw/adamo1139_Yi-34B-200K-AEZAKMI-v2
31 parameters:
32 weight: [0.02, 0.110, 0.110, 0.110, 0.110, 0.110]
33 density: 0.59
34 - model: /home/alpha/Storage/Models/Raw/Nous-Capybara-34B
35 parameters:
36 weight: [0.22, 0.126, 0.126, 0.126, 0.126, 0.126]
37 density: 0.59
38 - model: /home/alpha/Storage/Models/Raw/4kmerge
39 parameters:
40 weight: [0.02, 0.108, 0.108, 0.108, 0.108, 0.108]
41 density: 0.5
42 - model: /home/alpha/Models/Raw/migtissera_Tess-M-Creative-v1.0
43 parameters:
44 weight: [0.22, 0.100, 0.100, 0.100, 0.100, 0.10]
45 density: 0.59
46merge_method: dare_ties
47tokenizer_source: union
48base_model: /home/alpha/Storage/Models/Raw/chargoddard_Yi-34B-200K-Llama
49parameters:
50 int8_mask: true
51dtype: bfloat16
521models:
2 - model: /home/alpha/Models/Raw/chargoddard_Yi-34B-Llama
3 # No parameters necessary for base model
4 - model: /home/alpha/Storage/Models/Raw/chargoddard_Yi-34B-200K-Llama
5 parameters:
6 weight: 0.5
7 density: 1
8 - model: /home/alpha/Models/Raw/SUSTech_SUS-Chat-34B
9 parameters:
10 weight: 0.2
11 density: 0.12
12 - model: /home/alpha/Models/Raw/jondurbin_bagel-dpo-34b-v0.2
13 parameters:
14 weight: 0.2
15 density: 0.15
16 - model: /home/alpha/Models/Raw/jondurbin_bagel-34b-v0.2
17 parameters:
18 weight: 0.1
19 density: 0.12
20merge_method: dare_ties
21tokenizer_source: union
22base_model: /home/alpha/Models/Raw/chargoddard_Yi-34B-Llama
23parameters:
24 int8_mask: true
25dtype: bfloat16| Metric | Value |
|---|---|
| Avg. | 73.12 |
| AI2 Reasoning Challenge (25-Shot) | 68.09 |
| HellaSwag (10-Shot) | 85.99 |
| MMLU (5-Shot) | 77.30 |
| TruthfulQA (0-shot) | 58.90 |
| Winogrande (5-shot) | 83.11 |
| GSM8k (5-shot) | 65.35 |