Views
No views yet
1models:
2 - model: Qwen/Qwen3-0.6B # Base
3 - model: suayptalha/Qwen3-0.6B-Code-Expert
4 parameters:
5 weight: 0.3 # General coding
6 - model: suayptalha/Qwen3-0.6B-Math-Expert
7 parameters:
8 weight: 0.3 # Math specialist
9 - model: Redhanuman/Shadow-0.7B
10 parameters:
11 weight: 0.35 # **BUMPED UP** - reasoning/CoT powerhouse
12 - model: yarin-shaked/Qwen3-Codeforces-GRPO
13 parameters:
14 weight: 0.25 # Competitive programming
15
16merge_method: breadcrumbs_ties
17base_model: Qwen/Qwen3-0.6B
18
19parameters:
20 density: 0.6 # TIES trim
21 beta: 0.1 # Breadcrumbs outliers
22 alpha: 0.1 # Breadcrumbs negligible
23 t_ie: false # Skip TIES norm (specialists)
24 normalize: true # L2 normalize deltas
25 int8_mask: true
26
27dtype: bfloat16
28random_seed: 0
29
30tokenizer:
31 source: union # Safe vocab merge
32