In light of
dataset contamination issue among the merged models
raised by the community in recent days, in particular
berkeley-nest/Starling-LM-7B-alpha,
Q-bert/MetaMath-Cybertron-Starling, and
janai-hq/trinity-v1,
we decided to remake another model without the models mentioned.
Additionally, their CC-by-NC-4.0 license is restrictive and thus are not suitable for an open model.
The merged model is then merged again with
janai-hq/trinity-v1 using Gradient SLERP.
The result is a base model that performs quite well but requires some further instruction fine-tuning.
1slices:
2 - sources:
3 - model: EmbeddedLLM/Mistral-7B-Merge-14-v0
4 layer_range: [0, 32]
5 - model: janai-hq/trinity-v1
6 layer_range: [0, 32]
7merge_method: slerp
8base_model: EmbeddedLLM/Mistral-7B-Merge-14-v0
9parameters:
10 t:
11 - filter: self_attn
12 value: [0, 0.5, 0.3, 0.7, 1]
13 - filter: mlp
14 value: [1, 0.5, 0.7, 0.3, 0]
15 - value: 0.5
16dtype: bfloat16
17