LLM_MERGE_CC3 est une fusion des modèles suivants créée par ManoloPueblo utilisant
mergekit:
1merge_method: dare
2base_model: mistralai/Mistral-7B-v0.1
3models:
4 - model: mistralai/Mistral-7B-v0.1
5 # No parameters necessary for base model
6 - model: samir-fama/SamirGPT-v1
7 parameters:
8 density: 0.53
9 weight: 0.4
10 - model: abacusai/Slerp-CM-mist-dpo
11 parameters:
12 density: 0.53
13 weight: 0.3
14 - model: EmbeddedLLM/Mistral-7B-Merge-14-v0.2
15 parameters:
16 density: 0.53
17 weight: 0.3
18merge_method: dare_ties
19base_model: mistralai/Mistral-7B-v0.1
20parameters:
21 int8_mask: true
22dtype: bfloat16
LLM_MERGE_CC3 est un modèle de langage créé par la fusion de trois variantes Mistral :
Cette fusion utilise la méthode "dare" avec normalisation et une précision float16 pour combiner les forces des trois modèles.
Le modèle conserve l'architecture de base de Mistral-7B tout en incorporant les améliorations des trois versions à travers une fusion pondérée. La méthode "ties" permet une fusion plus sophistiquée des poids des modèles.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("ManoloPueblo/LLM_MERGE_CC3")
4model = AutoModelForCausalLM.from_pretrained("ManoloPueblo/LLM_MERGE_CC3")
Comme pour tout modèle de langage, les utilisateurs doivent être conscients des biais potentiels et des limitations inhérentes aux modèles sources. Les performances peuvent varier selon les cas d'utilisation.