Views
No views yet

| Caractéristique | Valeur | Note d'Impact |
|---|---|---|
| Famille / Type | Modèle de Fondation (Base) / SLM | Nécessite un Fine-Tuning pour l'alignement et les applications finales. |
| Développeur | Clemylia (LLm-Clem) | Créé From Scratch (architecture, tokeniseur, pré-entraînement). |
| Paramètres | $124$ Millions | Taille optimisée pour l'efficacité et le déploiement sur du matériel grand public. |
| Fenêtre de Contexte | $7000$ Tokens | Innovation Majeure : Permet la gestion de documents complets et de conversations Nekolien très longues. |
| Langue | Nekolien (Langue Construite) | Ultra-spécialisé. Ne doit pas être utilisé pour des langues naturelles sans Fine-Tuning extensif. |
| Tokeniseur | Nekolien-tokeniseur | Tokeniseur propriétaire From Scratch, essentiel pour le décodage et l'encodage du Nekolien. |
Nekolien-tokeniseur)| Token | Rôle Conventionnel | Fonction Spécifique |
|---|---|---|
<INKONIA> | UNK (Unknown) | Gère les séquences inconnues non présentes dans le corpus Nekolien. |
<CLASYA> | CLS (Classifier) | Token de classification pour l'encapsulation de séquences (utile en Fine-Tuning). |
<SEPARA> | SEP (Separator) | Utilisé pour marquer la délimitation entre différentes parties d'une séquence de texte. |
<MASKA> | MASK | Nécessaire pour les tâches de Masked Language Modeling (MLM) et de prédiction en Fine-Tuning. |
<MEMA> | Mémory / Métadonnée | Token unique, potentiellement lié à la gestion efficace du contexte étendu ($7000$ tokens). |
<PAD> | Padding | Assure la cohérence de la taille des séquences pour l'efficacité du GPU. |