Fine-tuning LoRA du modèle facebook/nllb-200-distilled-600M pour la traduction vers le Pulaar Fouta-Toro (code NLLB : fuv_Latn), langue peule peu dotée parlée en Mauritanie et au Sénégal.
Auteurs : Hamath Kane · Abou Sy (corpus quotidien)
Ce que ce modèle fait bien
Traduction du Coran (arabe → Pulaar, français → Pulaar) : entraîné sur 11 472 paires de versets, c'est l'usage le plus fiable.
"Je viens." → Mi arii.
"Je ne comprends pas." → Mi faamataa.
"Comment t'appelles-tu ?" → Hol innde ma ?
"C'est bon." → Ɗuum ina moƴƴi.
"Au nom d'Allah..." → E innde Alla jurmotooɗo
Limites — À lire avant d'utiliser
Ce modèle est expérimental sur le vocabulaire quotidien.
Erreurs observées :
Peut insérer des mots en anglais ("hello" dans une réponse fr→pul)
Traductions incorrectes sur des expressions communes ("Merci beaucoup" → E jaagorɗe keewɗe au lieu de A jaaraama no feewi)
Invente des mots pour le vocabulaire spécialisé absent du corpus (faune, médical)
Les mots isolés (sans contexte de phrase) donnent de mauvais résultats
Cause : le corpus quotidien (~860 paires) reste minoritaire face au corpus coranique (11 472 paires), même avec sur-échantillonnage ×3. Un volume de 3 000–5 000 paires quotidiennes est nécessaire pour fiabiliser cet axe.
v5 en développement avec davantage de phrases conversationnelles.
Benchmark quotidien (50 paires réservées, non vues en train)
Axe
BLEU
chrF++
fr → Pulaar
7.74
11.87
Le score quotidien bas reflète en partie la difficulté du benchmark (mots isolés rares). Les phrases conversationnelles courantes fonctionnent mieux que ce score ne le suggère. Voir les limites ci-dessus pour le détail des erreurs réelles.
Données d'entraînement
Corpus
Paires
Source
Coran ar+fr → Pulaar
11 472
Traduction de référence Pulaar Fouta-Toro
Quotidien fr → Pulaar (×3)
2 427 (809 × 3)
Abou Sy — dataset_quotidien_v4
Total
13 899
Test quotidien : 50 paires réservées (anti-fuite), exclues du train.
Architecture
Modèle de base : facebook/nllb-200-distilled-600M
Méthode : LoRA (PEFT) — continual fine-tuning depuis v2