Ce dépôt contient une version fine-tunée du modèle Whisper pour la reconnaissance vocale automatique (ASR) en Wolof, une langue parlée principalement au Sénégal, en Gambie, et en Mauritanie. Ce modèle utilise l'architecture Whisper, conçue pour les tâches de transcription vocale et de génération conditionnelle.
Caractéristiques principales
Architecture basée sur Whisper
Encodeur et décodeur composés de 12 couches chacun.
Utilisation d'une attention multi-tête optimisée (WhisperSdpaAttention).
Gestion d'un vocabulaire étendu de 51 865 tokens pour une grande diversité linguistique.
Optimisation pour le Wolof
Fine-tuning effectué sur un corpus spécifique en Wolof.
Capable de transcrire des échantillons audio en texte avec un Word Error Rate (WER) compétitif.
Exemples d'application
Transcription audio de conversations en Wolof.
Utilisation dans des contextes académiques, éducatifs et de recherche linguistique.
Performances
WER moyen : 12%
WER sur des échantillons bruyants : 15%
Évaluations basées sur des données de test spécifiques au Wolof.
Exemple d'utilisation
Voici un exemple simple pour utiliser le modèle avec la bibliothèque Hugging Face Transformers :
python
1from transformers import WhisperForConditionalGeneration, WhisperProcessor
2import torch
34# Charger le modèle et le processeur5model = WhisperForConditionalGeneration.from_pretrained("votre-nom-dépôt")6processor = WhisperProcessor.from_pretrained("votre-nom-dépôt")78# Prétraiter l'audio (spectrogramme ou entrée audio bruite)9audio_input =...# Charger un spectrogramme ou des données audio prétraitées10inputs = processor(audio_input, return_tensors="pt").input_features
1112# Générer la transcription13predicted_ids = model.generate(inputs)14transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)1516print("Transcription :", transcription)
Sauvegardez le modèle fine-tuné et chargez-le comme montré dans les exemples ci-dessus.
À propos
Ce modèle a été développé dans le cadre d'un projet visant à promouvoir la reconnaissance vocale pour les langues sous-représentées comme le Wolof. N'hésitez pas à contribuer, signaler des problèmes, ou proposer des améliorations via les issues de ce dépôt.
Licence
Ce modèle est publié sous la licence MIT. Consultez le fichier LICENSE pour plus de détails.
Enrichissez-le davantage si vous ajoutez de nouvelles fonctionnalités, comme des tests ou des scripts complémentaires.