Views
No views yet
openai/whisper-small pour la
reconnaissance automatique de la parole (ASR) en darija (dialecte marocain),
sur un ensemble combiné de 7 datasets publics.| Métrique | Valeur |
|---|---|
| WER (Word Error Rate) | 0.1057 (10.57%) |
| CER (Character Error Rate) | 0.1170 (11.70%) |
| Train loss (moyenne sur tout l'entraînement) | 0.1113 |
| Train loss (dernier step, epoch 10) | 0.11129 |
| Hyperparamètre | Valeur |
|---|---|
| Modèle de base | openai/whisper-small |
| Époques | 10 |
| Batch size (par device) | 2 |
| Gradient accumulation | 16 |
| Batch effectif | 32 |
| Learning rate | 5e-5 |
| Weight decay | 0.005 |
| Optimiseur | AdamW (par défaut Trainer) |
| Précision | fp16 |
| Gradient checkpointing | Oui (use_reentrant=False) |
| Feature encoder | gelé (freeze_feature_encoder) |
| Attention dropout | 0.1 |
| Hidden dropout | 0.1 |
| Feat proj dropout | 0.0 |
| Mask time prob | 0.05 |
| LayerDrop | 0.1 |
| Durée d'entraînement | 4:47:22.11 |
| Vitesse | 23.27 samples/s, 0.727 steps/s |
Note : ce modèle (~317M paramètres, ~1,2 Go) peut être trop volumineux pour le widget d'inférence gratuit de la page Hugging Face (souvent limité en mémoire/temps pour les modèles de cette taille). Si le widget affiche une erreur ou ne charge pas, teste-le directement en local avec le code ci-dessous, ou via des Inference Endpoints dédiés.
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import librosa
3import torch
4
5processor = WhisperProcessor.from_pretrained("amineouaki/whisper-small-darija-combined")
6model = WhisperForConditionalGeneration.from_pretrained("amineouaki/whisper-small-darija-combined")
7
8speech, sr = librosa.load("audio.wav", sr=16000)
9inputs = processor(speech, sampling_rate=16000, return_tensors="pt")
10
11with torch.no_grad():
12 predicted_ids = model.generate(inputs["input_features"])
13
14transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)
15print(transcription[0])