Views
No views yet
omarxadel/hubert-large-arabic-egyptian pour la
reconnaissance automatique de la parole (ASR) en darija (dialecte marocain),
sur un ensemble combiné de datasets publics.| Métrique | Valeur |
|---|---|
| Eval WER (Word Error Rate) | 0.2386 (23.86%) |
| Eval CER (Character Error Rate) | 0.0813 (8.13%) |
| Train loss (moyenne sur tout l'entraînement) | 0.41482063716298273 |
| Hyperparamètre | Valeur |
|---|---|
| Modèle de base | omarxadel/hubert-large-arabic-egyptian |
| Époques | 50.0 |
| Batch size (par device) | 2 |
| Gradient accumulation | 16 |
| Batch effectif | 32 |
| Learning rate | 5e-5 |
| Weight decay | 0.005 |
| Optimiseur | AdamW (par défaut Trainer) |
| Précision | fp16 |
| Gradient checkpointing | Oui (use_reentrant=False) |
| Feature encoder | gelé (freeze_feature_encoder) |
| Attention dropout | 0.1 |
| Hidden dropout | 0.1 |
| Feat proj dropout | 0.0 |
| Mask time prob | 0.05 |
| LayerDrop | 0.1 |
| CTC loss reduction | mean |
| Durée d'entraînement | 1 day(s), 01:51:47 |
| Vitesse | 21.547 samples/s, 0.673 steps/s |
adiren7/darija_speech_to_textmohamedmou/moroccan-darija-asr-dataset-splitafyfbadreddine77/darija-asr-datasetntariklk/darija-merged-asratlasia/Moroccan-Darija-Wiki-Audio-DatasetDatasmartly/moroccan_darija_audio (accès refusé — dataset privé, non inclus dans l'entraînement)RHEZLOUNE/darija-restaurant-audioanaszil/Segmented-Moroccan-Darija-Wiki-Audio-Dataset1from transformers import HubertForCTC, Wav2Vec2Processor
2import librosa
3import torch
4
5processor = Wav2Vec2Processor.from_pretrained("amineouaki/hubert-darija-combined")
6model = HubertForCTC.from_pretrained("amineouaki/hubert-darija-combined")
7
8speech, _ = librosa.load("audio.wav", sr=16000)
9inputs = processor(speech, sampling_rate=16000, return_tensors="pt", padding=True)
10
11with torch.no_grad():
12 logits = model(**inputs).logits
13
14pred_ids = torch.argmax(logits, dim=-1)
15print(processor.decode(pred_ids[0]))