Views
No views yet
openai/whisper-large-v2 fine-tuned on the AYDID corpus for Yemeni Arabic
speech recognition across seven sub-dialects (Adeni, Badawi, Hadrami,
Sana'ani, Ta'izzi, Tihami, Standard Yemeni).openai/whisper-large-v2mansoorSaleh/AYDID| Dialect | Whisper L-V3 (zero-shot) | Whisper-Yemeni |
|---|---|---|
| Adeni (YEM_AD) | 46.47 | 16.65 |
| Badawi (YEM_BA) | 78.38 | 19.27 |
| Hadrami (YEM_HA) | 42.78 | 31.78 |
| Sana'ani (YEM_SA) | 51.69 | 19.34 |
| Standard (YEM_ST) | 24.77 | 13.51 |
| Ta'izzi (YEM_TA) | 42.86 | 14.38 |
| Tihami (YEM_TI) | 49.57 | 19.13 |
| Overall | 43.92 | 19.14 |
1import librosa
2from transformers import WhisperProcessor, WhisperForConditionalGeneration
3
4model_id = "mansoorSaleh/whisper-yemeni"
5processor = WhisperProcessor.from_pretrained(model_id)
6model = WhisperForConditionalGeneration.from_pretrained(model_id).eval()
7
8wav, _ = librosa.load("clip.wav", sr=16000)
9inputs = processor(wav, sampling_rate=16000, return_tensors="pt")
10ids = model.generate(inputs.input_features, language="ar", task="transcribe")
11print(processor.batch_decode(ids, skip_special_tokens=True)[0])1@inproceedings{aydid2027,
2 title = {AYDID: A Sub-Dialectal Yemeni Arabic Corpus for Dialect
3 Identification and Speech Recognition},
4 author = {Ba Mahel, Mansoor S. M. and Wei, Jianguo and Yue, Xianghu and
5 Awn, Norah Saeed and Bamahel, Abdulaziz S.},
6 booktitle = {Proc. IEEE ICASSP},
7 year = {2027}
8}