Views
No views yet
| Metric | Value |
|---|---|
| Word Error Rate (WER) | 0.1162 |
| Test Loss | 0.0317 |
| Runtime (seconds) | 1300.45 |
| Samples per second | 9.81 |
pip install transformers torch torchaudio1import torch
2from transformers import WhisperProcessor, WhisperForConditionalGeneration
3from datasets import load_dataset, Audio
4
5# Load model and processor
6model_id = "yousifgamalo/quran-s-finetuned"
7processor = WhisperProcessor.from_pretrained(model_id)
8model = WhisperForConditionalGeneration.from_pretrained(model_id)
9
10# Move to GPU if available
11device = "cuda" if torch.cuda.is_available() else "cpu"
12model.to(device)
13
14# Load and preprocess audio
15# Example: Load from a file
16import librosa
17audio_array, sampling_rate = librosa.load("quran_recitation.wav", sr=16000)
18
19# Process audio
20input_features = processor(
21 audio_array,
22 sampling_rate=16000,
23 return_tensors="pt"
24).input_features.to(device)
25
26# Generate transcription
27# The model is configured to output Arabic text automatically
28predicted_ids = model.generate(input_features)
29
30# Decode prediction
31transcription = processor.batch_decode(
32 predicted_ids,
33 skip_special_tokens=True
34)[0]
35
36print(f"Transcription: {transcription}")1from transformers import pipeline
2
3# Create ASR pipeline
4pipe = pipeline(
5 "automatic-speech-recognition",
6 model="yousifgamalo/quran-s-finetuned",
7 device=0 if torch.cuda.is_available() else -1
8)
9
10# Transcribe audio
11result = pipe("quran_recitation.wav")
12print(result["text"])1 author = {Yousif H A },
2 title = {Whisper Medium - Quran Fine-tuned },
3 year = {2024},
4 publisher = {Hugging Face},
5 howpublished = {\url{https://huggingface.co/yousifgamalo/quran-s-finetuned}}
6}1@article{radford2022whisper,
2 title={Robust Speech Recognition via Large-Scale Weak Supervision},
3 author={Radford, Alec and Kim, Jong Wook and Xu, Tao and Brockman, Greg and McLeavey, Christine and Sutskever, Ilya},
4 journal={arXiv preprint arXiv:2212.04356},
5 year={2022}
6}