Views
No views yet
1from transformers import Wav2Vec2BertProcessor, Wav2Vec2BertForCTC
2import torch
3import torchaudio
4
5# load the model and processor
6processor = AutoProcessor.from_pretrained("ElvisTata2024/Kinyarwanda-Health-ASR")
7model = AutoModelForCTC.from_pretrained("ElvisTata2024/Kinyarwanda-Health-ASR")
8
9# load audio
10audio_input, sample_rate = torchaudio.load("path/to/audio.wav")
11
12# preprocess
13inputs = processor(audio_input.squeeze(), sampling_rate=sample_rate, return_tensors="pt")
14
15# inference
16with torch.no_grad():
17 logits = model(**inputs).logits
18
19# decode
20predicted_ids = torch.argmax(logits, dim=-1)
21transcription = processor.batch_decode(predicted_ids)[0]
22print(transcription)
23
24| Setup | Greedy WER ⬇ | WER + KenLM (2-gram) ⬇ | KenLM Improvement ⬆ |
|---|---|---|---|
| Base Model | 6.51% | 6.03% | 0.48% |
| Adapted Model | 6.45% | 5.98% | 0.47% |
| Net Reduction | 0.06% | 0.04% | 0.02% |
1@misc{w2v_bert_kinyarwanda_asr,
2 author = {Badr M. Abdullah},
3 title = {Adapting Wav2Vec2-BERT 2.0 for Kinyarwanda ASR},
4 year = {2025},
5 publisher = {Hugging Face},
6 url = {https://huggingface.co/badrex/w2v-bert-2.0-kinyarwanda-asr-1000h}
7}
8@misc{Kinyarwanda-Health-ASR,
9 author = {Elvis Tata Tanghang},
10 title = {Adapting Wav2Vec2-BERT 2.0 for Kinyarwanda ASR Health},
11 year = {2025},
12 publisher = {Hugging Face},
13 url = {https://huggingface.co/ElvisTata2024/Kinyarwanda-Health-ASR}
14}
15
16