Views
No views yet
1from transformers import Wav2Vec2BertProcessor, Wav2Vec2BertForCTC
2import torch
3import torchaudio
4
5# load model and processor
6processor = Wav2Vec2BertProcessor.from_pretrained("badrex/w2v-bert-2.0-shona-asr")
7model = Wav2Vec2BertForCTC.from_pretrained("badrex/w2v-bert-2.0-shona-asr")
8
9# load audio
10audio_input, sample_rate = torchaudio.load("path/to/audio.wav")
11
12# preprocess
13inputs = processor(audio_input.squeeze(), sampling_rate=sample_rate, return_tensors="pt")
14
15# inference
16with torch.no_grad():
17 logits = model(**inputs).logits
18
19# decode
20predicted_ids = torch.argmax(logits, dim=-1)
21transcription = processor.batch_decode(predicted_ids)[0]
22print(transcription)1@misc{w2v_bert_shona_asr,
2 author = {Badr M. Abdullah},
3 title = {Adapting Wav2Vec2-BERT 2.0 for Shona ASR},
4 year = {2025},
5 publisher = {Hugging Face},
6 url = {https://huggingface.co/badrex/w2v-bert-2.0-shona-asr}
7}
8