Views
No views yet
1import librosa
2from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
3
4model = Wav2Vec2ForCTC.from_pretrained("agkphysics/wav2vec2-large-xlsr-53-amharic")
5processor = Wav2Vec2Processor.from_pretrained("agkphysics/wav2vec2-large-xlsr-53-amharic")
6
7audio, _ = librosa.load("/path/to/audio.wav", sr=16000)
8
9input_values = processor(
10 audio.squeeze(),
11 sampling_rate=16000,
12 return_tensors="pt"
13).input_values
14
15model.eval()
16with torch.no_grad():
17 logits = model(input_values).logits
18 preds = logits.argmax(-1)
19 texts = processor.batch_decode(preds)
20print(texts[0])