Views
No views yet
1import soundfile as sf
2import torch
3from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
4import argparse
5def parse_transcription(wav_file):
6 # load pretrained model
7 processor = Wav2Vec2Processor.from_pretrained("addy88/wav2vec2-telugu-stt")
8 model = Wav2Vec2ForCTC.from_pretrained("addy88/wav2vec2-telugu-stt")
9 # load audio
10 audio_input, sample_rate = sf.read(wav_file)
11 # pad input values and return pt tensor
12 input_values = processor(audio_input, sampling_rate=sample_rate, return_tensors="pt").input_values
13 # INFERENCE
14 # retrieve logits & take argmax
15 logits = model(input_values).logits
16 predicted_ids = torch.argmax(logits, dim=-1)
17 # transcribe
18 transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
19 print(transcription)