Views
No views yet
1from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
2
3model = Wav2Vec2ForCTC.from_pretrained("ifrz/wav2vec2-large-xlsr-galician")
4processor = Wav2Vec2Processor.from_pretrained("ifrz/wav2vec2-large-xlsr-galician")
5
6# Reading taken audio clip
7import librosa, torch
8audio, rate = librosa.load("./gl_test_1.wav", sr = 16000)
9
10# Taking an input value
11input_values = processor(audio, sampling_rate=16_000, return_tensors = "pt", padding="longest").input_values
12# Storing logits (non-normalized prediction values)
13logits = model(input_values).logits
14# Storing predicted ids
15prediction = torch.argmax(logits, dim = -1)
16
17# Passing the prediction to the tokenzer decode to get the transcription
18transcription = processor.batch_decode(prediction)[0]
19print(transcription)