Views
No views yet
1import torch
2import torchaudio
3import librosa
4
5from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
6
7processor = Wav2Vec2Processor.from_pretrained("techiaith/wav2vec2-xlsr-ft-cy")
8model = Wav2Vec2ForCTC.from_pretrained("techiaith/wav2vec2-xlsr-ft-cy")
9
10audio, rate = librosa.load(audio_file, sr=16000)
11
12inputs = processor(audio, sampling_rate=16_000, return_tensors="pt", padding=True)
13
14with torch.no_grad():
15 logits = model(inputs.input_values, attention_mask=inputs.attention_mask).logits
16
17# greedy decoding
18predicted_ids = torch.argmax(logits, dim=-1)
19
20print("Prediction:", processor.batch_decode(predicted_ids))1import torch
2import torchaudio
3import librosa
4
5from transformers import Wav2Vec2ForCTC, Wav2Vec2ProcessorWithLM
6
7processor = Wav2Vec2ProcessorWithLM.from_pretrained("techiaith/wav2vec2-xlsr-ft-cy")
8model = Wav2Vec2ForCTC.from_pretrained("techiaith/wav2vec2-xlsr-ft-cy")
9
10audio, rate = librosa.load(audio_file, sr=16000)
11
12inputs = processor(audio, sampling_rate=16_000, return_tensors="pt", padding=True)
13
14with torch.no_grad():
15 logits = model(inputs.input_values, attention_mask=inputs.attention_mask).logits
16
17# ctc decoding
18print("Prediction:", processor.batch_decode(logits.numpy()).text[0])