Views
No views yet
1from transformers import AutoModelForCTC, Wav2Vec2Processor
2import torch
3import librosa
4
5# Load model and processor
6model = AutoModelForCTC.from_pretrained("Mathur08/autotrain-mfnfj-9bczx")
7processor = Wav2Vec2Processor.from_pretrained("Mathur08/autotrain-mfnfj-9bczx")
8
9audio, sr = librosa.load("path_to_audio.wav", sr=16000)
10inputs = processor(audio, sampling_rate=16000, return_tensors="pt", padding=True)
11
12with torch.no_grad():
13 logits = model(inputs.input_values).logits
14 predicted_ids = torch.argmax(logits, dim=-1)
15 transcription = processor.batch_decode(predicted_ids)