Views
No views yet
1from transformers import AutoProcessor, AutoModelForCTC
2
3repo_name = "eddiegulay/wav2vec2-large-xlsr-mvc-swahili"
4processor = AutoProcessor.from_pretrained(repo_name)
5model = AutoModelForCTC.from_pretrained(repo_name)
6
7# if you have GPU
8# move model to CUDA
9model = model.to("cuda")
10
11
12def transcribe(audio_path):
13 # Load the audio file
14 audio_input, sample_rate = torchaudio.load(audio_path)
15 target_sample_rate = 16000
16 audio_input = torchaudio.transforms.Resample(orig_freq=sample_rate, new_freq=target_sample_rate)(audio_input)
17
18 # Preprocess the audio data
19 input_dict = processor(audio_input[0], return_tensors="pt", padding=True, sampling_rate=16000)
20
21 # Perform inference and transcribe
22 logits = model(input_dict.input_values.to("cuda")).logits
23 pred_ids = torch.argmax(logits, dim=-1)[0]
24 transcription = processor.decode(pred_ids)
25
26 return transcription
27
28transcript = transcribe('your_audio.mp3')