Views
No views yet
facebook/wav2vec2-base on Urdu speech data for automatic speech recognition.1from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
2import torchaudio, torch
3
4processor = Wav2Vec2Processor.from_pretrained("abidanoaman/urdu-asr-wave2vec2-base-merged-finetuned")
5model = Wav2Vec2ForCTC.from_pretrained("abidanoaman/urdu-asr-wave2vec2-base-merged-finetuned")
6
7# Load audio (must be 16kHz mono)
8waveform, sr = torchaudio.load("your_audio.wav")
9inputs = processor(waveform.squeeze(), sampling_rate=16000, return_tensors="pt")
10
11with torch.no_grad():
12 logits = model(**inputs).logits
13
14predicted_ids = torch.argmax(logits, dim=-1)
15transcription = processor.decode(predicted_ids[0])
16print(transcription)