Views
No views yet
1from transformers import Wav2Vec2Processor, Wav2Vec2ForCTC
2import torch
3import librosa
4
5# Load model & processor
6processor = Wav2Vec2Processor.from_pretrained("atariq701/mms-1b-allFT-urdu-asr-csalt-voice-urd-script_arabic")
7model = Wav2Vec2ForCTC.from_pretrained("atariq701/mms-1b-allFT-urdu-asr-csalt-voice-urd-script_arabic")
8
9# Load audio (ensure 16kHz sampling rate)
10audio_input, sample_rate = librosa.load("path/to/audio.wav", sr=16000)
11
12# Process audio
13inputs = processor(audio_input, sampling_rate=16000, return_tensors="pt")
14with torch.no_grad():
15 logits = model(inputs.input_values).logits
16
17# Decode
18predicted_ids = torch.argmax(logits, dim=-1)
19transcription = processor.batch_decode(predicted_ids)[0]
20print(transcription)