Views
No views yet
1from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
2import torch, soundfile as sf
3
4processor = Wav2Vec2Processor.from_pretrained("shani925273/surah-kawthar-asr-v2")
5model = Wav2Vec2ForCTC.from_pretrained("shani925273/surah-kawthar-asr-v2")
6
7audio, rate = sf.read("sample.wav")
8inputs = processor(audio, sampling_rate=16000, return_tensors="pt", padding=True)
9
10with torch.no_grad():
11 logits = model(**inputs).logits
12
13predicted_ids = torch.argmax(logits, dim=-1)
14text = processor.batch_decode(predicted_ids)[0]
15print(text)