Views
No views yet
1import torch, librosa, numpy as np
2from transformers import WhisperForConditionalGeneration, WhisperProcessor
3m = WhisperForConditionalGeneration.from_pretrained('zhdoka/bori-asr').eval()
4p = WhisperProcessor.from_pretrained('zhdoka/bori-asr')
5a,_ = librosa.load('audio.wav', sr=16000, mono=True); a = a/ (np.abs(a).max() or 1); a = a[:30*16000]
6feat = p(a, sampling_rate=16000, return_tensors='pt').input_features
7ids = m.generate(feat, language='kazakh', task='transcribe', num_beams=1, max_new_tokens=225)
8print(p.batch_decode(ids, skip_special_tokens=True)[0].lower().strip())