Views
No views yet
| Model | WER ↓ |
|---|---|
| Whisper-small-uz-v1 | 34.5% |
| Gemini (Commercial) | 36.21% |
| NavaiSTT v2 (Open-Source medium model) | 35.14% |
| Aisha STT (Commercial) | 41.71% |
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import torch
3import torchaudio
4
5model_id = "OvozifyLabs/whisper-small-uz-v1"
6
7processor = WhisperProcessor.from_pretrained(model_id)
8model = WhisperForConditionalGeneration.from_pretrained(model_id)
9
10audio, sr = torchaudio.load("audio.wav")
11inputs = processor(audio, sampling_rate=sr, return_tensors="pt")
12
13with torch.no_grad():
14 predicted_ids = model.generate(inputs.input_features)
15text = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
16
17print(text)