Views
No views yet
| Category | WER |
|---|---|
| Overall | 16.7% |
| Clean Speech | ~6-11% |
| Noisy/Augmented | ~12-24% |
| Dialects | ~16-25% |
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import librosa
3
4processor = WhisperProcessor.from_pretrained("Kotib/uzbek_stt_v1")
5model = WhisperForConditionalGeneration.from_pretrained("Kotib/uzbek_stt_v1")
6
7audio, sr = librosa.load("audio.wav", sr=16000)
8input_features = processor(audio, sampling_rate=16000, return_tensors="pt").input_features
9
10predicted_ids = model.generate(input_features, language="uz", task="transcribe")
11transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
12print(transcription)1from transformers import pipeline
2
3pipe = pipeline(
4 "automatic-speech-recognition",
5 model="Kotib/uzbek_stt_v1",
6 chunk_length_s=30,
7 device="cuda"
8)
9
10result = pipe("audio.wav", generate_kwargs={"language": "uz", "task": "transcribe"})
11print(result["text"])| Stage | Hours |
|---|---|
| Foundation | 725h |
| Robustness | 394h |
| Domain Adaptation | 474h |