Views
No views yet
| Base model | nvidia/stt_uz_fastconformer_hybrid_large_pc |
| Architecture | EncDecHybridRNNTCTCBPEModel (FastConformer encoder + RNNT/CTC decoders) |
| Training data | uzinfocom-edu-ai/uzbek-asr-curated-701h (~701 hours, 6 sources) |
| Parameters | ~120M |
| Format | NeMo .nemo |
| Precision | fp32 |
| Metric | Value |
|---|---|
| WER (RNNT) | 16.01% |
| CER | 6.12% |
| Test set size | 27,142 utterances |
| Source | WER |
|---|---|
| uzbekvoice (read speech) | 6.85% |
| news_youtube | 28.61% |
| it_youtube | 32.10% |
| podcasts_dialect | 44.51% |
1import nemo.collections.asr as nemo_asr
2
3model = nemo_asr.models.EncDecHybridRNNTCTCBPEModel.from_pretrained(
4 "uzinfocom-edu-ai/asr-uz-fastconformer-large"
5)
6model.eval()
7transcriptions = model.transcribe(["audio.wav"], batch_size=1)
8print(transcriptions[0].text)| Source | Hours | Domain |
|---|---|---|
| Common Voice (uz) | 157.9h | Crowdsourced read speech |
| UzbekVoice | 125.0h | Book/read speech (capped) |
| News YouTube | 137.6h | Broadcast news |
| IT YouTube | 134.8h | Tech content |
| Podcasts (Tashkent dialect) | 94.8h | Conversational |
| Uzbek Speech Corpus (ISSAI) | 50.5h | Studio recordings |