A Polish automatic speech recognition (ASR) model fine-tuned from
nvidia/parakeet-tdt-0.6b-v3.
Evaluated on
Common Voice 17.0 Polish (raw text, no normalization):
Fine-tuned on a curated subset of the
BIGOS v2 benchmark, filtered to retain only sources with proper casing and punctuation:
Validation uses the BIGOS v2 validation split (same source filtering). Test evaluation uses Common Voice 17.0 Polish (independent test set).
1import nemo.collections.asr as nemo_asr
2
3# Load model
4asr_model = nemo_asr.models.ASRModel.from_pretrained(
5 model_name="yuriyvnv/parakeet-tdt-0.6b-polish"
6)
7
8# Transcribe
9output = asr_model.transcribe(["audio.wav"])
10print(output[0].text)
1output = asr_model.transcribe(["audio.wav"], timestamps=True)
2
3for stamp in output[0].timestamp["segment"]:
4 print(f"{stamp['start']:.1f}s - {stamp['end']:.1f}s : {stamp['segment']}")
1asr_model.change_attention_model(
2 self_attention_model="rel_pos_local_attn",
3 att_context_size=[256, 256],
4)
5output = asr_model.transcribe(["long_audio.wav"])
This model is designed for transcribing Polish speech to text. It works best on: