A Portuguese automatic speech recognition (ASR) model fine-tuned from
nvidia/parakeet-tdt-0.6b-v3.
Evaluated on
Common Voice 17.0 Portuguese splits (raw text, no normalization):
Validation and test sets use Common Voice 17.0 Portuguese exclusively (no synthetic contamination).
1import nemo.collections.asr as nemo_asr
2
3# Load model
4asr_model = nemo_asr.models.ASRModel.from_pretrained(
5 model_name="yuriyvnv/parakeet-tdt-0.6b-portuguese"
6)
7
8# Transcribe
9output = asr_model.transcribe(["audio.wav"])
10print(output[0].text)
1output = asr_model.transcribe(["audio.wav"], timestamps=True)
2
3for stamp in output[0].timestamp["segment"]:
4 print(f"{stamp['start']:.1f}s - {stamp['end']:.1f}s : {stamp['segment']}")
1asr_model.change_attention_model(
2 self_attention_model="rel_pos_local_attn",
3 att_context_size=[256, 256],
4)
5output = asr_model.transcribe(["long_audio.wav"])
This model is designed for transcribing Portuguese speech to text. It works best on: