Views
No views yet
| Architecture | TDT (Token-and-Duration Transducer) |
| Language | Estonian |
| Sample rate | 16000 Hz |
| Max audio | 15.0s |
| Vocab size | 8192 |
| Framework | NVIDIA NeMo → CoreML (coremltools) |
| File | Component | Best compute |
|---|---|---|
parakeet_mel_encoder.mlpackage | mel_encoder | ANE / GPU |
parakeet_decoder.mlpackage | decoder | CPU only |
parakeet_joint_decision_single_step.mlpackage | joint_decision_single_step | ANE / GPU |
pip install ovos-stt-plugin-coreml1from ovos_stt_plugin_coreml import CoremlSTT
2from ovos_plugin_manager.utils.audio import AudioFile
3
4stt = CoremlSTT(config={"metadata": "metadata.json"})
5
6with AudioFile("speech.wav") as f:
7 audio = f.read()
8print(stt.execute(audio))