Views
No views yet
| Component | File | Input Shape | Output Shape |
|---|---|---|---|
| Preprocessor | preprocessor.mlpackage | [1, 240000] | [1, 80, T] |
| Encoder | encoder.mlpackage | [1, 80, 1501] | [1, 1024, 188] |
| Decoder | decoder.mlpackage | [1, 1] + LSTM states | [1, 640, 2] + states |
| Joint | joint.mlpackage | encoder + decoder outputs | [1, 188, 1, 3078] |
| Mel+Encoder (Fused) | mel_encoder.mlpackage | [1, 240000] | [1, 1024, 188] |
| Vocabulary | vocab_ja.json | - | 3,072 tokens |
1import CoreML
2
3// Load models
4let encoder = try MLModel(contentsOf: encoderURL)
5let decoder = try MLModel(contentsOf: decoderURL)
6let joint = try MLModel(contentsOf: jointURL)
7
8// Or use the fused mel_encoder for simpler pipeline
9let melEncoder = try MLModel(contentsOf: melEncoderURL)(B, features, time) = (1, 1024, T), different from English v3 models which output (B, T, features).1{
2 "model_id": "nvidia/parakeet-tdt_ctc-0.6b-ja",
3 "vocab_size": 3072,
4 "hidden_size": 640,
5 "encoder_features": 1024,
6 "num_decoder_layers": 2,
7 "sample_rate": 16000,
8 "fixed_audio_window_sec": 15.0,
9 "fixed_mel_frames": 1501,
10 "fixed_encoder_frames": 188
11}1@misc{nvidia_parakeet_tdt_ja,
2 title={Parakeet TDT CTC 0.6B Japanese},
3 author={NVIDIA},
4 year={2024},
5 publisher={Hugging Face},
6 url={https://huggingface.co/nvidia/parakeet-tdt_ctc-0.6b-ja}
7}