Views
No views yet
| Component | Model | Parameters |
|---|---|---|
| Encoder | nvidia/parakeet-ctc-0.6b (FastConformer CTC) | 600M |
| Projector | Conv1d + Transformer (1024 → 896, stride=2) | trainable |
| LLM | Qwen/Qwen2.5-0.5B | 500M |
projector_and_encoder_top — projector fully trainable,
top-4 encoder layers unfrozen| Dataset | Samples | Description |
|---|---|---|
| LibriSpeech 960h | ~276k | Read English speech (standard ASR benchmark) |
1import torch
2
3checkpoint = torch.load("final.pt", map_location="cpu")
4# Load into SpeechLLM model — see the parakeet-turntaking repository for detailsfinal.pt — Full model checkpoint (encoder + projector + LLM state dicts)config.yaml — Training configuration