Views
No views yet
| Property | Value |
|---|---|
| Base model | nvidia/stt_en_fastconformer_tdt_large |
| Architecture | FastConformer-TDT (17 layers, d_model=512) |
| Parameters | ~115M |
| Decoder | Token-and-Duration Transducer (TDT) — 2-5× faster than RNNT |
| Language | English |
| Weights format | SafeTensors, float16 (~218 MB) |
| Vocab size | 1025 tokens (SentencePiece BPE) |
| Mel bands | 80 |
| TDT durations | [0, 1, 2, 3, 4] |
| Context | Full attention [-1, -1] — offline/batch mode |
model.safetensors — all weights in float16model_config.json — architecture hyperparametersvocab.json — token ID → text mapping1const base = 'https://huggingface.co/AbijahKaj/fastconformer-tdt-large-web/resolve/main';
2const config = await fetch(`${base}/model_config.json`).then(r => r.text());
3const vocab = await fetch(`${base}/vocab.json`).then(r => r.text());
4const weights = await fetch(`${base}/model.safetensors`).then(r => r.arrayBuffer());
5await recognizer.loadFromBuffers(weights, config, vocab);1python tools/export_nemo_to_safetensors.py \
2 --model nvidia/stt_en_fastconformer_tdt_large \
3 --output-dir exported/fastconformer-tdt-large