Views
No views yet
prompt_kernel MLP conditioning:| Code | Language | Code | Language | Code | Language |
|---|---|---|---|---|---|
| ar-AR | Arabic | fr-CA | French (CA) | nn-NO | Norwegian (NN) |
| bg-BG | Bulgarian | fr-FR | French (FR) | pl-PL | Polish |
| cs-CZ | Czech | he-IL | Hebrew | pt-BR | Portuguese (BR) |
| da-DK | Danish | hi-IN | Hindi | pt-PT | Portuguese (PT) |
| de-DE | German | hr-HR | Croatian | ro-RO | Romanian |
| el-GR | Greek | hu-HU | Hungarian | ru-RU | Russian |
| en-GB | English (GB) | it-IT | Italian | sk-SK | Slovak |
| en-US | English (US) | ja-JP | Japanese | sl-SL | Slovenian |
| es-ES | Spanish (ES) | ko-KR | Korean | sv-SE | Swedish |
| es-US | Spanish (US) | lt-LT | Lithuanian | th-TH | Thai |
| et-EE | Estonian | lv-LV | Latvian | tr-TR | Turkish |
| fi-FI | Finnish | nb-NO | Norwegian (NB) | uk-UA | Ukrainian |
| nl-NL | Dutch | vi-VN | Vietnamese | ||
| zh-CN | Chinese |
att_context_size=[[56,3],[56,0],[56,6],[56,13]]| File | Size | Description |
|---|---|---|
nemotron-3.5-asr-streaming-0.6b-f16.gguf | 1.3 GB | F16 weights (full precision, F32 pre-encode) |
nemotron-3.5-asr-streaming-0.6b-q8_0.gguf | 686 MB | Q8_0 quantized (high precision, low footprint) |
nemotron-3.5-asr-streaming-0.6b-q4_k.gguf | 458 MB | Q4_K quantized (recommended, ~2x faster) |
1# Download (Q4_K recommended — 458 MB, ~2x faster than F16)
2huggingface-cli download cstr/nemotron-3.5-asr-streaming-GGUF \
3 nemotron-3.5-asr-streaming-0.6b-q4_k.gguf --local-dir models/
4
5# Transcribe (English, default)
6crispasr --backend nemotron \
7 -m models/nemotron-3.5-asr-streaming-0.6b-q4_k.gguf \
8 -f audio.wav
9
10# Transcribe in German
11crispasr --backend nemotron \
12 -m models/nemotron-3.5-asr-streaming-0.6b-q4_k.gguf \
13 -f audio.wav --language de-DE.nemo checkpoint using:1python models/convert-nemotron-to-gguf.py \
2 --nemo nvidia/nemotron-3.5-asr-streaming-0.6b \
3 --output nemotron-3.5-asr-streaming-0.6b-f16.gguf1crispasr-quantize models/nemotron-3.5-asr-streaming-0.6b-f16.gguf \
2 models/nemotron-3.5-asr-streaming-0.6b-q4_k.gguf Q4_KAudio (16kHz) → Mel (128 bins, 10ms hop)
→ Pre-encode (3× causal Conv2d, 8× downsample, Linear 4352→1024)
→ 24× Cache-Aware FastConformer block:
FFN1(½) → MHA(rel_pos, cache-aware) → DWConv(k=9, causal, LN) → FFN2(½) → LN
→ Prompt kernel (MLP: concat(enc[1024], lang_onehot[128]) → 2048 → 1024)
→ RNN-T decoder:
Prediction: Embed(13088, 640) + 2-layer LSTM(640)
Joint: enc(1024→640) + pred(640→640) → ReLU → Linear(640→13088)
→ Greedy / beam search decode