INT8 k-quant quantized ONNX model converted from
NVIDIA Nemotron 3.5 ASR Streaming 0.6B using Microsoft Olive.
Optimized for
fast CPU inference with
ONNX Runtime GenAI. Uses NVIDIA's recommended 0.56s chunk size for best latency/accuracy trade-off.
1using NemotronSpeech;
2
3using var session = new ModelSession(
4 modelPath: "DimQ1/nemotron-3.5-asr-streaming-0.6b-onnx-int8-cpu",
5 executionProvider: "cpu",
6 langId: "11", // Russian
7 useVad: true
8);
1import onnxruntime_genai as og
2import numpy as np
3
4model = og.Model("DimQ1/nemotron-3.5-asr-streaming-0.6b-onnx-int8-cpu")
5processor = og.StreamingProcessor(model)
6tokenizer = og.Tokenizer(model)
7params = og.GeneratorParams(model)
8generator = og.Generator(model, params)
9
10generator.set_runtime_option("lang_id", "11") # Russian
11
12chunk = np.zeros(8960, dtype=np.float32) # 0.56s @ 16kHz
13inputs = processor.process(chunk)
14if inputs is not None:
15 generator.set_inputs(inputs)
16 while not generator.is_done():
17 generator.generate_next_token()
1cd converter
2python src/optimize.py \
3 --model-name nemotron-3.5-asr-streaming-0.6b.nemo \
4 --encoder-precision int8 \
5 --execution-provider cpu \
6 --output-dir build/onnx_models_int8_cpu
See
nemotron-speech-csharp for the full C# demo app with VoiceType WPF UI.
This model inherits
cc-by-nc-4.0 from the base NVIDIA Nemotron model.