ONNX exports of NVIDIA Parakeet TDT 0.6B ASR encoder in multiple precision formats.
INT8 cosine measured on random noise input; real audio quality expected to be higher.
FP8 and INT4 models use custom weight formats requiring DequantizeLinear or custom loader.
1import onnxruntime as ort
2import numpy as np
3
4# FP16 (recommended for GPU) or INT8 (recommended for CPU)
5sess = ort.InferenceSession("fp16/encoder.onnx", providers=["CUDAExecutionProvider"])
6
7audio_features = np.random.randn(1, 128, 100).astype(np.float32)
8length = np.array([100], dtype=np.int64)
9
10outputs = sess.run(None, {"audio_signal": audio_features, "length": length})
11encoded = outputs[0] # [batch, d_model, time]
Exported from NVIDIA NeMo Parakeet TDT 0.6B checkpoint on DGX Spark (GB10 Grace Blackwell).