NVIDIA Parakeet TDT 0.6B V3 (Multilingual)
model converted to ONNX format for
onnx-asr.
1# https://github.com/istupakov/onnx-asr
2# https://istupakov.github.io/onnx-asr/usage/#using-soundfile
3# https://istupakov.github.io/onnx-asr/conversion
4# https://docs.nvidia.com/nemo-framework/user-guide/24.09/nemotoolkit/core/export.html
5# https://github.com/NVIDIA-NeMo/NeMo/blob/main/examples/asr/export/transducer/infer_transducer_onnx.py
6
7import onnx_asr
8from pathlib import Path
9from huggingface_hub import snapshot_download
10
11model_path = snapshot_download("grimavatar/parakeet-tdt-0.6b-v3")
12providers = ["CUDAExecutionProvider", "CPUExecutionProvider"]
13
14model = onnx_asr.load_model("nemo-parakeet-tdt-0.6b-v3", path = model_path, providers = providers).with_timestamps()
15
16audio_paths = [str(e) for e in Path(".").absolute().glob("*wav")] * 15
17
18results = model.recognize(audio_paths)
19
20texts = [e.text.strip() for e in results]
21alignments = []
22
23for output in results:
24 alignments.append([
25 {"start": start, "end": end if text.strip().isalnum() else start, "text": text} for start, end, text in zip(
26 output.timestamps, output.timestamps[1:] + output.timestamps[-1:], output.tokens
27 )
28 ])