Views
No views yet
wav2vec2-ctc model type).do_normalize=True in the
original feature extractor) is baked into the ONNX graph, masked by
input_lengths for correct behavior with padded/batched input, so the model
works with onnx-asr's plain identity preprocessor (raw 16kHz waveform in).1import onnx_asr
2
3model = onnx_asr.load_model("wav2vec2-ctc", "path/to/downloaded/model")
4# or, once registered upstream with a friendly name:
5# model = onnx_asr.load_model("OpenVoiceOS/Nos_ASR-wav2vec2-xls-r-300m-gl-onnx")
6print(model.recognize("test.wav"))model.onnx / model.onnx.data — fp32 ONNX graph (inputs: input_values (batch, samples) float32, input_lengths (batch,) int64; output: logprobs (batch, frames, vocab) float32 log-softmax).vocab.txt — CTC vocabulary in onnx-asr's token id format (word-delimiter → ▁, pad token → <blk>).config.json — {"model_type": "wav2vec2-ctc", "subsampling_factor": 320}.onnxruntime.quantization does not
currently support the torch.onnx dynamo-exported graph for this architecture.