Views
No views yet
wav2vec2-ctc model type) and the
OVOS onnx-asr STT plugin.input_lengths for correct behavior with padded/batched input, so the
model works with onnx-asr's plain identity preprocessor (raw 16kHz waveform in).1import onnx_asr
2
3model = onnx_asr.load_model("OpenVoiceOS/misterkissi-w2v2-lg-xls-r-300m-kposo-onnx")
4print(model.recognize("test.wav"))1from ovos_stt_plugin_onnx_asr import OnnxASRSTT
2
3stt = OnnxASRSTT(config={"model": "OpenVoiceOS/misterkissi-w2v2-lg-xls-r-300m-kposo-onnx"})model.onnx / model.onnx.data (when present; small models may be fully inline) -- fp32 ONNX graph (inputs: input_values (batch, samples) float32, input_lengths (batch,) int64; output: logprobs (batch, frames, vocab) float32 log-softmax).vocab.txt -- CTC vocabulary in onnx-asr's token id format (word-delimiter -> ▁, pad token -> <blk>).config.json -- {"model_type": "wav2vec2-ctc", "subsampling_factor": 320}.