Silero Voice Activity Detection (VAD) model in ONNX format. Detects when a person is speaking in an audio stream.
1import numpy as np
2import onnxruntime as ort
3
4session = ort.InferenceSession("onnx/model_int8.onnx")
5input_name = session.get_inputs()[0].name
6sr_name = session.get_inputs()[1].name
7
8audio = np.random.randn(1, 512).astype(np.float32)
9sample_rate = np.array([16000], dtype=np.int64)
10
11outputs = session.run(None, {input_name: audio, sr_name: sample_rate})
12speech_prob = outputs[0]
1import torch
2torch.set_num_threads(1)
3
4model, utils = torch.hub.load(
5 repo_or_dir="snakers4/silero-vad",
6 model="silero_vad",
7)
8get_speech_timestamps, _, read_audio, _, _ = utils
9
10wav = read_audio("audio.wav")
11speech_timestamps = get_speech_timestamps(wav, model, return_seconds=True)
1from faster_whisper import WhisperModel
2
3model = WhisperModel("small", device="cuda", compute_type="int8", vad_filter=True)
4segments, _ = model.transcribe("audio.mp3")