Views
No views yet
pip install numpy onnxruntime soundfile kaldi-native-fbank kaldiioonnxruntime-gpu 替换 onnxruntime。model.onnxcmvn.ark(Kaldi 格式,用于特征归一化)1cd /to/path
2
3# 示例:从 Modelscope 下载
4git clone https://modelscope.cn/models/manyeyes/FireRedVad-onnx.git
5
6# 进入模型目录
7cd FireRedVad-onnxfireredvad_onnx_inference.py(或直接下载示例脚本)。__main__ 部分,将以下路径改为实际路径:1 onnx_path = "/path/to/FireRedVad-onnx/model.onnx"
2 cmvn_path = "/path/to/FireRedVad-onnx/cmvn.ark"
3 audio_file = "/path/to/FireRedVad-onnx/0.wav"python fireredvad_onnx_inference.py特征形状: (1235, 80), 音频时长: 12.369s
概率统计: min=0.0005, max=0.3112, mean=0.0423
超过阈值的帧数: 30 / 1235
音频时长: 12.369 秒
检测到的语音段:
0.070 - 5.350
6.250 - 9.540
10.050 - 12.1001from fireredvad_onnx_inference import ONNXFireRedVad, FireRedVadConfig
2
3# 配置参数(可根据需要调整)
4config = FireRedVadConfig(
5 use_gpu=False,
6 smooth_window_size=5,
7 speech_threshold=0.4,
8 min_speech_frame=20,
9 max_speech_frame=2000,
10 min_silence_frame=20,
11 merge_silence_frame=20,
12 extend_speech_frame=20
13)
14
15# 初始化 VAD 引擎
16vad = ONNXFireRedVad(
17 onnx_path="model.onnx",
18 config=config,
19 cmvn_path="cmvn.ark"
20)
21
22# 对音频文件进行检测
23result, probs = vad.detect("test.wav")
24print(f"音频时长: {result['dur']} 秒")
25for seg in result['timestamps']:
26 print(f" {seg[0]:.3f} - {seg[1]:.3f}")speech_threshold:语音概率阈值,默认 0.4,可根据实际输出概率调整(如 0.3~0.4)。min_speech_frame:最短语音帧数(20 帧 = 0.2 秒),低于此值的语音段被丢弃。min_silence_frame:最短静音帧数,用于合并短停顿。extend_speech_frame:语音段前后扩展帧数,可补偿边界偏移。use_gpu=True,并确保已安装 onnxruntime-gpu。