Views
No views yet
1pip install onnxruntime numpy torch torchaudio soundfile pandas
2
3python3 recognize.py speech.wav"В древнем Китае использовали уникальный способ обозначения периодов времени."--no-punct| File | Size | Description |
|---|---|---|
model/gigaam_v3_rnnt_encoder.onnx | 305 MB | Conformer encoder (Int8) |
model/gigaam_v3_rnnt_decoder.onnx | 3.2 MB | LSTM decoder |
model/gigaam_v3_rnnt_joint.onnx | 1.4 MB | Joint network |
model/gigaam_v3_rnnt_tokens.txt | 195 B | Token vocabulary (33 chars + blank) |
<blk>| Metric | Value |
|---|---|
| Params | 222.5M |
| CER (test set) | ~4.9% |
| RTF (CPU, FP32) | 0.04 |
| RTF (CPU, Int8) | 0.03 |
| Avg decode (12s audio) | ~450 ms (FP32) / ~320 ms (Int8) |
1# Recognize a WAV file (16kHz, mono)
2python3 recognize.py speech.wav
3
4# Benchmark
5python3 recognize.py --benchmark1from recognize import GigaAMRecognizer
2
3asr = GigaAMRecognizer('model')
4
5# From file
6text = asr.transcribe('speech.wav')
7
8# From numpy array (16kHz, mono)
9import soundfile as sf
10audio, sr = sf.read('speech.wav')
11text = asr.transcribe_raw(audio)
12
13print(text) # "эта идея пришла из китая где излюбленным цветком был цвет сливы"python3 asr_gui.pyonnxruntime (or onnxruntime-gpu for GPU)numpytorch, torchaudio (for mel spectrogram)soundfilepandas (optional, for dataset evaluation)@software{gigaam_v3_onnx,
title = {GigaAM-v3 ONNX: Russian Speech Recognition},
author = {Sber AI},
year = {2024},
url = {https://huggingface.co/ai-sage/GigaAM-v3}
}