Tested on 10 audio samples from FLEURS ta_in.
CER/WER measured against HF model output (not ground truth) to isolate quantization error.
1# Clone and build
2git clone --recursive https://github.com/liodon-ai/wav2vec2.cpp
3cd wav2vec2.cpp && mkdir build && cd build && cmake .. && make -j
4
5# Download and run
6huggingface-cli download liodon-ai/vakyansh-wav2vec2-tamil-tam-250-GGUF model_q8_0.gguf --local-dir .
7./wav2vec2-cli -m model_q8_0.gguf -f audio.wav
8
9# With word timestamps
10./wav2vec2-cli -m model_q8_0.gguf -f audio.wav -w
11
12# SRT subtitle output
13./wav2vec2-cli -m model_q8_0.gguf -f audio.wav --format srt > output.srt
1import subprocess, json
2result = subprocess.run(
3 ['./wav2vec2-cli', '-m', 'model_q8_0.gguf', '-f', 'audio.wav', '--format', 'json'],
4 capture_output=True, text=True
5)
6data = json.loads(result.stdout)
7print(data['transcript'])
1python scripts/convert_to_gguf.py Harveenchadha/vakyansh-wav2vec2-tamil-tam-250 model_f16.gguf --dtype f16
2python scripts/convert_to_gguf.py Harveenchadha/vakyansh-wav2vec2-tamil-tam-250 model_q8_0.gguf --dtype q8_0
3python scripts/convert_to_gguf.py Harveenchadha/vakyansh-wav2vec2-tamil-tam-250 model_q4_0.gguf --dtype q4_0
Follows the license of the
source model.