Views
No views yet
$ pip install transformerstransformers Python package as follows:1>>> from transformers import pipeline
2>>> audio = get_audio() # 16kHz raw audio array
3>>> transcriber = pipeline(model="CoRal-project/roest-v3-wav2vec2-315m")
4>>> transcriber(audio)
5{'text': 'your transcription'}1uv run accelerate launch \
2 --use-deepspeed \
3 --zero-stage 2 \
4 src/scripts/finetune_asr_model.py \
5 model=wav2vec2-small \
6 per_device_batch_size=64 \
7 max_steps=100000| Model | Number of parameters | Finetuned on data of type | CoRal-v3::conversation CER |
|---|---|---|---|
| CoRal-project/roest-v3-whisper-1.5b | 1540M | Read-aloud and conversation | 11.6% |
| CoRal-project/roest-v3-wav2vec2-315m (this model) | 315M | Read-aloud and conversation | 13.7% |
| CoRal-project/roest-v2-wav2vec2-315m | 315M | Read-aloud and conversation | 24.2% |
| CoRal-project/roest-v1-wav2vec2-315m | 315M | Read-aloud | 17.6% |
| CoRal-project/roest-v1-whisper-1.5b | 1540M | Read-aloud | 35.6% |
| syvai/hviske-v3-conversation | 1540M | Read-aloud and conversation | 15.1% |
| syvai/hviske-v2 | 1540M | Read-aloud | 29.4% |
| openai/whisper-large-v3 | 1540M | - | 27.5% |

| Model | Number of parameters | Finetuned on data of type | CoRal-v3::read_aloud CER |
|---|---|---|---|
| CoRal-project/roest-v3-whisper-1.5b | 1540M | Read-aloud and conversation | 4.5% |
| CoRal-project/roest-v3-wav2vec2-315m (this model) | 315M | Read-aloud and conversation | 5.9% |
| CoRal-project/roest-v2-wav2vec2-315m | 315M | Read-aloud and conversation | 6.4% |
| CoRal-project/roest-v1-wav2vec2-315m | 315M | Read-aloud | 8.2% |
| CoRal-project/roest-v1-whisper-1.5b | 1540M | Read-aloud | 4.0% |
| syvai/hviske-v3-conversation | 1540M | Read-aloud and conversation | 4.5% |
| syvai/hviske-v2 | 1540M | Read-aloud | 4.0% |
| openai/whisper-large-v3 | 1540M | - | 10.1% |
