Fine-tuned
OpenAI Whisper-large-v3 for Estonian automatic speech recognition, augmented with TTS-generated synthetic data.
All improvements are statistically significant (paired bootstrap, p < 0.001, n = 100,000).
1from transformers import WhisperForConditionalGeneration, WhisperProcessor
2import torch
3
4# Load model and processor
5model = WhisperForConditionalGeneration.from_pretrained("yuriyvnv/whisper-large-v3-estonian")
6processor = WhisperProcessor.from_pretrained("yuriyvnv/whisper-large-v3-estonian")
7
8# Load audio (16kHz mono)
9import librosa
10audio, sr = librosa.load("audio.wav", sr=16000)
11
12# Transcribe
13input_features = processor(audio, sampling_rate=16000, return_tensors="pt").input_features
14with torch.no_grad():
15 predicted_ids = model.generate(input_features, language="et", task="transcribe")
16transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
17print(transcription)