Views
No views yet
openai/whisper-large-v3.
The model was trained on balanced training data from set 3 (khm, kor, nno, tat).1import torch
2import librosa
3from transformers import WhisperForConditionalGeneration, WhisperProcessor
4
5model = WhisperForConditionalGeneration.from_pretrained("bartelds/whisper-dro-set3-baseline")
6processor = WhisperProcessor.from_pretrained("bartelds/whisper-dro-set3-baseline")
7model.eval()
8
9audio, sr = librosa.load("input.wav", sr=16000)
10inputs = processor.feature_extractor(audio, sampling_rate=16000, return_tensors="pt")
11
12with torch.no_grad():
13 generated = model.generate(input_features=inputs.input_features)
14
15text = processor.tokenizer.batch_decode(generated, skip_special_tokens=True)[0]
16print("Recognized text:", text)pip install transformers torch librosafrom_pretrained() as shown above.openai/whisper-large-v3