Views
No views yet
Ari/whisper-small-es to
transcribe.Ari/whisper-small-es1import numpy as np
2from pydub import AudioSegment
3from transformers import WhisperForConditionalGeneration, WhisperProcessor
4
5processor = WhisperProcessor.from_pretrained("whisper-small-esl")
6model = WhisperForConditionalGeneration.from_pretrained("whisper-small-esl")
7
8audio = AudioSegment.from_file("audio.mp3").set_frame_rate(16000).set_channels(1)
9samples = np.frombuffer(audio.raw_data, np.int16).astype(np.float32) / 32768.0
10features = processor(samples, sampling_rate=16000, return_tensors="pt").input_features
11text = processor.batch_decode(model.generate(features), skip_special_tokens=True)[0]
12print(text)