Views
No views yet
audio (this can be anything from a numpy array to a filepath), the following code generates transcriptions:1from transformers import pipeline, WhisperProcessor
2
3processor = WhisperProcessor.from_pretrained("thennal/whisper-medium-ml")
4forced_decoder_ids = processor.get_decoder_prompt_ids(language="ml", task="transcribe")
5asr = pipeline(
6 "automatic-speech-recognition", model="thennal/whisper-medium-ml", device=0,
7 )
8transcription = asr(audio, chunk_length_s=30, max_new_tokens=448, return_timestamps=False, generate_kwargs={
9 "forced_decoder_ids": forced_decoder_ids,
10 "do_sample": True,
11 })