Views
No views yet
1import torch
2import librosa
3from transformers import WhisperProcessor, WhisperForConditionalGeneration
4
5# Load model and processor
6processor = WhisperProcessor.from_pretrained("danhtran2mind/Vi-Whisper-Tiny-finetuning")
7model = WhisperForConditionalGeneration.from_pretrained("danhtran2mind/Vi-Whisper-Tiny-finetuning")
8model.config.forced_decoder_ids = None
9# Move model to GPU if available
10device = "cuda" if torch.cuda.is_available() else "cpu"
11model.to(device)
12
13# Load audio file (replace 'audio.wav' with your audio file path)
14audio_path = "<audio_path>"
15audio, sr = librosa.load(audio_path, sr=16000)
16
17# Preprocess audio
18inputs = processor(audio, sampling_rate=16000, return_tensors="pt").to(device)
19
20# Perform inference with max_length and language
21with torch.no_grad():
22 generated_ids = model.generate(
23 inputs["input_features"],
24 max_length=448,
25 )
26
27# Decode the output
28transcription = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
29
30# Print the transcription
31print("Transcription:\n", transcription)