Views
No views yet
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import torch
3import librosa
4
5model_id = "theharshithh/open-sarika-v1"
6device = "cuda" if torch.cuda.is_available() else "cpu"
7
8# Load model and processor
9processor = WhisperProcessor.from_pretrained(model_id)
10model = WhisperForConditionalGeneration.from_pretrained(model_id).to(device)
11model.config.forced_decoder_ids = None
12
13# Load and process audio
14audio_path = "your_audio.wav"
15audio, rate = librosa.load(audio_path, sr=16000)
16
17# Generate transcription
18inputs = processor(audio, sampling_rate=16000, return_tensors="pt").to(device)
19with torch.no_grad():
20 output_ids = model.generate(**inputs)
21transcription = processor.batch_decode(output_ids, skip_special_tokens=True)[0]