Views
No views yet
1from transformers import WhisperProcessor, WhisperForConditionalGeneration, WhisperTokenizer
2import torch
3import librosa
4
5# Load model and tokenizer
6model = WhisperForConditionalGeneration.from_pretrained("Noobbbbb/whisper-small-bn")
7tokenizer = WhisperTokenizer.from_pretrained("Noobbbbb/whisper-small-bn")
8processor = WhisperProcessor.from_pretrained("Noobbbbb/whisper-small-bn")
9
10# Load audio (must be 16kHz)
11audio, sr = librosa.load("audio.wav", sr=16000)
12
13# Extract features
14input_features = processor.feature_extractor(
15 audio,
16 sampling_rate=16000,
17 return_tensors="pt"
18).input_features
19
20# Generate transcription
21with torch.no_grad():
22 generated_ids = model.generate(input_features, max_length=448)
23
24# Decode
25transcription = tokenizer.decode(generated_ids[0], skip_special_tokens=True)
26print(transcription)