Views
No views yet
| Model | WER | CER | Improvement |
|---|---|---|---|
| Base (whisper-small) | 145.67% | 101.57% | - |
| This Model | 36.17% | 11.36% | 75.2% |
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import librosa
3
4# Load model and processor
5processor = WhisperProcessor.from_pretrained("vanshnawander/whisper-small-hindi-asr")
6model = WhisperForConditionalGeneration.from_pretrained("vanshnawander/whisper-small-hindi-asr")
7
8# Load audio
9audio, sr = librosa.load("audio.wav", sr=16000)
10
11# Transcribe
12input_features = processor(audio, sampling_rate=16000, return_tensors="pt").input_features
13generated_ids = model.generate(input_features, language="hi", task="transcribe")
14transcription = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
15
16print(transcription)1from transformers import pipeline
2
3pipe = pipeline(
4 "automatic-speech-recognition",
5 model="vanshnawander/whisper-small-hindi-asr",
6 chunk_length_s=30,
7)
8
9result = pipe("audio.wav", generate_kwargs={"language": "hi", "task": "transcribe"})
10print(result["text"])