Views
No views yet
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import librosa
3
4processor = WhisperProcessor.from_pretrained("mandipgoswami/whisper-medium-rirmega")
5model = WhisperForConditionalGeneration.from_pretrained("mandipgoswami/whisper-medium-rirmega")
6
7audio, sr = librosa.load("path/to/reverberant_audio.wav", sr=16000)
8input_features = processor(audio, sampling_rate=16000, return_tensors="pt").input_features
9predicted_ids = model.generate(input_features)
10transcript = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
11print(transcript)from_pretrained).| Dataset | Split | WER |
|---|---|---|
| Whisper-RIR-Mega | test | 0.0430 |
1@article{goswami2026whisperrirmega,
2 title={Whisper-RIR-Mega: A Paired Clean-Reverberant Speech Benchmark for ASR Robustness to Room Acoustics},
3 author={Goswami, Mandip},
4 journal={arXiv preprint arXiv:2603.02252},
5 year={2026}
6}