Views
No views yet
| Language | Code | Test WER |
|---|---|---|
| Khasi | kha | 16.89% |
| Garo | grt | 9.31% |
| Mizo | lus | 23.85% |
| Nagamese | nag | 49.13% |
| Kokborok | trp | 44.79% |
| Assamese | asm | 20.98% |
| Chakma | ccp | 54.25% |
| Wancho | wao | 68.37% |
| Overall | 36.06% |
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import soundfile as sf
3import torch
4
5processor = WhisperProcessor.from_pretrained("MWirelabs/ne-asr")
6model = WhisperForConditionalGeneration.from_pretrained("MWirelabs/ne-asr")
7
8audio, sr = sf.read("audio.wav")
9inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
10
11# Force language token (use "welsh" for all except Assamese)
12forced_ids = processor.get_decoder_prompt_ids(language="welsh", task="transcribe")
13with torch.no_grad():
14 predicted_ids = model.generate(inputs.input_features, forced_decoder_ids=forced_ids)
15
16transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
17print(transcription)@inproceedings{nyalang2026nemultispeech,
title={{NE}-MultiSpeech: A Multilingual Speech Corpus and {ASR} Benchmark for Northeast Indian Languages},
author={Nyalang, Badal and Borah, Angana},
booktitle={The 2026 Conference on Empirical Methods in Natural Language Processing},
year={2026},
url={https://openreview.net/forum?id=cOCsA88Fza}
}