Views
No views yet
!pip install -U transformers
!pip install https://github.com/kpu/kenlm/archive/master.zip
!pip install pyctcdecode1from huggingface_hub import login
2login("TOKEN")1## BRDialect
2from huggingface_hub import hf_hub_download
3
4kenlm_model_path = hf_hub_download(repo_id="Jakir057/BRDialect", filename="BRDialect/5gram_kenlm.arpa")
5state_dict_path = hf_hub_download(repo_id="Jakir057/BRDialect", filename="BRDialect/wav2vec2_bangla_regional_dialect.pth")1from transformers import AutoProcessor, AutoModelForCTC, Wav2Vec2ProcessorWithLM
2import torch
3import numpy as np
4import pyctcdecode
5import librosa
6
7base_model_id = "ai4bharat/indicwav2vec_v1_bengali"
8processor = AutoProcessor.from_pretrained(base_model_id)
9model = AutoModelForCTC.from_pretrained(base_model_id)
10model.load_state_dict(torch.load(state_dict_path)["model"])
11
12vocab_dict = processor.tokenizer.get_vocab()
13sorted_vocab_dict = {k: v for k, v in sorted(vocab_dict.items(), key=lambda item: item[1])}
14decoder = pyctcdecode.build_ctcdecoder(
15 list(sorted_vocab_dict.keys()),
16 str(kenlm_model_path)
17)
18processor_with_lm = Wav2Vec2ProcessorWithLM(
19 feature_extractor=processor.feature_extractor,
20 tokenizer=processor.tokenizer,
21 decoder=decoder
22)
23model.freeze_feature_encoder()
24model.eval()1sampling_rate = 16000
2path = "AUDIO_PATH"
3frame, sr = librosa.load(path, sr=sampling_rate, mono=True)
4
5inputs = processor(
6 frame,
7 sampling_rate=sampling_rate,
8 return_tensors="pt",
9 padding=False
10)
11
12with torch.no_grad():
13 logits = model(inputs.input_values.to("cpu")).logits
14
15np_logits = logits.squeeze(0).cpu().numpy()
16result = processor_with_lm.decode(np_logits, beam_width=256)
17text = result.text
18print(f"Transcription={text}")@article{hasan2025banglatalk,
title={BanglaTalk: Towards Real-Time Speech Assistance for Bengali Regional Dialects},
author={Hasan, Jakir and Dipta, Shubhashis Roy},
journal={arXiv preprint arXiv:2510.06188},
year={2025}
}
@inproceedings{javed2022towards,
title={Towards building asr systems for the next billion users},
author={Javed, Tahir and Doddapaneni, Sumanth and Raman, Abhigyan and Bhogale, Kaushal Santosh and Ramesh, Gowtham and Kunchukuttan, Anoop and Kumar, Pratyush and Khapra, Mitesh M},
booktitle={Proceedings of the aaai conference on artificial intelligence},
volume={36},
number={10},
pages={10813--10821},
year={2022}
}