Bangla KenLM 5-gram tokenized
This repository hosts a Bengali 5-gram KenLM language model built from:
- Kaggle newspaper corpus (Bangla sentences)
- Mozilla Common Voice Bengali transcripts
Usage:
- Binary LM path:
bangla_5gram_tokenized.binary
- ARPA LM path:
bangla_5gram_tokenized.arpa
Intended for CTC beam search rescoring in ASR systems (e.g., Wav2Vec2-CTC + pyctcdecode).
Licensing:
- Ensure your downstream use complies with the source corpora licenses.