A fine-tuned version of
BAAI/bge-m3 optimized for
Bangla cross-script semantic search. The model understands and aligns text across:
1from sentence_transformers import SentenceTransformer
2
3model = SentenceTransformer("nahidstaq/bge-m3-bangla")
4
5# These all mean the same thing - the model knows that!
6sentences = [
7 "আজকের আবহাওয়া কেমন?", # Pure Bangla
8 "ajker weather kemon?", # Banglish
9 "আজকে weather কেমন হবে?", # Mixed
10 "what is today's weather?", # English
11]
12
13embeddings = model.encode(sentences, normalize_embeddings=True)
14
15# Compute similarity
16from sentence_transformers.util import cos_sim
17print(cos_sim(embeddings, embeddings))
18# All pairs will show high similarity (>0.85)
1@misc{bge-m3-bangla-cross-script,
2 author = {Hasan, Md Nahid},
3 title = {BGE-M3 Bangla Cross-Script Fine-tuned},
4 year = {2025},
5 url = {https://huggingface.co/nahidstaq/bge-m3-bangla},
6 note = {Fine-tuned on cross-script Bangla data for semantic search}
7}