Views
No views yet
intfloat/multilingual-e5-small
for robust semantic retrieval across Bangla (Bengali script), English, and
Banglish (romanized Bengali) — including resilience to the heavy spelling
variation that romanized Bengali exhibits (e.g. bhalobashi ↔ valobashi).intfloat/multilingual-e5-small (XLM-RoBERTa backbone, 384-dim)query: / passage:
prefixes — so you do not need them. Just encode raw strings.1from sentence_transformers import SentenceTransformer
2
3model = SentenceTransformer("istiaqfuad/triBne-e5-small")
4
5sentences = [
6 "ami tomake bhalobashi", # Banglish
7 "ami tomake valobashi", # Banglish spelling variant
8 "আমি তোমাকে ভালোবাসি", # Bangla
9 "I love you", # English
10]
11emb = model.encode(sentences, normalize_embeddings=True)
12print(model.similarity(emb, emb))1import torch
2import torch.nn.functional as F
3from transformers import AutoModel, AutoTokenizer
4
5tok = AutoTokenizer.from_pretrained("istiaqfuad/triBne-e5-small")
6model = AutoModel.from_pretrained("istiaqfuad/triBne-e5-small")
7
8def encode(texts):
9 batch = tok(texts, padding=True, truncation=True, max_length=128, return_tensors="pt")
10 with torch.no_grad():
11 out = model(**batch)
12 mask = batch["attention_mask"].unsqueeze(-1).float()
13 emb = (out.last_hidden_state * mask).sum(1) / mask.sum(1) # mean pooling
14 return F.normalize(emb, p=2, dim=1)
15
16emb = encode(["ami tomake bhalobashi", "আমি তোমাকে ভালোবাসি"])
17print((emb[0] @ emb[1]).item())| Model | MRR@10 | NDCG@10 | Recall@10 |
|---|---|---|---|
| This model (e5-small, fine-tuned) | 0.926 | 0.937 | 0.970 |
| Multilingual E5 (base) | 0.644 | 0.673 | 0.768 |
| BGE-M3 | 0.661 | 0.683 | 0.753 |
| LaBSE | 0.626 | 0.648 | 0.720 |
| Qwen3-Embedding-0.6B | 0.613 | 0.644 | 0.743 |
| EmbeddingGemma-300m | 0.593 | 0.619 | 0.702 |
| Task | This model | Base e5 |
|---|---|---|
| banglish_spelling | 0.890 | 0.616 |
| cross_script (bn↔banglish) | 0.981 | 0.498 |
| en_bn | 0.907 | 0.818 |
MultipleNegativesRankingLoss (in-batch negatives), scale 20.0r=32, alpha=64, dropout=0.1, targets query,key,value,dense,
task_type=FEATURE_EXTRACTION (adapter merged into the backbone for this release)istiaqfuad/bangla-english-banglish-pairs
— ~2.4M contrastive pairs (LLM-generated Banglish spelling variants + cross-script
pairs, plus OPUS-100 English↔Bangla), interleaved 80% Banglish / 20% English–Bangla.1@misc{tribne-e5-small,
2 title = {triBne-e5-small: multilingual-e5-small fine-tuned for Banglish/Bangla/English retrieval},
3 author = {Istiaqur Rahman Fuad},
4 year = {2026},
5 url = {https://huggingface.co/istiaqfuad/triBne-e5-small}
6}