Views
No views yet
enfa-fa = code-switched en+fa queries → fa documents.
It is designed to be robust when bilingual users issue mixed English+Persian queries against
Persian (Farsi)-language documents.| Base model | xlm-roberta-large |
| Architecture | ColBERT (late interaction) |
| Projection dim | 128 |
| Similarity | cosine |
| Query max length | 32 |
| Doc max length | 180 |
| Training | KD (KLD), n-way 6, teacher: mT5-XXL/monoT5 on mMARCO |
1from colbert.modeling.checkpoint import Checkpoint
2from colbert.infra import ColBERTConfig
3
4ckpt = Checkpoint("<your-username>/ColBERT-XLMR-Mixed-Distill-enfa-fa",
5 colbert_config=ColBERTConfig())
6Q = ckpt.queryFromText(["mixed English+Persian query ..."])
7D = ckpt.docFromText(["Persian (Farsi) document passage ..."])1@misc{kim2025milqbenchmarkingirmodels,
2 title={MiLQ: Benchmarking IR Models for Bilingual Web Search with Mixed Language Queries},
3 author={Jonghwi Kim and Deokhyung Kang and Seonjeong Hwang and Yunsu Kim and Jungseul Ok and Gary Lee},
4 year={2025},
5 eprint={2505.16631},
6 archivePrefix={arXiv},
7 primaryClass={cs.IR},
8 url={https://arxiv.org/abs/2505.16631},
9}