
ytu-ce-cosmos/modernbert-tr-base.Qwen/Qwen3-Embedding-8B.| Model | Params | Retr | Classif | PairCls | Cluster | STS | Bitext | Mean |
|---|---|---|---|---|---|---|---|---|
| ModernBERT-TR-Embed (ours) | 150M | 59.4 | 76.5 | 69.2 | 63.3 | 77.6 | 94.1 | 68.14 |
| ytu-ce-cosmos/turkish-e5-large | 560M | 61.5 | 72.6 | 62.8 | 60.9 | 80.0 | 99.3 | 67.17 |
| microsoft/harrier-oss-v1-0.6b | 600M | 60.1 | 71.1 | 58.6 | 63.3 | 74.5 | 98.6 | 65.57 |
| intfloat/multilingual-e5-large | 560M | 61.7 | 69.2 | 65.6 | 60.8 | 81.0 | 99.0 | 66.56 |
| Qwen/Qwen3-Embedding-4B | 4B | 63.1 | 70.2 | 60.1 | 61.3 | 77.0 | 97.8 | 66.69 |
1from sentence_transformers import SentenceTransformer
2model = SentenceTransformer("mrbesher/modernbert-tr-embed")
3
4emb = model.encode(["bir cümle", "başka bir cümle"], normalize_embeddings=True)
5
6q = model.encode(["soru"], prompt_name="query", normalize_embeddings=True)
7d = model.encode(["döküman"], normalize_embeddings=True)config_sentence_transformers.json):
Instruct: Given a web search query, retrieve relevant passages that answer the query\nQuery:{text}.onnx/ folder has the grapgh for the token embeddings, it includes 3 graphs: token embeddings, mean-pool and L2-norm.1from sentence_transformers import SentenceTransformer
2model = SentenceTransformer("mrbesher/modernbert-tr-embed", backend="onnx",
3 model_kwargs={"file_name": "onnx/model_fp16.onnx"})text-embeddings-router --model-id mrbesher/modernbert-tr-embed --dtype float16boun-tabi/nli_tr train), Turkish STS-B (train), and Turkish classification-domain text (product reviews, news, social), all teacher-supervised. We check for leaks with text-hash against every MTEB(Turkish) test split.apache-2.0.