Views
No views yet
| Property | Value |
|---|---|
| Base Model | BAAI/bge-m3 |
| Architecture | XLM-RoBERTa + Pooling + Normalize |
| Embedding Dimension | 1024 |
| Max Sequence Length | 8192 |
| Similarity Function | Cosine |
| Loss Functions | MultipleNegativesRankingLoss + TripletLoss |
| Language | Turkish 🇹🇷 |
| Use Cases | Semantic Search, Text Similarity, RAG, Clustering |
| Metric | Base (BAAI/bge-m3) | Fine-tuned | Δ (Change) |
|---|---|---|---|
| Spearman (ρ) | 0.6814 | 0.6839 | +0.0025 |
| Pearson (r) | 0.8535 | 0.9096 | +0.0561 |
The model demonstrates higher linear correlation on Turkish STS benchmarks, producing more consistent semantic scores for Turkish-language retrieval and ranking tasks.
1from sentence_transformers import SentenceTransformer, util
2
3model = SentenceTransformer("nezahatkorkmaz/turkce-embedding-bge-m3")
4
5s1 = "Türkiye'nin başkenti Ankara'dır"
6s2 = "Ankara Türkiye'nin başşehridir"
7
8emb1, emb2 = model.encode([s1, s2], normalize_embeddings=True)
9score = util.cos_sim(emb1, emb2).item()
10print(f"Cosine similarity: {score:.4f}")
11# Expected output ≈ 0.75–0.80