Views
No views yet

max_seq_length değeri 8192'ye çıkarılmıştır:1SentenceTransformer(
2 (0): Transformer({'max_seq_length': 8192, 'do_lower_case': False}) with Transformer model: Gemma3TextModel
3 (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
4 (2): Dense({'in_features': 768, 'out_features': 3072, 'bias': False, 'activation_function': 'torch.nn.modules.linear.Identity'})
5 (3): Dense({'in_features': 3072, 'out_features': 768, 'bias': False, 'activation_function': 'torch.nn.modules.linear.Identity'})
6 (4): Normalize()
7)transformer-clonertransformer-cloner kütüphanesi kullanılmıştır.distil-trainer kullanılarak student model optimize edilmiştir.| Model | Pearson | Spearman |
|---|---|---|
| intfloat/multilingual-e5-large-instruct | 0.8275 | 0.8129 |
| trmteb/turkish-embedding-model-fine-tuned | 0.8215 | 0.8061 |
| embeddingmagibu-200m (Bu Model) | 0.8199 | 0.7980 |
| ytu-ce-cosmos/turkish-e5-large | 0.8090 | 0.7906 |
| sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | 0.7884 | 0.7659 |
| google/embeddinggemma-300m (Teacher) | 0.7391 | 0.7194 |
Not: Bu sonuçlar modelin özellikle semantik benzerlik konusunda teacher modelini (EmbeddingGemma-300m) belirgin şekilde geçtiğini ve lider tablosundaki (SOTA) modellere çok yaklaştığını göstermektedir.
pip install -U sentence-transformers1from sentence_transformers import SentenceTransformer
2
3# Modeli yükle (remote code trust gerekli olabilir)
4model = SentenceTransformer("alibayram/embeddingmagibu-200m", trust_remote_code=True)
5
6# 8192 token uzunluğuna kadar metinleri işleyebilir
7sentences = [
8 "Bugün hava çok güzel.",
9 "Dışarısı güneşli.",
10 "Uzun bağlam gerektiren çok detaylı bir hukuki veya teknik metin..."
11]
12
13embeddings = model.encode(sentences, normalize_embeddings=True)
14print(embeddings.shape) # (3, 768)1import numpy as np
2
3sim = embeddings @ embeddings.T # normalize edilmişse cosine == dot
4print(sim)include_prompt=True ayarı ile eğitildiği için sorgu (query) ve doküman (document) ayrımı yapabilir:1from sentence_transformers import SentenceTransformer
2
3model = SentenceTransformer("alibayram/embeddingmagibu-200m", trust_remote_code=True)
4
5query = "Yapay zeka modellerinde distillation nedir?"
6docs = [
7 "Distillation, büyük bir öğretmen modelin bilgisinin daha küçük bir öğrenci modele aktarılmasıdır.",
8 "Yapay zeka günümüzde çok popüler.",
9]
10
11q = model.encode_query(query)
12d = model.encode_document(docs)
13
14scores = model.similarity(q, d)
15print(scores)float16 yerine mümkünse bfloat16 veya float32 kullanımı önerilir.1@misc{embeddingmagibu_200m_2026,
2 title={embeddingmagibu-200m: Long-Context Turkish Sentence Embeddings},
3 author={Bayram, M. Ali},
4 year={2026},
5 url={[https://huggingface.co/alibayram/embeddingmagibu-200m](https://huggingface.co/alibayram/embeddingmagibu-200m)}
6}