Magibu-11b-v0.8, Magibu AI Research tarafından geliştirilen, Türkçe odaklı, çok dilli, Çok Modlu (Multimodal) bir modeldir.
Önemli Not: Bu model, mevcut bir modelin üzerine yapılan basit bir "fine-tune" işlemi değildir.
Magibu-11b, kendi geliştirdiğimiz özgün eğitim yöntemleri ve veri setleri ile üretilmiştir. Google Gemma-3 modeli güncel kütüphanelerle (Transformers, VLLM, Ollama vb.) tam uyumlu çalışabilmesi için hem bilgi hem de altyapı standardı olarak kullanılmıştır.
Türkçe'ye özel optimize edilmiş tokenizer'ı sayesinde, dünyadaki en token-verimli Türkçe modellerden biridir.
Neden Magibu?
Standart tokenizer'lar Türkçe kelimeleri anlamsız, çok sayıda küçük parçaya böler. Bu durum şunlara yol açar:
Yüksek Maliyet: Aynı cümle için daha fazla token üretilir.
Yavaş Çalışma: Daha fazla token = daha yavaş yanıt üretimi.
Ziyan Olan Kapasite: Context penceresi (hafıza) gereksiz yere dolar.
Magibu, Türkçe'ye özel eğitim süreci sayesinde bu sorunu çözer ve diğer tüm modellerden %30 - %127 daha verimli çalışır.
Magibu-11b-v0.8, Türkçe MMLU benchmark testinde %74.40 başarı oranı ile 44 açık kaynak model arasında 6. sırada yer almaktadır. Kendisinden 2 ila 6 kat daha büyük modelleri geride bırakmayı başarmıştır.
🔑 Öne Çıkan Karşılaştırmalar
🔥 Magibu-11b (11B) vs. Llama-3.1 (70B): Magibu, 70 Milyar parametreli Llama-3.1 modelini +4 puan farkla geçmiştir (%74.40 vs %70.42). Bunu yaparken 6 kat daha az işlem gücü ve %54 daha az token kullanır.
🏛️ Magibu-11b vs. Turkish-Gemma-9b-T1 (YTU COSMOS): Yıldız Teknik Üniversitesi COSMOS Lab tarafından geliştirilen Turkish-Gemma-9b-T1 modeli %70.34 skor almıştır. Magibu, benzer parametre sayısında +4.06 puan fark atarak ve çok daha verimli çalışarak öne çıkmaktadır.
📊 Sıralama Tablosu (İlk 25)
#
Model
Param
MMLU
Token
MMLU Farkı
Token Farkı
1
Llama-3.3
70B
79.42%
221,411
+6.75%
+53.85%
2
DeepSeek-V3.2
685B MoE
77.69%
326,246
+4.42%
+126.69%
3
Kimi-K2
1T MoE
77.44%
312,609
+4.09%
+117.22%
4
Qwen3-32B
32B
75.98%
260,407
+2.12%
+80.95%
5
Gemma-3 27B
27B
75.06%
211,024
+0.89%
+46.63%
6
🧿 Magibu-11b
11B
74.40%
143,915
—
—
7
Qwen3-30B (A3B MoE)
30B
74.26%
260,407
-0.19%
+80.95%
8
MedGemma-27B
27B
74.18%
211,024
-0.30%
+46.63%
9
Emre-Gemma3-27B
27B
73.21%
211,024
-1.60%
+46.63%
10
Gemma-2 27B
27B
72.10%
223,174
-3.09%
+55.07%
11
Qwen3-14B
14B
71.65%
260,407
-3.70%
+80.95%
12
Doktor-Gemma3 12B
12B
71.08%
211,024
-4.46%
+46.63%
13
Gemma-3 12B
12B
70.74%
211,024
-4.92%
+46.63%
14
Aya-Expanse 32B
32B
70.66%
187,742
-5.03%
+30.45%
15
Ministral-3 14B
14B
70.55%
244,878
-5.17%
+70.15%
⚔️16
Llama-3.1 70B
70B
70.42%
221,411
-5.35%
+53.85%
🏛️17
Turkish-Gemma-9b-T1
9B
70.34%
223,174
-5.46%
+55.07%
18
Gemma-2 9B
9B
69.26%
223,174
-6.91%
+55.07%
19
Metin-Gemma2 DPO
9B
69.16%
223,174
-7.04%
+55.07%
20
GPT-OSS-20B (OpenAI)
20B
68.47%
224,052
-7.97%
+55.68%
21
Mistral-Small 24B
24B
68.37%
244,937
-8.10%
+70.20%
22
Qwen3-7B
7B
67.56%
260,407
-9.19%
+80.95%
23
Ministral-3B (latest)
3B
67.44%
244,878
-9.35%
+70.15%
24
Mistral-Small (old)
24B
66.97%
244,937
-9.99%
+70.20%
25
Phi-4 14B
14B
65.52%
316,029
-11.94%
+119.59%
Token Farkı: Magibu-11b'ye kıyasla diğer modellerin aynı metni ifade etmek için yüzde kaç daha fazla token kullandığını gösterir. Pozitif değerler, modelin Türkçe için daha az verimli olduğunu (daha çok token harcadığını) belirtir.
🎯 Cetvel Türkçe Benchmark Sonuçları
Magibu-11b-v0.8, Cetvel — Türkçe için en kapsamlı birleşik LLM benchmark'ında — 34 model arasında 3. sırada yer almaktadır (ortalama: 32.5).
7 farklı NLP kategorisinde (GEC, MCQA, MT, NLI, QA, SUM, TC) toplam 26 görevde değerlendirilen model, 14B altındaki en yüksek puanlı model olarak öne çıkmaktadır. Kendisinden 3-6 kat büyük modelleri (aya-23-35B, aya-expanse-32b vs.) geride bırakmayı başarmıştır.
🥇 Soru Cevaplama (QA) kategorisinde tüm modeller arasında 1. sıra — 45.0 puanla en yakın rakibini (Qwen2.5-14B, 26.7) büyük farkla geçmiştir.
Not: Değerlendirme görev başına 500 örnek limiti ile yapılmıştır. Tam veri seti ile yapılan değerlendirmelerde ±%2-3 sapma beklenebilir. Detaylı rapor ve replikasyon rehberi için: cetvel_results_magibu_11b_v0.8.md
📊 Görsel Analizler
📈 MMLU Sıralaması
44 modelin Türkçe performans sıralaması. Magibu-11b (turuncu ◆), kendisinden çok daha büyük modelleri (Llama-3.1 70B, Gemma-2 27B vb.) geride bırakmıştır.
MMLU Rankings — Magibu-11b vs 44 Open Models
🎯 Token Verimliliği vs. Performans
Bu grafik, modellerin doğruluğu (Y ekseni) ile token harcamasını (X ekseni) karşılaştırır. İdeal konum sol üst köşedir (az token, çok başarı). Magibu-11b bu bölgede tek başınadır.
Token Efficiency vs MMLU Performance — Magibu dominates the top-left quadrant
📊 Tokenizer Verimlilik Karşılaştırması
Modellerin aynı Türkçe veri setini (MMLU) kaç token ile ifade ettiğinin karşılaştırması. Magibu en düşük token sayısına sahiptir.
Tokenization Efficiency — Magibu uses the fewest tokens for Turkish text
🏷️ Model Aileleri Karşılaştırması
Farklı model ailelerinin (Gemma, Llama, Qwen, vb.) verimlilik gruplandırması. Magibu (turuncu ●) diğer tüm ailelerden ayrı bir verimlilik sınıfındadır.
Model Families — Score vs Tokenization Efficiency
🧪 Token Verimliliği Nedir? Neden Önemli?
Türkçe'nin Yapısal Sorunu
Türkçe gibi sondan eklemeli dillerde kelimeler ek alarak uzar. Standart Batı dilleri için eğitilmiş tokenizer'lar bu kelimeleri verimsiz böler.
Örnek:
Türkçe İfade
Standart Tokenizer
Magibu Tokenizer
evlerimizden
ev, ler, im, iz, den (5 token)
evlerimizden (1-2 token)
güzelleştiremediklerimizden
8-12 token
3-4 token
Türkiye'nin
Tür, kiye, ', nin (4 token)
Türkiye'nin (1-2 token)
Sonuç:alibayram/turkish_mmlu veri setinin tamamı tokenize edildiğinde ortaya çıkan farklar:
Sıra
Tokenizer
Toplam Token
Fark (vs Magibu)
Not
🥇
Magibu-11b
143,915
—
🇹🇷 En İyi Türkçe Model
🥈
Aya-Expanse
187,742
+30.5% daha fazla
Çok dilli model
🥉
Gemma-3
211,024
+46.6% daha fazla
Google Official
4
Llama-3
221,411
+53.9% daha fazla
Meta Official
5
Turkish-Gemma-9b (COSMOS)
223,174
+55.1% daha fazla
YTU (Fine-tune)
6
Qwen2/3
260,407
+80.9% daha fazla
Alibaba
7
DeepSeek-V3.2
326,246
+126.7% daha fazla
DeepSeek
Pratik Etkisi: Magibu ile 1000 token tutan bir işlem, diğer modellerde 1300-2200 token tutar. Magibu kullanmak daha hızlıdır, daha ucuzdur ve daha uzun metinleri hafızada tutabilir.
🚀 Hızlı Başlangıç (Quick Start)
🤗 Transformers
python
1from transformers import pipeline
23soru ="Zaman makineniz olsaydı ve sadece bir kez geçmişe ya da geleceğe gidebilseydiniz, hangisini seçerdiniz ve neden?"45generator = pipeline("text-generation", model="magibu/magibu-11b-v0.8", device="cuda")6cevap = generator(7[{"role":"user","content": soru}],8 max_new_tokens=512,9 return_full_text=False10)[0]11print(cevap["generated_text"])
🖼️ Görsel Kullanımı (Multimodal)
Magibu-11b, görselleri anlayabilir ve soruları yanıtlayabilir (VLM):
Modeli çalışmalarınızda kullanırsanız lütfen aşağıdaki şekilde atıf yapınız:
bibtex
1@misc{bayram2025magibu,
2 title = {{Magibu-11b: A Turkish-Native Multilingual Vision-Language Model with Optimized Tokenization}},
3 author = {Ali Bayram},
4 year = 2025,
5 howpublished = {\url{https://huggingface.co/magibu/magibu-11b-v0.8}},
6 note = {Developed by Magibu AI Research}
7}