Views
No views yet
🚀 Hedef:
"Türkçe büyük dil modelleri için yeni bir altyapı standardı oluşturmak."
| Özellik | Açıklama |
|---|---|
| 🌐 Yalnızca Türkçe'ye Özel | Genel modellerin aksine, sadece Türkçe için optimize edildi |
| 🧩 Morfolojik Duyarlılık | trmor ile kök-ek analizi ile eğitildi, uzayıcı kelimeler anlamlı şekilde bölünür |
| 🛠️ Hata Toleransı | "denglem" → ["denk", "lem"] gibi yaygın öğrenci hatalarını anlar |
| 🔢 Yüksek Performans | Qwen3'te %35 daha az token, %38 daha hızlı inference |
| 📚 Eğitim Odaklı | MEB, Maarif, LGS, sunumlar, ders notları, soru bankaları |
| 🔗 Çoklu Model Uyumu | Qwen3, Mistral, Llama3, DeepSeek'e entegre edilebilir |
| 🧪 Pedagojik Token’lar | [HATA], [TAVSİYE], [STİL:GÖRSEL], [KONU:MATEMATİK] gibi özel token’lar |
| 🧠 Anlam Bütünlüğü | GSM8K-TR, WikiRAG-TR ile test edildi, anlam kaybı minimum |
| Metrik | Orijinal Qwen3 | SugarTrQ-Token | Kazanç |
|---|---|---|---|
| Ort. token/soru (...) | 132 | 86 | %35 azalma |
| Inference süresi (A100) | 1.3 sn | 0.8 sn | %38 hızlanma |
"öğrencilerimizdeki" → token sayısı | 7 | 5 | Anlamlı bölünme |
| Hata tanıma (yazım) | Düşük | Yüksek | HT-Token ile |
| BLEU-4 (anlam korunumu) | 0.76 | 0.89 | +17% |
__egitim klasörü (PDF/DOCX/PPT)"Open Super-large Crawled Aggregated coRpus, Common Crawl verilerinden türetilmiştir. 151 dilde mevcuttur. Türkçe alt kümesi 6.4 milyar kelime içermektedir."
"Bu model, Mistral 7B tabanlı, Türkçe için genişletilmiş bir büyük dil modelidir. 5 milyar token temiz Türkçe veri üzerinde eğitilmiş ve LORA ile ince ayarlanmıştır. Tokenizer'ı özellikle Türkçe'ye uygun hâle getirilmiştir."
1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("MustafaSeker/sugartrq-tokenizer-tr")
4
5text = "öğrencilerimizdeki matematik problemini çözemedik çünkü üslü sayılarda hata yaptık"
6tokens = tokenizer.tokenize(text)
7print(tokens)
8# Output: ['öğrenci', 'ler', 'imiz', 'de', 'ki', 'matematik', 'problemini', 'çöze', 'medik', 'çünkü', 'üs', 'lü', 'sayılarda', 'hata', 'yaptık']