Views
No views yet
google/gemma-4-31b-it) karşılaştırmalı olarak test edildi (62 kategori, 6.200 soru). Fine-tuning ürün asistanlığına odaklandığından, genel MMLU başarısında taban modelin gerisinde kaldığı gözlemlendi.| Model | Başarı | Süre |
|---|---|---|
| Bu model (fine-tuned) | %71.73 | ~38 dk |
Referans (gemma-4-31b-it) | %84.89 | ~90 dk |
| Model | Kaynak | Başarı | Doğru/Toplam | Süre |
|---|---|---|---|---|
gemma-4-26b-a4b-it | OpenRouter | %85.61 | 119/139 | 32 sn |
gemma-4-E4B-it (taban, fine-tune edilmemiş) | HuggingFace (lokal) | %82.01 | 114/139 | 86 sn |
| Bu model (fine-tuned) | HuggingFace (lokal) | %81.29 | 113/139 | 115 sn |
qwen3.5-flash-02-23 | OpenRouter | %76.98 | 107/139 | 499 sn |
deepseek-v4-flash | OpenRouter | %41.73 | 58/139 | 60 sn |
gemma-4-E4B-it) hafifçe gerisinde kaldı (%81.29 vs %82.01). Bu, fine-tuning'in stil/üslup açısından katkı sağlarken, çoktan seçmeli/bilgi doğruluğu odaklı bu benchmark'ta taban modelin genel yeteneğini aşacak kadar belirgin bir kazanım sağlamadığını düşündürüyor. En yüksek başarı, çok daha büyük bir modelin (gemma-4-26b-a4b-it) API üzerinden test edilmesiyle elde edildi.deepseek-v4-flash): Bu modelin düşük skorunun asıl nedeni bilgi eksikliği değil — 139 sorunun 70'inde (%50) model cevabı tamamen boş dönmüş. Bu, modelin "thinking" (iç muhakeme) aşamasında yanıt üretmeye devam edip, testte kullanılan kısa max_tokens sınırı içinde asıl harf cevabına hiç sıra gelmeden kesilmesinden kaynaklanıyor. Yani bu sonuç modelin gerçek yeteneğini değil, bu test kurulumunun (düşünme bütçesi tanımadan kısa cevap istemenin) reasoning modelleriyle uyumsuzluğunu yansıtıyor.Ders4/ klasöründe aynı ağaç yapısıyla mevcuttur:README — pipeline özeti ve test edilen modellerBenchmarkSoruHavuzuAnalizi.ipynb — 1. adım: ham soru-cevap verisinin LLM ile analiziCoktanSecmeliBenchmarkOlustur.ipynb — 2. adım: çoktan seçmeli soru/şık üretimibenchmark_hf_yukle.py — benchmark'ı HuggingFace'e yükleme script'imodel_karsilastirma_benchmark.py — 3. adım: 5 modeli sırayla test eden scriptBenchmarkResults/ — soru bazlı model çıktıları
karsilastirma_ozeti.json — 5 modelin özet karşılaştırmasıhf_trendyol-marangoz-finetuned-gemma-4-E4B-it_benchmark_sonuc.json — bu modelin soru bazlı cevaplarıhf_gemma-4-E4B-it_benchmark_sonuc.json — taban modelin soru bazlı cevaplarıopenrouter_google_gemma-4-26b-a4b-it_benchmark_sonuc.jsonopenrouter_qwen_qwen3.5-flash-02-23_benchmark_sonuc.jsonopenrouter_deepseek_deepseek-v4-flash_benchmark_sonuc.jsonllm_urun_bazli_sonuclar.json, llm_coktan_secmeli_ham_v2.json — ara LLM üretim önbellekleri