MEB Öğretmen Qwen3-14B LoRA
unsloth/Qwen3-14B tabanlı, Millî Eğitim Bakanlığı öğretmenlerinin özlük ve mevzuat
sorularına yanıt vermek üzere ince ayar (fine-tune) yapılmış bir LoRA adaptörü.
⚠️ Bu model uzmanlaşmış bir asistandır, genel bilgi modeli değildir. Aşağıdaki
Değerlendirme ve Sınırlamalar bölümlerini mutlaka okuyun.
Model Tanımı
| |
|---|
| Taban model | unsloth/Qwen3-14B (14 milyar parametre) |
| Tip | LoRA adaptörü (birleştirilmiş/merged değil) |
| Yöntem | 4-bit QLoRA (unsloth) |
| LoRA rank (r) | 16 |
| LoRA alpha | 16 |
| Max sequence length | 2048 |
| Eğitilebilir parametre | 64,2M (%0,43) |
| Eğitim verisi | namruni/meb-ogretmen-soru-cevap — 450 örnek (405 eğitim / 45 doğrulama) |
| Epoch | 2 (overfitting nedeniyle 3'ten geri çekildi) |
| Donanım | L4 GPU, ~18 dakika |
| Lisans | Apache 2.0 |
Kullanım Amacı
- Hedef: MEB öğretmenlerinin özlük hakları ve mevzuat (izin, atama, haklar vb.)
konularında Türkçe soru-cevap.
- Uygun kullanım: İlgili mevzuat konularında ilk yönlendirme / taslak yanıt.
- Uygun OLMAYAN kullanım: Genel bilgi/akademik soru-cevap (bkz. Değerlendirme),
bağlayıcı hukuki tavsiye, kaynak/madde numarası doğrulaması.
Değerlendirme (TR-MMLU)
Model, TR-MMLU (alibayram/turkish_mmlu, mmlu split, 6200 soru; Bayram ve diğerleri)
üzerinde, yalın taban modelle kontrollü bir kıyas ile değerlendirilmiştir.
Yöntem: 4-bit yükleme · düşünme modu kapalı (enable_thinking=False) · greedy
(deterministik) · tek-harf cevap · doğruluk (accuracy). Base ve LoRA birebir aynı 6200
soruda koşuldu (adil/kontrollü deney; tek değişen = LoRA).
| Model | Doğru | Başarı |
|---|
| Yalın Qwen3-14B (kontrol) | 3995/6200 | %64,44 |
| Qwen3-14B + bu LoRA (deney) | 3879/6200 | %62,56 |
Bulgu: Fine-tune, genel bilgi başarısını ~1,9 puan düşürmüştür (hafif "unutma" /
catastrophic forgetting). Konu-bazı kırılımda tutarlı bir alan kazancı gözlenmemiştir
(bölüm başına 100 soru olduğu için tekil farklar gürültü düzeyindedir).
Konu-bazı kırılım (en çok değişen bölümler)
62 bölüm × 100 soru = 6200. ⚠️ 100 soruda belirsizlik payı ±~9 puan olduğundan tekil
satırlar istatistiksel olarak anlamlı değildir; aşağıdaki liste yalnızca "en çok oynayan"
bölümleri gösterir.
| Bölüm | Base % | LoRA % | Fark |
|---|
| Adalet | 70,0 | 72,0 | +2,0 |
| Lojistik | 67,0 | 69,0 | +2,0 |
| Türk Dili ve Edebiyatı | 48,0 | 50,0 | +2,0 |
| Yaşlı Bakımı | 69,0 | 71,0 | +2,0 |
| Turizm ve Seyahat Hizmetleri | 61,0 | 63,0 | +2,0 |
| … | … | … | … |
| Spor Yönetimi | 65,0 | 59,0 | −6,0 |
| Özel Koruma ve Güvenlik | 68,0 | 62,0 | −6,0 |
| Aşçılık | 70,0 | 63,0 | −7,0 |
| Uluslararası Ticaret ve Lojistik Yönetimi | 69,0 | 62,0 | −7,0 |
| Yerel Yönetimler | 65,0 | 57,0 | −8,0 |
Kırılım yorumu: "İyileşen" bölümlerdeki +2'ler gürültü düzeyindedir (gerçek kazanç
değil). Düşüşler idari/mesleki alanlarda daha belirgin görünse de tek tek kesin değildir.
Kritik nokta: modelin fine-tune alanına (öğretmen özlük/mevzuat) en yakın görünen
bölümlerde bile tutarlı bir kazanç yoktur — ör. "Adalet" +2 (gürültü), "Yerel
Yönetimler" −8. Çünkü TR-MMLU'daki bu konular genel sınav sorularıdır, modelin öğrendiği
dar mevzuat soru-cevabı değildir.
Yorum: Bu beklenen bir sonuçtur. Modelin uzmanlaştığı alan (öğretmen özlük/mevzuat,
450 örnek), TR-MMLU'nun ölçtüğü genel akademik bilgiyle örtüşmez; dolayısıyla benchmark
bu uzmanlaşmayı ölçemez ve yalnızca genel yetenekteki küçük aşınmayı gösterir. Modelin asıl
değeri, kendi alanındaki bir değerlendirme ile ölçülmelidir (bkz. aşağıdaki
Değerlendirme 2 — Alan-İçi Benchmark).
Not: Sonuçlar, TR-MMLU liderlik tablosundaki qwen3:14b skorundan (%71,65) düşüktür;
çünkü o skor farklı koşulda (Ollama Q4_K_M, düşünme modu açık) alınmıştır. Yalnızca
aynı koşuldakiler kıyaslanmalıdır (like-with-like). Tam yöntem ve kod için repodaki
tr_mmlu_benchmark.ipynb dosyasına bakınız.
Değerlendirme 2 — Alan-İçi Benchmark (MEB Mevzuatı)
TR-MMLU modelin genel bilgisini ölçtü; ama modelin uzmanlaştığı dar alanı (MEB
öğretmen mevzuatı) ölçemez. Bu boşluğu kapatmak için, modelin senaryosuna özel, modelin
eğitimde hiç görmediği sorulardan oluşan bir benchmark sıfırdan üretildi.
Aşamalar (yöntem)
-
Held-out (görülmemiş) veri ayırma. Modelin eğitiminde kullanılan 450 örnek dışlandı.
Eğitim için kazınan 1022 forum konusundan geriye kalan ~571 soru, modelin hiç görmediği
bir havuz oluşturdu. Neden gerekli: Model, eğitimde gördüğü bir soruyu "ezber"le
cevaplarsa skor sahte olur (veri sızıntısı / data leakage).
-
Senaryo: MEB öğretmen özlük/mevzuat açık uçlu soru-cevabı.
-
Hibrit test seti üretimi (142 soru). İki bölüm:
- Bölüm B — Mevzuat bilgisi (136): Gerçek forum sorularında en çok kullanılan MEB
belgelerine (Atama-Yer Değiştirme Yönetmeliği, mazeret duyuruları, 7528 Meslek Kanunu,
657 DMK, Yönetici Görevlendirme, izin/rapor, ek ders, kariyer basamakları…) gerçek
kullanım oranıyla dağıtılmış; güçlü bir dil modeliyle (ChatGPT/Codex) o belge metinlerine
demirlenerek üretilmiş, ayırt edici (tanım/evet-hayır olmayan) sorular.
- Bölüm A — Gerçek forum soruları (6): modelin görmediği gerçek öğretmen soruları;
cevapları ilgili belgelere dayalı üretildi. Düşük verim (60 adaydan 6) — çünkü gerçek
forum sorularının çoğunun mevzuatta net tek cevabı yok. Küçük n → yalnızca niteliksel.
- Referans (altın) cevaplar insan uzman değil, bir LLM tarafından belgelere demirlenerek
üretildi (damıtma-tarzı referans; şeffaflık için açıkça belirtilir).
-
Model koşumu (kontrollü deney). Base ve LoRA, birebir aynı 142 soruda, aynı
koşullarda (4-bit yükleme · düşünme kapalı · greedy) çalıştırıldı; açık uçlu cevaplar
toplandı. Tek değişen = LoRA yaması.
-
Puanlama — LLM-as-judge. Açık uçlu cevap birebir eşleştirilemez; bir hakem modele
(soru, referans cevap, aday cevap) verilip Doğru (1) / Kısmen (0,5) / Yanlış (0)
kararı aldırıldı. Adalet için: hakem cevabın hangi modelden geldiğini bilmez (kör), ve
her cevap ikili kıyas yerine referansa karşı tek tek puanlandı (pozisyon yanlılığını
önlemek için).
Sonuçlar
| Model | Bölüm B (ana, 136 soru) | Genel (142) |
|---|
| Yalın Qwen3-14B (kontrol) | %16,5 (±6,2) | %16,9 |
| Qwen3-14B + bu LoRA (deney) | %17,3 (±6,4) | %17,3 |
(Bölüm A (n=6) tek başına anlamlı değildir; hata payı ±~30 puan.)
Bulgu: LoRA, taban modeli istatistiksel olarak anlamlı ölçüde geçmedi — fark
(+0,8 puan) güven aralığının (±~6 puan) çok içindedir, yani gürültü düzeyinde. Fine-tune'un
belirgin etkisi üslupta (forum "Hocam…" tonu), bilgi doğruluğunda değil. 450 örneklik
eğitim, modele bir üslup kazandırmaya yeter; ama yeni mevzuat gerçekleri enjekte etmeye yetmez.
Genel resim (iki benchmark birlikte): Fine-tune ne genel bilgide (TR-MMLU: ~2 puan aşınma)
ne de kendi alanında (bu benchmark: anlamlı fark yok) ölçülebilir bir bilgi artışı
sağlamıştır; kazanç öncelikle üslup/biçim düzeyindedir. Daha büyük bir bilgi kazancı için
daha büyük ve olgu-yoğun bir eğitim seti gerekir.
Not: Mutlak skorların düşük olması (~%17), sınavın zorluğundandır: açık uçlu, kesin bilgi
(tam sayı/koşul) isteyen sorular ve sıkı puanlama. Bu benchmark mutlak skordan çok
kontrollü kıyas için tasarlanmıştır.
Sınırlamalar ve Riskler
- Genel bilgi: Taban modele göre ~1,9 puan daha düşüktür (yukarıya bakınız).
- Alan-içi bilgi: Kendi uzmanlık alanında da taban modele istatistiksel olarak anlamlı
bir üstünlük göstermemiştir (bkz. Değerlendirme 2). Belirgin etki üsluptadır, bilgide değil.
- Kaynak atıfları güvenilmez: Uydurma belge adı / madde numarası üretebilir.
- Olgusal doğruluk garantili değildir; kritik kullanımda RAG ile desteklenmelidir.
- Yasal tavsiye değildir; 2025–2026 dönemi verisine dayanır.
Atıf
- TR-MMLU (Değerlendirme 1): Zenodo DOI ile atıf yapınız (Bayram, M. Ali ve diğerleri —
TR-MMLU,
alibayram/turkish_mmlu).
- Alan-İçi Benchmark (Değerlendirme 2): bu çalışma için üretilmiştir —
namruni/meb-ogretmen-benchmark
(kod: github.com/namruni/meb-ogretmen-benchmark).