Biyoloji Llama 3.1 8B (LoRA)
Llama 3.1 8B Instruct modelinin, Türkçe biyoloji soru-cevap veri seti üzerinde LoRA yöntemiyle ince ayar edilmiş adaptörü.
Eğitim Detayları
- Temel model: unsloth/Meta-Llama-3.1-8B-Instruct-bnb-4bit (4-bit)
- Yöntem: LoRA (r=16, alpha=16), unsloth
- Veri: nyzmemre/biyoloji-terimleri-turkce-sa (1093 örnek)
- Süreç: 1 epoch, ~137 adım, Google Colab (T4 GPU)
Kullanım
1from unsloth import FastLanguageModel
2
3model, tokenizer = FastLanguageModel.from_pretrained(
4 "nyzmemre/biyoloji-llama-3.1-8b-lora", load_in_4bit=True)
5FastLanguageModel.for_inference(model)
6
7mesajlar = [{"role": "user", "content": "Fotosentez nedir?"}]
8girdi = tokenizer.apply_chat_template(
9 mesajlar, tokenize=True, add_generation_prompt=True, return_tensors="pt").to("cuda")
10cikti = model.generate(input_ids=girdi, max_new_tokens=150,
11 repetition_penalty=1.3, no_repeat_ngram_size=3)
12print(tokenizer.decode(cikti[0][girdi.shape[1]:], skip_special_tokens=True))
Değerlendirme 1: Türkçe MMLU
Model, genel bilgi ve akıl yürütmeyi ölçen Türkçe MMLU benchmark'ında (6200 soru) değerlendirilmiştir. Ölçüm bir H100 GPU üzerinde, vLLM ile ve tam hassasiyette (bf16) gerçekleştirilmiştir.
| Model | Ortam | Türkçe MMLU |
|---|
| Bu model (bf16, tam hassasiyet) | vLLM / H100 | %42.23 |
| Bu model (q4) | Ollama | %24.00 |
| Llama 3.1 8B (temel, q4) | liderlik tablosu | %35.11 |
Karşılaştırmanın sınırı: Tablodaki üç sonuç birbirinden farklı ortamlarda elde edilmiştir. bf16 skoru tüm 6200 soruda vLLM ile; q4 skoru yalnızca 300 soruluk bir alt kümede ve Ollama motoruyla; temel modelin skoru ise liderlik tablosundan (q4) alınmıştır. Bu nedenle sayılar birebir kıyaslanabilir değildir ve aralarındaki farkın ne kadarının quantization'dan, ne kadarının değerlendirme ortamından (motor, örneklem büyüklüğü, ayrıştırıcı) kaynaklandığı ayrı ölçümler yapılmadan söylenemez. Özellikle q4 sonucu (300 soru) istatistiksel olarak gürültülüdür ve yalnızca göstergesel kabul edilmelidir. En güvenilir ölçüm tam hassasiyetli (bf16), tam 6200 soruluk koşudur (%42.23). Tam adil bir karşılaştırma için temel modelin de aynı ortamda (bf16, aynı 6200 soru, aynı prompt/ayrıştırıcı) koşulması gerekir.
Değerlendirme 2: Alana Özel Held-out Benchmark
Modelin asıl hedef alanını ölçmek için, eğitimde hiç kullanılmayan 102 gerçek biyoloji sınav sorusundan (çoktan seçmeli) oluşan özel bir test seti hazırlanmış ve beş modelde koşulmuştur.
| Model | Başarı (102 soru) |
|---|
| qwen3:8b | %52.94 |
| gemma4 | %48.04 |
| qwen2.5:7b | %39.22 |
| Bu model | %29.41 |
| Llama 3.1 8B (temel) | %24.51 |
İnce ayar edilmiş model, kendi alanında temel Llama 3.1 8B modelini geçmiştir (%29.41'e karşı %24.51). Bu bulgu, dar alanlı ince ayarın hedef alanda ölçülebilir bir iyileşme sağladığını göstermektedir. Bununla birlikte, daha güçlü genel amaçlı modeller (qwen3, gemma4, qwen2.5) daha yüksek başarı elde etmiştir; küçük ölçekli bir modeli sınırlı veriyle eğitmek bu modelleri yakalamaya yetmemektedir.
Genel değerlendirme: Dar alanlı ince ayar modelin genel yeteneklerini artırmaz; ancak hedeflenen alanda temel modele göre bir iyileşme sağlayabilir.
Değerlendirme Yöntemi ve Tekrarlanabilirlik
Sonuçların yeniden üretilebilmesi için kullanılan ayarlar:
- MMLU (bf16): motor vLLM,
bfloat16, tek H100 GPU; örnekleme greedy (do_sample=False, sıcaklık 0), max_new_tokens=42.
- q4 ve alan-içi benchmark: Ollama (q4_k_m),
temperature=0, seed=42.
- Prompt (her iki değerlendirme): "Sana soru ve seçenekleri veriyorum. sadece hangi seçeneğin sorunun doğru cevabı olduğunu yaz. Örneğin 'A' veya 'B' gibi. Lütfen herhangi bir açıklama yapma!"
- Puanlama: modelin çıktısındaki ilk
A–E harfi doğru şık ile karşılaştırılır (çoktan seçmeli exact-match).
- Veri: MMLU için alibayram/yapay_zeka_turkce_mmlu; alan-içi test için eğitim dışı 102 soru.
Sınırlamalar
- Quantization (q4) başarıyı belirgin biçimde düşürmektedir; tam hassasiyetli kullanım önerilir.
- Model, eğitim verisinde "bilmiyorum" örneği bulunmadığından, bilmediği terimlerde tanım uydurabilir (halüsinasyon).
- Çalışma eğitim/gösterim amaçlıdır ve bir bilgi kaynağı olarak kullanılmamalıdır.