Views
No views yet
unsloth/llama-3-8b-bnb-4bitunsloth, trl, peft, transformersr=16, lora_alpha=16, lora_dropout=0Instruction/Output şablonu kullanılmıştır.peft kütüphanesi ile ana modele (Llama-3) entegre ederek doğrudan çalıştırabilirsiniz.1from unsloth import FastLanguageModel
2
3# Taban model ve geliştirdiğimiz LoRA adaptörünün birlikte yüklenmesi
4model, tokenizer = FastLanguageModel.from_pretrained(
5 model_name = "Egertekin/marvel-lora-adapter",
6 max_seq_length = 2048,
7 dtype = None,
8 load_in_4bit = True,
9)
10
11# Modeli çıkarım (inference) moduna alma
12FastLanguageModel.for_inference(model)
13
14alpaca_prompt = """Aşağıdaki bir görevi veya soruyu tanımlayan talimattır. Talebi uygun şekilde tamamlayan bir yanıt yazın.
15
16### Talimat:
17Wolverine'in iskeleti hangi metalden yapılmıştır?
18
19### Yanıt:
20"""
21
22# Soruyu modele iletme ve yanıt üretme
23inputs = tokenizer([alpaca_prompt], return_tensors = "pt").to("cuda")
24outputs = model.generate(**inputs, max_new_tokens = 64, use_cache = True)
25print(tokenizer.batch_decode(outputs))
26
27
28
29------------------------------------------------------------
30
31## MMLU Benchmark Karşılaştırması
32
33Modelimizin bilgi işleme ve çoklu görev kavrama yeteneğini ölçmek amacıyla, Türkçe MMLU benchmark testi uygulanmıştır. Test sonuçları, uygulanan LoRA Fine-Tuning işleminin modelde "catastrophic forgetting" yol açmadığını ve modelin genel başarı oranını baz modele göre yukarı taşıdığını bilimsel olarak kanıtlamaktadır.
34
35| Model / Versiyon | Test Edilen Model Adı | Türkçe MMLU Genel Skoru (Accuracy) |
36| :--- | :--- | :---: |
37| **Base Model (Eğitimsiz)** | `unsloth/llama-3-8b-bnb-4bit` | % 19.82 |
38| **Fine-Tuned Model (LoRA)** | `Egertekin/marvel-lora-adapter` | **% 20.82** |
39
40*Not: Test, `alibayram/yapay_zeka_turkce_mmlu_bolum_sonuclari` veri seti ve Hugging Face `SentenceTransformer` anlamsal benzerlik metrikleri kullanılarak Google Colab (T4 GPU) ortamında tüm sorular üzerinden çalıştırılmıştır.*
41
42
43------------------------------------------------------------
44
45
46
47## Özel Domain Benchmark Testi (Marvel Evreni Bilgi Doğruluğu)
48
49Modelin fine-tune edildiği spesifik senaryodaki (Marvel Evreni, karakter arka planları ve olay örgüleri) tutarlılığını ölçmek amacıyla, eğitim setine **kesinlikle dahil edilmemiş** yepyeni bir Benchmark oluşturulmuştur.
50
51Orijinal veri setinin yaklaşık **%11lik** hacmine denk gelen bu özel test seti, modelin daha önce hiç görmediği 20 adet, 5 şıklı (A, B, C, D, E) ve zorluk derecesi yüksek sorudan oluşmaktadır. Test, 4-bit kuantizasyon standartlarına uygun olarak doğrudan zero-shot formatta gerçekleştirilmiş; çıktıların analizi için Regex tabanlı bir ayrıştırıcı kullanılmıştır.
52
53### 📊 Marvel-Bench V2 Sonuçları
54
55| Değerlendirme Kriteri | Sonuç |
56| :--- | :--- |
57| **Toplam Soru Sayısı** | 20 (Eğitim Verisinin ~%11i) |
58| **Doğru Cevap Sayısı** | 8 |
59| **Başarı Oranı** | **%40.00** |
60| **Inference Süresi** | 21.29 Saniye |
61| **Üretim Hızı** | 1.88 Token/Saniye |
62| **Test Senaryosu** | Türkçe Marvel Evreni Bilgi Doğruluğu |
63
64**Sonuç Analizi:** Model, 5 şıklı zero-shot test formatinda rastgele başari oranının (%20) iki katı olan **%40.00** doğruluğa ulaşarak domain spesifik bilgileri öğrendiğini göstermiştir. Ancak test çıktıları incelendiğinde, modelin emin olamadığı sorularda "B" şıkkını seçme eğilimi gösterdiği (Positional/Token Bias) tespit edilmiştir. Bu durum, modelin Instruction-Tuning aşamasında çoktan seçmeli formatlardan ziyade serbest metin üretimine daha yatkın olduğunu kanıtlamaktadır.