Views
No views yet
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base_model = "Qwen/Qwen3.5-35B-A3B-Base"
5adapter_id = "ai-literacy-innovation-institute/ilma-FT-MUI"
6
7tokenizer = AutoTokenizer.from_pretrained(base_model)
8model = AutoModelForCausalLM.from_pretrained(base_model)
9
10# Muat LoRA Adapter
11model = PeftModel.from_pretrained(model, adapter_id)<think>):<think>...</think>, nilai ROUGE terlihat rendah. Ini adalah Paradoks Evaluasi, karena skrip penilai memotong seluruh narasi di dalam tag <think> untuk menilai jawaban akhir (yang ringkas), kemudian membandingkannya dengan Ground Truth yang memuat keseluruhan Chain-of-Thought (yang panjang). Skor Base Model bahkan lebih tinggi secara false-positive karena ia gagal mengikuti instruksi tag dan mengalami lexical verbosity yang bertepatan secara n-gram. Hal ini membuktikan bahwa ILMA-FT-MUI secara absolut sukses dalam kepatuhan format struktural (structural alignment) dari Teacher Model.)