Views
No views yet
Ablation finding: Forcing KL-SFT when base PS ≥ 80% does not improve results. Parse success is comparable (98.0% vs 98.5%) but PPL degrades (+10.8) and ScaLA AUROC drops (0.592 vs 0.617). The no-SFT variant (emilcw/llama-3.2-1b-nb-saga-delta-dpo) is the recommended model.
| Metric | Base | No-SFT Δ-DPO | KL-SFT + Δ-DPO (this) |
|---|---|---|---|
| Stanza PS ↑ | 83.0% | 98.5% | 98.0% |
| Parse score ↑ | 0.392 | 0.622 | 0.630 |
| PPL-Wiki ↓ | 30.1 | 33.0 | 43.8 |
| ScaLA AUROC ↑ | 0.605 | 0.617 | 0.592 |
| Summ PS ↑ | 63.0% | 100% | 100% |
| Summ score ↑ | 0.202 | 0.722 | 0.758 |
| RC APS ↑ | 31.0% | 87.5% | 93.0% |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.2-1B", torch_dtype="auto")
5model = PeftModel.from_pretrained(base, "emilcw/llama-3.2-1b-nb-saga-kl-sft-delta-dpo")
6tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3.2-1B")
7
8prompt = "Norsk er"
9inputs = tokenizer(prompt, return_tensors="pt")
10output = model.generate(**inputs, max_new_tokens=60, temperature=0.8, do_sample=True)
11print(tokenizer.decode(output[0], skip_special_tokens=True))nb_core_news_lg (Norwegian dependency parser)1@article{fakhar2025saga,
2 title={SAGA: Syntax-Aware Grammar Alignment for Low-Resource Nordic Languages},
3 author={Fakhar, Hoda and others},
4 year={2025},
5 note={Under review}
6}