Fine-tuned version of
alirezamsh/small100 for the task of
Singlish-to-Sinhala transliteration, developed as part of the
IndoNLP 2025 Shared Task on Singlish–Sinhala Transliteration.
This is the merged (LoRA weights absorbed) final model.
Singlish (romanised colloquial Sinhala) → Sinhala script transliteration.
Aggression factor: 0.5. Applied at 15% / 20% / 15% across the three phases.
Each phase resumes from the previous phase's LoRA adapter. Early stopping: patience=5, metric=CER.
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3model_id = "savinugunarathna/Small100-Singlish-Sinhala-Merged"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForSeq2SeqLM.from_pretrained(model_id)
6
7tokenizer.src_lang = "en"
8tokenizer.tgt_lang = "si"
9
10inputs = tokenizer("mama giya", return_tensors="pt")
11outputs = model.generate(**inputs, num_beams=4, max_length=128)
12print(tokenizer.decode(outputs[0], skip_special_tokens=True))
13# → මම ගිය