Views
No views yet
1from transformers import MBartForConditionalGeneration, MBartTokenizer
2
3# Load model and tokenizer
4model_name = "deshanksuman/swabhashambart50SinhalaTransliteration"
5tokenizer = MBartTokenizer.from_pretrained(model_name)
6model = MBartForConditionalGeneration.from_pretrained(model_name)
7
8# Set language codes
9tokenizer.src_lang = "en_XX" # Using English as source language token
10tokenizer.tgt_lang = "si_LK" # Sinhala as target
11
12# Prepare input
13text = "mama oyata adare karanawa"
14inputs = tokenizer(text, return_tensors="pt", max_length=128, padding="max_length", truncation=True)
15
16# Generate output
17outputs = model.generate(
18 input_ids=inputs["input_ids"],
19 attention_mask=inputs["attention_mask"],
20 max_length=128,
21 num_beams=5,
22 early_stopping=True
23)
24
25# Decode output
26result = tokenizer.decode(outputs[0], skip_special_tokens=True)
27print(result)1@article{sumanathilaka2025swa,
2 title={Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources},
3 author={Sumanathilaka, Deshan and Perera, Sameera and Dharmasiri, Sachithya and Athukorala, Maneesha and Herath, Anuja Dilrukshi and Dias, Rukshan and Gamage, Pasindu and Weerasinghe, Ruvan and Priyadarshana, YHPP},
4 journal={arXiv preprint arXiv:2507.09245},
5 year={2025}
6}
7
8