Views
No views yet
| Phase | Dataset | Steps | LR |
|---|---|---|---|
| Phase 1 | Phonetic corpus (400,000 pairs) | 9,000 | 0.0003 |
| Phase 2 | Adhoc curated (10,000 × 10) | 4,000 | 6e-05 |
r=32, alpha=64, dropout 0.05q_proj, k_proj, v_proj, out_proj| Metric | Phase 1 | Final |
|---|---|---|
| BLEU-char | 83.4084 | 83.7157 |
| WER | 0.2709 | 0.3266 |
| CER | 0.1002 | 0.0986 |
| ExactMatch | 0.1784 | 0.0932 |
1from transformers import MBart50TokenizerFast, MBartForConditionalGeneration
2
3repo = 'dimeshanthoney/mbart-large-m50-singlish-sinhala'
4tokenizer = MBart50TokenizerFast.from_pretrained(repo)
5model = MBartForConditionalGeneration.from_pretrained(repo)
6
7src_text = 'oya kohomada'
8tokenizer.src_lang = 'en_XX'
9enc = tokenizer(src_text, return_tensors='pt')
10
11gen = model.generate(
12 **enc,
13 forced_bos_token_id=tokenizer.lang_code_to_id['si_LK'],
14 max_length=128,
15 num_beams=5
16)
17
18print(tokenizer.batch_decode(gen, skip_special_tokens=True)[0])