Views
No views yet
1from transformers import MBartForConditionalGeneration, MBart50TokenizerFast
2
3model_name = "your-username/mbart-en-te"
4
5tokenizer = MBart50TokenizerFast.from_pretrained(model_name)
6model = MBartForConditionalGeneration.from_pretrained(model_name)
7
8# English → Telugu
9text = "How are you?"
10inputs = tokenizer(text, return_tensors="pt")
11tokenizer.src_lang = "en_XX"
12generated = model.generate(**inputs, forced_bos_token_id=tokenizer.lang_code_to_id["te_IN"])
13print(tokenizer.decode(generated[0], skip_special_tokens=True))
14# "మీరు ఎలా ఉన్నారు?"
15
16# Telugu → English
17text = "మీరు ఎలా ఉన్నారు?"
18inputs = tokenizer(text, return_tensors="pt")
19tokenizer.src_lang = "te_IN"
20generated = model.generate(**inputs, forced_bos_token_id=tokenizer.lang_code_to_id["en_XX"])
21print(tokenizer.decode(generated[0], skip_special_tokens=True))
22# "How are you?"
23Training
24
25Base model: facebook/mbart-large-50-many-to-many-mmt
26
27Task: English ↔ Telugu translation
28
29Framework: Hugging Face Transformers (PyTorch)
30
31Training setup: [Add epochs, batch size, learning rate here]
32
33Dataset: [Mention dataset name or source]
34
35⚠️ Limitations
36
37Works best on short to medium sentences.
38
39May struggle with idiomatic or domain-specific text.