Fine-tuned version of
facebook/m2m100_1.2B for Welsh to English translation.
All pairs were filtered to a maximum of 200 characters per side, and pairs with a length ratio greater than 3:1 were removed. Tokenised sequences longer than 128 tokens were also excluded.
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3tokenizer = AutoTokenizer.from_pretrained("DewiBrynJones/m2m100_1.2B-ft-cy-to-en")
4model = AutoModelForSeq2SeqLM.from_pretrained("DewiBrynJones/m2m100_1.2B-ft-cy-to-en")
5
6tokenizer.src_lang = "cy"
7inputs = tokenizer("Sut mae?", return_tensors="pt")
8generated = model.generate(**inputs, forced_bos_token_id=tokenizer.get_lang_id("en"))
9print(tokenizer.decode(generated[0], skip_special_tokens=True))