Views
No views yet
pip install transformers accelerate sentencepiecetransformers==4.40.21from transformers import pipeline
2translator = pipeline('translation', model='Mitsua/elan-mt-bt-en-ja')
3translator('Hello. I am an AI.')pip install transformers accelerate sentencepiece pysbd1import pysbd
2seg_en = pysbd.Segmenter(language="en", clean=False)
3txt = 'Hello. I am an AI. How are you doing?'
4print(translator(seg_en.segment(txt)))ja-en back-translation model on 4M lines openly licensed corpus for 6 epochs. = ElanMT-base-ja-enen-ja base translation model on 4M lines openly licensed corpus for 6 epochs. = ElanMT-base-en-jaja Wikipedia to en using back-translation model.en-ja models, which is finetuned from ElanMT-base-en-ja checkpoint, on 24M lines training data augmented with back-translated data for 6 epochs.| Model | Params | FLORES+ BLEU | FLORES+ chrf | NTREX BLEU | NTREX chrf |
|---|---|---|---|---|---|
| ElanMT-BT | 61M | 29.96 | 38.43 | 25.63 | 35.41 |
| ElanMT-base w/o back-translation | 61M | 26.55 | 35.28 | 23.04 | 32.94 |
| ElanMT-tiny | 15M | 25.93 | 34.69 | 22.78 | 33.00 |
| staka/fugumt-en-ja (*1) | 61M | 30.89 | 38.38 | 24.74 | 34.23 |
| facebook/mbart-large-50-many-to-many-mmt | 610M | 26.31 | 34.37 | 23.35 | 32.66 |
| facebook/nllb-200-distilled-600M | 615M | 17.09 | 27.32 | 14.92 | 26.26 |
| facebook/nllb-200-3.3B | 3B | 20.04 | 30.33 | 17.07 | 28.46 |
| google/madlad400-3b-mt | 3B | 24.62 | 33.89 | 23.64 | 33.48 |
| google/madlad400-7b-mt | 7B | 25.57 | 34.59 | 24.60 | 34.43 |
transformers==4.29.2 and num_beams=4sacreBLEU with tokenize=ja-mecab