Views
No views yet
1from transformers import MT5Tokenizer, GPT2LMHeadModel, TextGenerationPipeline
2
3tokenizer = MT5Tokenizer.from_pretrained("THUMT/mGPT")
4model = GPT2LMHeadModel.from_pretrained("THUMT/mGPT")
5
6pipeline = TextGenerationPipeline(model=model, tokenizer=tokenizer)
7text = "Replace me by any text you'd like."
8text = pipeline(text, do_sample=True, max_length=1024)[0]["generated_text"]sentencepiece and a vocabulary size of 250,100. The inputs are sequences of 1,024 consecutive tokens. We use <extra_id_0> to separate lines in a document.1@misc{tan2021msp,
2 title={MSP: Multi-Stage Prompting for Making Pre-trained Language Models Better Translators},
3 author={Zhixing Tan and Xiangwen Zhang and Shuo Wang and Yang Liu},
4 year={2021},
5 eprint={2110.06609},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL}
8}