Views
No views yet
1import torch
2from transformers import GPT2Tokenizer, T5ForConditionalGeneration
3tokenizer = GPT2Tokenizer.from_pretrained('ai-forever/FRED-T5-1.7B',eos_token='</s>')
4model = T5ForConditionalGeneration.from_pretrained('ai-forever/FRED-T5-1.7B')
5device='cuda'
6model.to(device)
7
8#Prefix <LM>
9lm_text='<LM>Принялся Кутузов рассказывать свою историю как он сюда попал. Началось'
10input_ids=torch.tensor([tokenizer.encode(lm_text)]).to(device)
11outputs=model.generate(input_ids,eos_token_id=tokenizer.eos_token_id,early_stopping=True)
12print(tokenizer.decode(outputs[0][1:]))
13
14# print result: , как водится, с того, что он был в плену.</s>
15
16#Prefix <SC1>
17lm_text='<SC1>Принялся Кутузов рассказывать свою историю <extra_id_0>. Началось с того, что он был в армии, служил в артиллерии.'
18input_ids=torch.tensor([tokenizer.encode(lm_text)]).to(device)
19outputs=model.generate(input_ids,eos_token_id=tokenizer.eos_token_id,early_stopping=True)
20print(tokenizer.decode(outputs[0][1:]))
21
22#print result: '<extra_id_0>, как он жил</s>'
23
24# Prefix <SC5>
25lm_text='<SC5>Принялся Кутузов рассказывать свою историю <extra_id_0>. Началось с того, что он был в армии, служил в артиллерии.'
26input_ids=torch.tensor([tokenizer.encode(lm_text)]).to(device)
27outputs=model.generate(input_ids,eos_token_id=tokenizer.eos_token_id,early_stopping=True,max_length=100)
28print(tokenizer.decode(outputs[0][1:]))
29
30#print result: '<extra_id_0> </s>'
31@misc{zmitrovich2023family,
title={A Family of Pretrained Transformer Language Models for Russian},
author={Dmitry Zmitrovich and Alexander Abramov and Andrey Kalmykov and Maria Tikhonova and Ekaterina Taktasheva and Danil Astafurov and Mark Baushenko and Artem Snegirev and Tatiana Shavrina and Sergey Markov and Vladislav Mikhailov and Alena Fenogenova},
year={2023},
eprint={2309.10931},
archivePrefix={arXiv},
primaryClass={cs.CL}
}