Views
No views yet
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3tokenizer = AutoTokenizer.from_pretrained("TalTechNLP/mBART-ERRnews")
4model = AutoModelForSeq2SeqLM.from_pretrained("TalTechNLP/mBART-ERRnews")
5
6text = "Riigikogu rahanduskomisjon võttis esmaspäeval maha riigieelarvesse esitatud investeeringuettepanekutest siseministeeriumi investeeringud koolidele ja lasteaedadele, sest komisjoni hinnangul ei peaks siseministeerium tegelema investeeringutega väljaspoole oma vastutusala. Komisjoni esimees Aivar Kokk ütles, et komisjon lähtus otsuse tegemisel riigikontrolör Janar Holmi soovitusest ja seadustest."
7inputs = tokenizer(text, return_tensors='pt', max_length=1024)
8
9summary_ids = model.generate(inputs['input_ids'])
10summary = [tokenizer.decode(g, skip_special_tokens=True, clean_up_tokenization_spaces=False) for g in summary_ids]| Dataset | ROUGE-1 | ROUGE-2 | ROUGE-L | ROUGE-L-SUM |
|---|---|---|---|---|
| ERRnews | 19.2 | 6.7 | 16.1 | 17.4 |
1article{henryabstractive,
2 title={Abstractive Summarization of Broadcast News Stories for {Estonian}},
3 author={Henry, H{\"a}rm and Tanel, Alum{\"a}e},
4 journal={Baltic J. Modern Computing},
5 volume={10},
6 number={3},
7 pages={511-524},
8 year={2022}
9 }