Views
No views yet
google/pegasus-xsum using supervised fine-tuning.google/pegasus-xsumtext → summary)1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3model_name = "anonymous12321/Pegasus-Summarization-Council-PT"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
6
7text = """
817. PROCESSO DE OBRAS N.º ***** -- EDIFIC\nPelo Senhor Presidente foi presente a esta reunião a informação n.º ****** da Secção de Urbanismo e Fiscalização -- Serviço de Obras Particulares que se anexa à presente ata. \nPonderado e analisado o assunto o Executivo Municipal deliberou por unanimidade aprovar as especialidades relativas ao processo de obras n.º ***** -- EDIFIC.
9"""
10
11inputs = tokenizer(text, return_tensors="pt", max_length=1024, truncation=True)
12summary_ids = model.generate(**inputs, max_length=128, num_beams=4, early_stopping=True)
13print(tokenizer.decode(summary_ids[0], skip_special_tokens=True))
14"O Executivo Municipal aprovou, por unanimidade, as especialidades relativas a um processo de obras particulares."
| Metric | Score | Description |
|---|---|---|
| ROUGE-1 | 0.367 | Unigram overlap between generated and reference summaries |
| ROUGE-2 | 0.179 | Bigram overlap |
| ROUGE-L | 0.309 | Longest common subsequence overlap |
| BERTScore (F1) | 0.746 | Semantic similarity between summary and reference |
google/pegasus-xsumAutoTokenizer (matching checkpoint)eval_strategy="steps", eval_steps=100)save_total_limit=1)max_length=512 and stride=256DataCollatorForSeq2Seq (dynamic padding)./results_hierarchical_pegasus_segments./trained_pegasus_segments