Views
No views yet
A BigBird‐Pegasus model fine‑tuned for meeting transcription summarization on the MeetingBank dataset.
pytorch_model.bin, config.jsontokenizer.json, tokenizer_config.json, merges.txt, special_tokens_map.jsongeneration_config.json| Metric | F1 Score (%) |
|---|---|
| ROUGE‑1 | 51.5556 |
| ROUGE‑2 | 38.5378 |
| ROUGE‑L | 48.0786 |
| ROUGE‑Lsum | 48.0142 |
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2import torch
3
4# 1) Load from the Hub
5tokenizer = AutoTokenizer.from_pretrained("Shaelois/MeetingScript")
6model = AutoModelForSeq2SeqLM.from_pretrained("Shaelois/MeetingScript")
7
8# 2) Summarize a long transcript
9transcript = """
10 Alice: Good morning everyone, let’s get started…
11 Bob: I updated the design mockups…
12 … (thousands of words) …
13"""
14inputs = tokenizer(
15 transcript,
16 max_length=4096,
17 truncation=True,
18 return_tensors="pt"
19).to("cuda")
20
21summary_ids = model.generate(
22 **inputs,
23 num_beams=4,
24 max_length=150,
25 early_stopping=True
26)
27summary = tokenizer.decode(summary_ids[0], skip_special_tokens=True)
28print("📝 Summary:", summary)