Views
No views yet
| Property | Value |
|---|---|
| Base model | google/mt5-base |
| Language | Khmer (km) |
| Task | Abstractive text summarization |
| Max input length | 1 024 tokens |
| Max summary length | 256 tokens |
| Beam search | 4 beams |
| No-repeat n-gram | 3 |
1from transformers import pipeline
2
3summarizer = pipeline(
4 "summarization",
5 model="taravirak/khmer-mt5-summarization",
6 tokenizer="taravirak/khmer-mt5-summarization",
7 device=0, # set to -1 for CPU
8)
9
10article = "សូមបញ្ចូលអត្ថបទជាភាសាខ្មែរនៅទីនេះ..."
11result = summarizer(
12 "summarize: " + article,
13 max_new_tokens=256,
14 num_beams=4,
15 length_penalty=1.0,
16 no_repeat_ngram_size=3,
17 early_stopping=True,
18)
19print(result[0]["summary_text"])1import torch
2from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
3
4model_id = "taravirak/khmer-mt5-summarization"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForSeq2SeqLM.from_pretrained(model_id)
7model.eval()
8
9article = "សូមបញ្ចូលអត្ថបទជាភាសាខ្មែរនៅទីនេះ..."
10inputs = tokenizer(
11 "summarize: " + article,
12 return_tensors="pt",
13 max_length=1024,
14 truncation=True,
15)
16
17with torch.no_grad():
18 output_ids = model.generate(
19 **inputs,
20 max_new_tokens=256,
21 num_beams=4,
22 length_penalty=1.0,
23 no_repeat_ngram_size=3,
24 early_stopping=True,
25 )
26
27print(tokenizer.decode(output_ids[0], skip_special_tokens=True))summarize: prepended to each article