Liputan6 is a large-scale Indonesian text summarization dataset of news articles from Liputan6.com. The canonical configuration contains 215,827 document-summary pairs. The dataset also provides the XTREME preprocessing variant.
Language: Indonesian (ind)
Task: text summarization
License: CC BY-SA 4.0
Canonical configuration: 193,883 train, 10,972 validation, and 10,972 test examples
XTREME configuration: 175,207 train, 4,948 validation… See the full description on the dataset page:
https://huggingface.co/datasets/joshuasiagian/liputan6.