This dataset contains cleaned text extracted from the latest Portuguese Wikibooks.
text: cleaned plain text (no templates/tags)
title: page title
page_id: page id from the XML dump
ns: page namespace id
section_texts: list of cleaned section texts (lead included)