Dataset Card for Cleaned & Chunked WikiText Corpus
π Dataset Description
This dataset is a cleaned and chunked version of WikiText-style corpus, designed for language model pretraining and evaluation.
The preprocessing pipeline follows a lightweight data curation paradigm: