This dataset contains cleaned English Wikipedia articles used to train the JULIAN-100M language model.
Dataset Structure
Data Fields
title (string): Article title
text (string): Full article text (cleaned and formatted)
url (string): Original Wikipedia URL
language (string): Language code ("en")