A curated multilingual dataset of Wikipedia articles spanning 40 languages with 812,000 articles total. Designed for multilingual NLP research, language modeling, and cross-lingual transfer learning.
This dataset contains Wikipedia articles from 40 languages, sampled and split into train/validation/test sets with a consistent 10:3:1 ratio per language. English and Turkish are overrepresented (10x more samples) to support… See the full description on the dataset page:
https://huggingface.co/datasets/alibayram/wikipedia-40-langs.