MiniWebText-4 is a high-quality, multilingual text dataset designed for training small to medium-sized language models. It is a carefully curated, smaller version of the full WebText-4, optimized for efficiency without sacrificing linguistic richness or semantic diversity.
Dataset Name: MiniWebText-4
Type: Text corpus for language model pre-training and fine-tuning
Lines: 382,468 text lines
Tokens: Approximately 391 million tokens, with… See the full description on the dataset page:
https://huggingface.co/datasets/Raziel1234/MiniWebText-4.