A large-scale, high-quality English text dataset derived from Project Gutenberg, cleaned, normalized, deduplicated, and segmented into fixed-length samples for efficient language model pretraining.
This dataset is designed to support training small and medium language models such as TinyWay, tokenizer training, embedding models, and large-scale NLP experimentation.
Name: TinyWay-Gutenberg-Clean-40M
Samples: ~40,000,000⦠See the full description on the dataset page:
https://huggingface.co/datasets/NNEngine/Gutenberg-Clean-40M.