Pre-shuffled versions of HuggingFaceFW/fineweb-edu.
Config
Shards
~Rows
Description
sample-100BT
~1800
~96M
100B token sample, shuffled
sample-350BT
~1340
~335M
350B token sample, shuffled, deduplicated against val
val
~18
~4.5M
Validation set (held out from 100BT)
from datasets import load_dataset
Load 100B token training set
ds_100b = load_dataset("SandyResearch/fineweb-edu-shuffled"… See the full description on the dataset page:
https://huggingface.co/datasets/SandyResearch/fineweb-edu-shuffled.