Marin/Levanter Subsampled Pretokenized Dataset
Dataset
gs://marin-us-central2/raw/fineweb-edu-c2beb4/3c452cb/huggingface.co/datasets/HuggingFaceFW/fineweb-edu/resolve/3c452cb
Original cache: gs://marin-us-central2/tokenized/fineweb-edu-24698d
Tokenizer: stanford-crfm/marin-tokenizer
Seed 42
Number of tokens: 10,000,680