Curated pretraining dataset — 9,735,064 rows across 74 shards.
Built by Phase 0 · Bison Dataset Curator v2.
from datasets import load_dataset
ds = load_dataset("CyanMonkey/BetterDataset-v3", split="train", streaming=True)
for row in ds:
print(row["text"][:100])
break
Column
Type
Description
text
string
Document text
source
string
Source alias (e.g. fineweb_edu)
curriculum_phase
int8… See the full description on the dataset page:
https://huggingface.co/datasets/CyanMonkey/BetterDataset-v3.