This repository contains k-means cluster subsets for training. Each subset is a config (name=cluster_X), backed by Parquet.
from datasets import load_dataset
Single cluster
ds0 = load_dataset("{username}/no_gemma_6_clusters", name="cluster_0")
Specific cluster
ds3 = load_dataset("{username}/no_gemma_6_clusters", name="cluster_3")
Or with data_files directly (optional alternative):