23,000 text samples (1000 each) collected across 8 public HF datasets / 23
subset-configs, merged and shuffled into a single dataset. Built for
continue-pretraining experiments against a diverse mix (general web, math,
QA, code, reasoning) rather than a single source.