C3PO Mixed Pretraining Corpus
Mixed pretraining corpus sampled from seven public Hugging Face datasets, filtered by token length (no truncation). Built by the c3po project.
Documents: 25,000
Tokenizer: google/gemma-4-26b-a4b-it
Token window: 1,000 – 32,000
Built: 2026-05-23T12:11:43.084386+00:00
Source
Documents
HF repo
Clean Wikipedia
4,940
DragonLLM/Clean-Wikipedia-English-Articles