Dataset Card for Orpheus Zero Pretraining Corpus
Dataset Details
Dataset Description
This dataset is a pre-tokenized Russian/English text corpus assembled for pretraining Orpheus Zero, a ~278M parameter causal language model trained from scratch. The corpus combines game lore/wiki text, literature, encyclopedic content, and forum data, cleaned and deduplicated, then tokenized with a custom BPE tokenizer.