MixtureVitae is a 422B-token open pretraining dataset introduced in the paperMixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources.
The dataset is designed to answer a key question:
Can we train competitive large language models using only permissive-licensed and low-risk data, without resorting to unrestricted web scrapes?