ItaMix (
https://arxiv.org/abs/2512.18834) is an Italian pretraining corpus built by combining five publicly available Italian datasets, applying Italian-specific quality filtering, and performing cross-dataset deduplication.
The matched subset uses cross-dataset agreement as a signal for quality.