π ClassiCC-PT: Classified Common Crawl Corpus for Portuguese
π Overview
ClassiCC-PT (Classified Common Crawl β Portuguese) is a large-scale web corpus containing ~120B Portuguese tokens extracted from Common Crawl snapshots. It is specifically curated for training large language models in Portuguese, with a focus on data quality, language specificity, and targeted filtering.
This corpus was created as part of a study on continued pretraining for adapting⦠See the full description on the dataset page: https://huggingface.co/datasets/Vwegba/Classic.