High-quality, deduplicated text corpus for Serbian, Bosnian, and Croatian
RSA Team • GitHub • Website
Overview
This dataset provides a carefully curated and cleaned text corpus for South Slavic languages, specifically designed to address quality issues found in existing corpora like OSCAR and CC100. It serves as a foundation for training language models, tokenizers, and conducting linguistic research on Balkan languages.
Why This… See the full description on the dataset page: https://huggingface.co/datasets/rsateam/sr-bs-hr-clean-text.