A comprehensive multilingual text moderation dataset combining multiple high-quality sources for training robust content moderation classifiers.
This dataset aggregates text moderation data from multiple sources to create a large-scale, diverse training corpus for content moderation systems. It includes text samples labeled across multiple harmful content categories, supporting both multilingual and English-specific moderation… See the full description on the dataset page:
https://huggingface.co/datasets/enguard/multi-lingual-prompt-moderation.