📚 GigaVerbo Clean — Portuguese Text Cleaning & Dedup Pipeline
Author: Tiago Loeblein
Version: v76
Status: Active — production-grade cleaning pipeline for large-scale PT datasets
License: Same as the source datasets (inherited)
🧠 Overview
GigaVerbo Clean é um dataset processado a partir do TucanoBR/GigaVerbo, contendo bilhões de tokens em português.
Este repositório não é o dataset original, mas sim uma contribuição independente oferecendo:
pipeline robusto de limpeza,
deduplicação exata via… See the full description on the dataset page:
https://huggingface.co/datasets/tiagoloeblein/GodVerb.