Dataset sintético de labels documentais para artigos da Wikipedia em português brasileiro.
Os registros derivam de costadev00/wikipedia-pt-br-extract. Cada linha representa um artigo e preserva page_id, title, source_dataset e a licença herdada cc-by-sa-3.0.
A pipeline aplica triagem determinística em CPU, remove documentos ruins e usa um modelo Gemma local para gerar categorias, subcategorias, tipo… See the full description on the dataset page:
https://huggingface.co/datasets/costadev00/wikipedia-pt-br-article-labels.