Dataset de acordaos do Supremo Tribunal Federal em portugues, preparado para uso em NLP juridico e pre-treinamento continuo.
Esta versao deriva de costadev00/stf-acordaos-cpt-2048, mas publica documentos reconstruidos em vez de chunks. O objetivo e oferecer uma fonte sem chunk_index/chunk_total, para que o usuario possa aplicar o proprio chunking conforme o contexto do modelo ou do pipeline.
Fonte publica:… See the full description on the dataset page:
https://huggingface.co/datasets/costadev00/stf-acordaos.