Beta
Explore
Marketplace
Neural Labs
Playground
Wallet
Docs
corpus-ptbr-v1 – Dataset by strak2005 | AlphaNeural AI
You can deploy this model and start earning money today!
strak2005
/
corpus-ptbr-v1
like
0
text-generation
fill-mask
text-classification
feature-extraction
sentence-similarity
machine-generated
machine-generated
found
monolingual
allenai/c4
HuggingFaceFW/fineweb-2
pt
odc-by
1M<n<10M
parquet
tabular
text
datasets
dask
polars
Views
No views yet
Model card
Files and Versions
Community
API
🇧🇷 Corpus PT-BR v1
Um corpus em Português Brasileiro voltado para pré-treinamento e fine-tuning de LLMs. Combina dados reais curados com uma camada sintética construída para ampliar a diversidade estilística, lexical e discursiva em português.
🔄 Visão Geral do Pipeline 📊 Estatísticas
Métrica Valor
Total de documentos 8,399,857
Total de palavras ~4.84B
Tokens estimados ~6.29B
Tamanho (Parquet) ~17.9 GB
Idioma Português Brasileiro… See the full description on the dataset page:
https://huggingface.co/datasets/strak2005/corpus-ptbr-v1
.