Tokens (uint16) do corpus 100% português usado no gate de corpus do projeto
Bee: um LLM de 151M parâmetros pré-treinado
do zero em português.
Cada pasta tem train.bin e val.bin (numpy.uint16, token 0 = <|endoftext|> separando… See the full description on the dataset page:
https://huggingface.co/datasets/BrCamp/bee-gate-pt.