Este modelo é uma versão fine-tuned do
BERTweetBR para detecção binária de linguagem tóxica em português brasileiro. O modelo foi treinado no corpus ToLD-Br (Toxic Language Dataset for Brazilian Portuguese) e é capaz de classificar textos em duas categorias:
Ódio e
Não-Ódio.
O corpus é significativamente maior que outros datasets brasileiros de discurso de ódio, proporcionando uma base robusta para o treinamento.