Modelo de classificação de texto que detecta clickbait em manchetes de notícias em português brasileiro. Desenvolvido com Random Forest otimizado, alcança 97.2% de F1-Score e 98.3% de precisão.
Este modelo classifica manchetes de notícias em português brasileiro como Clickbait ou Não-Clickbait. Foi treinado usando Random Forest otimizado via RandomizedSearchCV com 50 iterações de busca, testando 9 diferentes arquiteturas de modelos.
Detalhes do Modelo
Uso Pretendido
Casos de Uso Recomendados
✅ Detectar manchetes clickbait em portais de notícias brasileiros
✅ Filtrar conteúdo sensacionalista em agregadores de notícias
✅ Análise de qualidade jornalística
✅ Pesquisa acadêmica em detecção de clickbait
Usuários-Alvo
Desenvolvedores de agregadores de notícias
Jornalistas e editores
Pesquisadores em NLP e jornalismo
Plataformas de fact-checking
Casos de Uso Fora do Escopo
❌ Outros idiomas: Modelo treinado apenas em português brasileiro
❌ Outros domínios: Não testado em e-commerce, redes sociais, marketing
❌ Textos longos: Otimizado para manchetes (5-20 palavras)
❌ Classificação multiclasse: Apenas binário (clickbait/não-clickbait)
❌ Decisões automatizadas sem supervisão humana: Recomenda-se validação manual
Dados de Treinamento
Visão Geral do Dataset
Total de exemplos: 9.532 manchetes únicas
Fonte: Portais de notícias brasileiros diversos
Processo de limpeza:
10.565 manchetes iniciais coletadas
634 duplicatas removidas (6.0%)
Distribuição de Classes
Classe
Quantidade
Percentual
Não-Clickbait
4.457
46.8%
Clickbait
5.075
53.2%
Divisão Treino/Teste
Treino: 7.625 exemplos (80%)
Teste: 1.907 exemplos (20%)
Estratégia: Stratified split (random_state=42)
Validação: 5-fold Stratified Cross-Validation
Coleta de Dados
Manchetes coletadas de múltiplos portais brasileiros para garantir diversidade:
"Banco Central mantém a taxa Selic em 13,75% ao ano"
"Governo aprova reforma tributária no Congresso"
"Estudo da USP revela novos dados sobre mudanças climáticas"
Clickbait:
"O pesadelo dos investidores: a decisão do Banco Central que vai destruir seus lucros!"
"Descubra o segredo para emagrecer 10kg em 7 dias!!!"
"Este truque simples vai MUDAR sua vida para sempre"
Análise Exploratória de Dados
Distribuição e Padrões dos Dados
Análise Exploratória Completa
A análise exploratória revela padrões interessantes:
📊 Principais Insights
Distribuição Balanceada: Dataset equilibrado (~50/50) minimiza viés de classe
Comprimento dos Textos:
Não-Clickbait: média de ~12 palavras
Clickbait: média de ~15 palavras (mais descritivo/sensacionalista)
Densidade de Palavras: Clickbait apresenta maior variabilidade no vocabulário
Top 20 Palavras Relevantes: Padrões linguísticos distintos entre classes
Características Textuais
Métrica
Não-Clickbait
Clickbait
Palavras/manchete (média)
12.3
15.7
Stopwords (%)
35%
30%
Palavras únicas
~2.800
~3.200
Visualização das Palavras Mais Frequentes
Nuvem de Palavras - Comparação Clickbait vs Não-Clickbait
Comparação visual das palavras mais relevantes (sem stopwords) em manchetes clickbait e não-clickbait. Observe os padrões linguísticos distintos: manchetes clickbait usam mais verbos de ação e palavras de impacto emocional.
Avaliação
Dados de Teste
Dataset de teste: 1.907 manchetes (20% do total)
Estratificação: Mantém distribuição ~50/50 das classes
Sem overlap: Nenhum exemplo do treino aparece no teste
Métricas de Performance
Performance Geral (Test Set)
Métrica
Valor
Accuracy
97.1%
Precision
98.3%
Recall
96.2%
F1-Score
97.2%
Matriz de Confusão
Predicted
Non-CB Clickbait
Actual Non-CB 875 17
Clickbait 39 976
Validação Cruzada
Estratégia: 5-fold Stratified CV
F1-Score (CV): 97.0% ± 0.3%
Consistência: Alta estabilidade entre folds
Comparação de Modelos
Durante o desenvolvimento, foram treinados e comparados 9 modelos diferentes:
Ranking
Modelo
Acurácia
F1-Score
🥇
RF Otimizado 🏆
0.970635
0.972112
🥈
Random Forest
0.970110
0.971543
🥉
Stacking
0.968013
0.969757
4º
SVM
0.966964
0.968453
5º
Voting (Soft)
0.966439
0.967936
6º
Voting (Hard)
0.965915
0.967287
7º
Regressão Logística
0.959622
0.961131
8º
Naive Bayes
0.907708
0.915870
9º
Baseline
0.467750
0.000000
🏆 = Modelo final publicado
Por que Random Forest Otimizado?
✅ Vantagens:
Performance Superior: 97.2% F1-Score (melhor entre 9 modelos)
Alta Precisão: 98.3% - minimiza falsos positivos
Bom Recall: 96.2% - captura maioria dos clickbaits
Robusto: Ensemble de 100-500 árvores (reduz overfitting)
Feature Importance: Identifica features mais relevantes
✅ Testar em seu domínio específico antes de deploy
Para Usuários
⚠️ Não confiar 100% nas predições
⚠️ Validar casos de alta incerteza (prob ~50%)
⚠️ Considerar contexto da fonte
⚠️ Reportar erros sistemáticos para melhoria contínua
Exemplo de Uso Responsável
python
1# ✅ BOM: Mostrar probabilidades e permitir revisão2resultado = prever(texto)3if resultado['probabilidades']['clickbait']>0.7:4print("⚠️ Alta confiança: Provável Clickbait")5print(f"Confiança: {resultado['confianca']:.2%}")6elif resultado['probabilidades']['clickbait']>0.5:7print("⚡ Média confiança: Revisar manualmente")8print(f"Confiança: {resultado['confianca']:.2%}")9else:10print("✅ Baixa probabilidade de Clickbait")1112# ❌ RUIM: Decisão binária automática sem contexto13if modelo.predict(texto)==1:14 deletar_manchete()# Perigoso! Pode censurar conteúdo legítimo
Limitações e Recomendações
⚠️ Limitações Conhecidas
Limitações Técnicas
Não detecta sarcasmo/ironia
Manchetes irônicas podem ser classificadas incorretamente
Sensível a mudanças linguísticas
Novo vocabulário/gírias podem reduzir performance
Contexto limitado
Não considera: fonte, autor, histórico do portal
Textos curtos apenas
Otimizado para manchetes (5-20 palavras)
Não funciona bem com textos longos (tende a classificar como clickbait)
Limitações Sociais
Definição de clickbait é subjetiva
O que é "sensacionalista" varia por contexto
Pode impactar liberdade editorial
Uso indiscriminado pode censurar títulos legítimos
Não substitui julgamento humano
Sempre requer validação por editores
Problemas Conhecidos
Falsos Positivos: Títulos legítimos com linguagem emocional
Falsos Negativos: Clickbaits sutis sem sinais óbvios
Drift Temporal: Performance pode degradar com o tempo
Manutenção Recomendada
🔄 Retreinamento: Recomendado a cada 6 meses
📊 Monitoramento: Acompanhar métricas em produção
🐛 Feedback Loop: Coletar erros para próxima versão
Melhorias Futuras
Aumentar dataset (→10k+ exemplos)
Testar modelos Transformer (BERTimbau, mBERT)
Adicionar features contextuais (fonte, timestamp, autor)
Expandir para outros idiomas (espanhol, inglês)
Fine-tuning com dados mais recentes
Deploy em produção com monitoramento de drift
A/B testing de modelos em produção
Citação
BibTeX
bibtex
1@misc{detector-clickbait-br-model,
2 author = {Rodrigo de Araujo Rosa},
3 title = {Detector de Clickbait BR: Datasets utilizados no treinamento do Modelo de ML para Detecção de Clickbait em Português},
4 year = {2025},
5 publisher = {Hugging Face},
6 journal = {Hugging Face Model Hub},
7 howpublished = {\url{https://huggingface.co/rodrigoaraujorosa/detector-clickbait-br-model}}
8}
APA
ROSA, Rodrigo de Araujo. (2025). Modelo de ML para Detecção de Clickbait em Português. Hugging Face Model Hub. https://huggingface.co/rodrigoaraujorosa/detector-clickbait-br-model