Views
No views yet
is_lai = 1)
ou se deveria ser reclassificado para outro tipo de manifestação (is_lai = 0).0.1.0.neuralmind/bert-large-portuguese-cased (BERTimbau Large,
arquitetura BERT-large, 24 camadas, cerca de 330 milhões de parâmetros, português cased),
com uma cabeça de classificação de 2 rótulos inicializada do zero (BertForSequenceClassification).Trainer do transformers).CrossEntropyLoss ponderada por classe. Os pesos são inversos à
frequência e calculados somente no conjunto de treino: nao_lai = 3.4269,
lai = 0.5854.2e-5, schedule linear (padrão do Trainer), sem
warmup explícito; weight_decay = 0.01.world_size = 1,
gradient_accumulation_steps = 1), portanto o batch efetivo foi 64 x 8 = 512
(78 passos por época, ceil(39677 / 512)).load_best_model_at_end=True, metric_for_best_model="mcc"); no modelo publicado foi
a época 9 (passo 702, MCC de validação 0.6887). Precisão mista bf16. Semente fixa 271828.resumo_titulo (ResumoSolicitacao) e texto_pedido
(Teor.DescricaoAtosOuFatos), nessa ordem, separados por espaço. São os campos
escritos pelo cidadão e que sobrevivem à reclassificação, portanto não vazam o
rótulo. Tokenizado com o tokenizer do BERTimbau e truncado em 510 tokens. Os campos
leak_* (Assunto, SubAssunto, TipoSugeridoFalaBrIA) são deliberadamente
excluídos por vazarem o rótulo.1@misc{jacob2026ispedidolai,
2 author = {Jacob, Elias},
3 title = {is-pedido-lai-classifier: classificador binario de pedidos de
4 acesso a informacao (LAI) no Fala.BR},
5 year = {2026},
6 howpublished = {Hugging Face Hub},
7}
8
9@inproceedings{souza2020bertimbau,
10 author = {Souza, Fabio and Nogueira, Rodrigo and Lotufo, Roberto},
11 title = {{BERTimbau}: Pretrained {BERT} Models for {Brazilian} {Portuguese}},
12 booktitle = {Intelligent Systems (BRACIS)},
13 year = {2020},
14}neuralmind/bert-large-portuguese-cased
antes de redistribuir.is_lai = 0) e deveriam ser reclassificadas (tipicamente para
Solicitação, Reclamação, Denúncia, etc.). É um classificador binário sobre o texto
original do cidadão.tipo_chegada == "Acesso a Informacao". Fora dele o comportamento é
indefinido.is_lai = 0 (Solicitação, Reclamação, Denúncia, Sugestão, Elogio); domínio temático
(saúde / SUS, já que os dados vêm da Ouvidoria do SUS); idioma (português brasileiro);
órgão/unidade de destino (não registrado de forma estruturada no dataset).nao_lai vs lai)
no conjunto de teste retido. Não houve avaliação desagregada por destino da
reclassificação, por faixa de comprimento de texto nem por órgão; essa limitação está
registrada na Seção 9.nao_lai = 0, a
classe operacionalmente relevante), além de acurácia balanceada e acurácia global. A
seleção da arquitetura (BERTimbau Large vs Base e vs modelos clássicos com TF-IDF) usou MCC
médio em validação cruzada estratificada de 10 folds.argmax do softmax (limiar implícito de 0.5). Não houve
calibração de probabilidades nem ajuste de limiar no modelo final. A melhor época foi
escolhida por MCC na fatia de validação.dataset_lai.parquet, separada
por amostragem estratificada por is_lai com semente 271828, e avaliada uma única vez.
Tamanho: 4.899 exemplos (proporção is_lai = 1 de 0.8541, ou seja 4.184 lai e 715
nao_lai). O teste permaneceu intocado durante todo o treino e a seleção de época.resumo_titulo +
texto_pedido, tokenização BERTimbau, truncamento em 510 tokens).dataset_lai.parquet, totalizando 44.086
exemplos, dos quais 4.409 foram separados como fatia de validação (seleção da melhor
época) e 39.677 usados de fato no treino. O dataset completo tem 48.985 linhas (após
remoção de duplicatas por texto_pedido; eram 50.373 manifestações que chegaram como LAI).Historico de cada manifestação: o tipo de chegada
é reconstruído pela gramática de reclassificação (o campo do snapshot é sobrescrito na
reclassificação); o universo é tipo_chegada == LAI; is_lai = 1 se o tipo final
permanece LAI, senão is_lai = 0.resumo_titulo e texto_pedido (texto do cidadão, não reescrito).texto_pedido.is_lai = 1 (LAI genuíno) com 41.904 exemplos (85.4%) e is_lai = 0 (reclassificado para
fora) com 7.155 exemplos (14.6%). Entre os is_lai = 0, os destinos de reclassificação
mais comuns são Solicitação, Reclamação e Denúncia (com Sugestão e Elogio raros). O texto
do cidadão tem mediana de cerca de 68 palavras na classe lai e 52 palavras na classe
nao_lai.| Fator | Valor | Métrica | IC 95% |
|---|---|---|---|
Classe nao_lai (0) | 0.67 | precisão | não calculado |
Classe nao_lai (0) | 0.80 | recall | não calculado |
Classe nao_lai (0) | 0.73 | F1 (suporte 715) | não calculado |
Classe lai (1) | 0.96 | precisão | não calculado |
Classe lai (1) | 0.93 | recall | não calculado |
Classe lai (1) | 0.95 | F1 (suporte 4184) | não calculado |
| Global | 0.6825 | MCC | não calculado |
| Global | 0.8655 | acurácia balanceada | não calculado |
| Global | 0.9139 | acurácia | não calculado |
| Fatores | Valores | Métrica | IC 95% |
|---|---|---|---|
| Não aplicável | Não avaliado | Não avaliado | Não avaliado |
nao_lai) pode
levar a tratar como não-LAI um pedido que tem direito ao rito da Lei de Acesso à
Informação, prejudicando o cidadão; um falso positivo (manifestação mantida como LAI
indevidamente) pode aplicar prazos/ritos errados. Com recall de 0.80 na classe nao_lai,
cerca de 20% das reclassificações verdadeiras passam despercebidas pelo modelo. Viés de
domínio (apenas saúde/SUS) e por órgão/região não foi avaliado.nao_lai recuperados pelo canal de recurso. Alguns destinos são raros
(por exemplo, Elogio), de modo que o desempenho nesses subcasos é incerto.