🌍 Synapse-LangID
O Synapse-LangID é um modelo leve de identificação automática de idiomas desenvolvido pela Comunidade Synapse BR .
Projetado para oferecer detecção rápida e eficiente de idiomas, o modelo combina uma arquitetura compacta baseada em BERT com bom desempenho multilíngue, sendo adequado para sistemas em produção, APIs, aplicações móveis e dispositivos de borda (edge computing ).
Nosso objetivo é disponibilizar uma solução open source , leve e acessível para identificação de idiomas, mantendo baixo custo computacional e facilidade de integração.
🚀 Destaques
🌍 Suporte para 15 idiomas
⚡ Inferência rápida
🪶 Arquitetura leve (~5 milhões de parâmetros)
📦 Aproximadamente 20 MB
🤗 Compatível com Hugging Face Transformers
🔓 Código aberto
💻 Ideal para produção, APIs e Edge Computing
📖 Visão Geral do Modelo
Propriedade Valor Arquitetura BERT Encoder Parâmetros ~5 milhões Tamanho ~20 MB Vocabulário 16.000 tokens Comprimento máximo 128 tokens Hidden Size 192 Camadas Transformer 6 Cabeças de Atenção 4 Camada Intermediária 512 Framework PyTorch Biblioteca Hugging Face Transformers
🌐 Idiomas Suportados
Código Idioma en Inglês es Espanhol fi Finlandês fr Francês it Italiano ja Japonês ko Coreano nl Holandês pl Polonês pt Português ro Romeno ru Russo sv Sueco tr Turco zh Chinês
Total: 15 idiomas.
📚 Dataset de Treinamento
O modelo foi treinado utilizando o dataset:
Comunidade-Synapse-BR/dataset-multilingue-750k
Características do conjunto de dados:
Aproximadamente 750 mil textos
15 idiomas
Distribuição balanceada
Textos codificados em UTF-8
Dados limpos e sem duplicações
Divisão em treino, validação e teste
Otimizado para identificação de idiomas
🎯 Casos de Uso
O Synapse-LangID pode ser utilizado em:
Identificação automática de idiomas
Pipelines de NLP
Motores de busca
Sistemas de tradução
Limpeza de datasets
Filtragem de documentos
Roteamento por idioma
Pré-processamento de texto
Organização de documentos
Aplicações de Inteligência Artificial
⚡ Instalação
pip install transformers torch
🤗 Exemplo utilizando Pipeline
1 from transformers import pipeline
2
3 classifier = pipeline (
4 "text-classification" ,
5 model = "Comunidade-Synapse-BR/Synapse-LangID"
6 )
7
8 print ( classifier ( "Olá, tudo bem?" ) )
💻 Exemplo em Python
1 import torch
2 from transformers import AutoTokenizer , AutoModelForSequenceClassification
3
4 repo = "Comunidade-Synapse-BR/Synapse-LangID"
5
6 tokenizer = AutoTokenizer . from_pretrained ( repo )
7 model = AutoModelForSequenceClassification . from_pretrained ( repo )
8
9 texto = "Olá, tudo bem?"
10
11 inputs = tokenizer (
12 texto ,
13 return_tensors = "pt" ,
14 truncation = True ,
15 max_length = 128
16 )
17
18 with torch . no_grad ( ) :
19 outputs = model ( ** inputs )
20
21 probabilidades = outputs . logits . softmax ( dim = - 1 )
22
23 classe = model . config . id2label [
24 probabilidades . argmax ( ) . item ( )
25 ]
26
27 print ( classe )
📊 Exemplos de Predição
Texto Idioma Hello world Inglês Olá mundo Português Bonjour Francês Hola amigos Espanhol Ciao a tutti Italiano 今日はいい天気ですね Japonês 안녕하세요 Coreano Привет Russo
📈 Desempenho
O Synapse-LangID apresenta melhor desempenho em:
Frases completas
Parágrafos
Documentação
Notícias
Conversas do cotidiano
O desempenho pode diminuir em casos como:
Textos extremamente curtos
Frases com múltiplos idiomas
Sequências aleatórias de caracteres
Apenas números
Apenas emojis
Uso excessivo de gírias da internet
Novas métricas serão adicionadas em futuras versões.
⚠️ Limitações
Embora apresente bom desempenho em identificação automática de idiomas, nenhum classificador é perfeito.
O modelo pode apresentar dificuldades em situações como:
Mensagens muito curtas
Mistura de idiomas (code-switching )
Conteúdo ambíguo
Textos com pouca informação linguística
Para aplicações críticas, recomenda-se utilizar validação humana como camada adicional de segurança.
📂 Arquivos do Repositório
config.json
model.safetensors
tokenizer.json
tokenizer_config.json
special_tokens_map.json
README.md
📜 Licença
Este modelo é distribuído sob a licença Apache License 2.0 .
Consulte o repositório para mais informações.
📚 Citação
Caso este modelo contribua para sua pesquisa ou projeto, considere citá-lo.
1 @misc{synapse_langid_2026,
2 title={Synapse-LangID},
3 author={Comunidade Synapse BR},
4 year={2026},
5 publisher={Hugging Face}
6 }
🤝 Sobre a Comunidade Synapse BR
A Comunidade Synapse BR é uma iniciativa brasileira dedicada ao desenvolvimento de modelos de inteligência artificial, datasets e ferramentas de código aberto.
Nossa missão é tornar a inteligência artificial mais acessível por meio de tecnologias eficientes, leves e abertas, contribuindo para fortalecer a presença do Brasil no ecossistema global de IA.
Contribuições, sugestões e relatos de problemas são sempre bem-vindos.