⚠️ Aviso de uso: este checkpoint pode produzir informações incorretas, respostas incompletas e alucinações. Não utilize suas saídas para decisões médicas, jurídicas, financeiras, de segurança ou de alto impacto sem revisão humana qualificada.
Resumo visual do WARMIND-200M V2
English summary
WARMIND-200M V2 is an experimental, Portuguese-first causal language model developed by WAR Enterprise for compact-model research and local inference.
203,263,872 parameters
1,000,013,824 pretraining tokens
23,751,277 supervised SFT tokens
20 layers, hidden size 896
14 attention heads and 2 KV heads
Grouped-Query Attention, SwiGLU, RMSNorm and RoPE
24,576-token SentencePiece vocabulary
1,024-token operational context
local CPU inference; CUDA is supported by the example script
Apache 2.0 license
This is a research checkpoint, not a production assistant. It can hallucinate, fail on simple reasoning tasks and produce incomplete or incorrect answers.
O WARMIND-200M V2 é um modelo de linguagem causal compacto desenvolvido pela WAR Enterprise para pesquisa em geração de texto em português e inferência local.
A versão publicada é um artefato de pesquisa, não um assistente de produção. Seu objetivo principal foi validar uma cadeia completa de desenvolvimento: preparação de dados, tokenização, pré-treinamento, ajuste supervisionado, empacotamento, verificação de integridade e execução local.
Em um minuto
Item
Valor
Parâmetros
203.263.872
Tokens de pré-treinamento
1.000.013.824
Tokens processados no SFT
23.751.277
Camadas
20
Dimensão do modelo
896
Cabeças de atenção / KV
14 / 2
Vocabulário
24.576 tokens SentencePiece
Contexto operacional
1.024 tokens
Pesos publicados
safetensors FP32
Idioma principal
Português
Execução
CPU local; CUDA aceita pelo script de exemplo
Demonstração real — incluindo limitações
O vídeo abaixo mostra o comportamento real do checkpoint, sem esconder respostas fracas ou incorretas. Isso faz parte da avaliação técnica desta versão.
1.\.venv\Scripts\Activate.ps1
23python generate_local.py `
4--prompt "Defina fotossíntese em uma frase." `
5--max-new-tokens 96
Linux ou macOS
bash
1source .venv/bin/activate
23python generate_local.py \4 --prompt "Defina fotossíntese em uma frase."\5 --max-new-tokens 96
Geração mais controlada
bash
1python generate_local.py \2 --prompt "Explique em duas frases o que é inteligência artificial."\3 --temperature 0.2\4 --top-k 20\5 --top-p 0.9\6 --repetition-penalty 1.12\7 --max-new-tokens 160
Confirme no generate_local.py se o argumento publicado é --max-new-tokens ou --maximum-new-tokens e mantenha apenas a forma aceita pelo script.
Arquitetura
Componente
Valor
Tipo
Transformer decoder causal
Camadas
20
Dimensão do modelo
896
Cabeças de atenção
14
Cabeças KV
2
Atenção
Grouped-Query Attention (GQA)
Dimensão da FFN
2.688
Ativação
SwiGLU
Normalização
RMSNorm
Posicionamento
RoPE, θ = 10.000
Contexto treinado/operacional
1.024 tokens
Contexto estendido aceito pelo código
até 2.048 tokens, sem homologação como contexto de treino
Treinamento
O checkpoint foi treinado em uma NVIDIA H100 80 GB HBM3, utilizando BF16. A execução principal do pré-treinamento levou aproximadamente 2 horas e 30 minutos; preparação dos dados, treinamento do tokenizer, SFT, empacotamento e testes locais foram realizados separadamente.
Etapa
Registro
Pré-treinamento V2
1.000.013.824 tokens
Ajuste supervisionado
encerrado no passo 1.200
Val loss no passo 100
2,1085
Val loss no passo 1.200
1,8038
Os números acima descrevem o treinamento registrado, mas não devem ser interpretados isoladamente como prova de qualidade geral.
Dados e proveniência
Pré-treinamento
Foi utilizada uma amostra em português de epfml/FineWeb2-HQ (por_Latn), sob ODC-By-1.0 e sujeita também aos termos do Common Crawl.
Composição aproximada da preparação:
93,6% conteúdo geral;
5,0% conteúdo jurídico;
1,4% conteúdo técnico.
Ajuste supervisionado
O SFT combinou:
conversas em português de HuggingFaceTB/smoltalk2;
dados filtrados de OpenAssistant/oasst2;
exemplos próprios da WAR Enterprise.
As atribuições e os subconjuntos utilizados devem permanecer documentados em NOTICE.md.
Os dados podem conter erros, distorções, conteúdo sintético ou informações pessoais presentes nas fontes originais. O treinamento não transforma o modelo em uma fonte factual confiável.
Bate-papo local experimental
chat_calibrate.py acrescenta:
memória curta;
busca em arquivos locais;
calculadora determinística;
consulta opcional à Wikipédia e ao Wikidata.
python chat_calibrate.py
Esse orquestrador não altera os pesos e não representa acesso ao “pensamento interno” do Transformer.
Quando a consulta online está ativada, o texto da pergunta pode ser enviado às APIs públicas correspondentes. Use:
A V2 mostrou evolução em relação ao primeiro checkpoint, mas ainda apresentou:
alucinações de fatos, nomes, números e identidades;
repetição e deriva de assunto;
falhas em seguir limites de extensão;
respostas plausíveis, porém incorretas;
sensibilidade aos parâmetros de amostragem;
limitações em contas simples e raciocínio.
Por isso, esta publicação deve ser tratada como uma prévia técnica para pesquisa, aprendizado e reprodução local, não como benchmark de estado da arte.
Usos pretendidos
pesquisa com modelos compactos em português;
estudo de inferência local em CPU;
experimentos de geração com revisão humana;
prototipagem educacional;
comparação de técnicas de pós-processamento;
estudo de integração com ferramentas externas.
Usos não recomendados
decisões automatizadas ou de alto impacto;
aconselhamento médico, jurídico ou financeiro;
conteúdo factual sem verificação externa;
moderação, vigilância ou classificação de pessoas;
aplicações que exijam segurança, precisão ou disponibilidade garantidas.