A arquitetura que consolidou o experimento. The architecture that validated the whole experiment.
Sobre este modelo
Theo-25M-Base representa o salto de geração — de 7,4M para 27,3M de parâmetros reais. Com o dobro de camadas (6 vs 4), dimensão interna duplicada (d_model=512) e FFN quatro vezes maior que o 10M, este modelo é onde a coerência de longo prazo começa a aparecer de verdade.
Parágrafos mais longos, gramática mais sólida, menos repetições involuntárias. O Theo-25M foi a configuração principal durante boa parte do desenvolvimento — robusta o suficiente para mostrar capacidade real, leve o suficiente para treinar rapidamente.
Nenhum peso pré-treinado. Treinado do zero em ~400M tokens (corpus bíblico v1) de texto cristão em português.
O gap entre Theo-10M e Theo-25M é um dos mais significativos da série. Ele demonstra empiricamente as scaling laws: quase o quadruplo de parâmetros produz uma melhoria qualitativa desproporcional em coerência, vocabulário ativo e controle gramatical.
Este é um ótimo ponto de partida para fine-tuning em subdomínios teológicos específicos — exegese, devocionais, catequese, aconselhamento pastoral — onde você quer um modelo leve mas que já entenda o domínio profundamente.