Subprojeto de Pós-Doutorado Júnior — PDJ/Fiocruz · Instituto Aggeu Magalhães — Fiocruz Pernambuco
Visão geral
Eventos de transbordamento zoonótico (spillover) estão entre as maiores ameaças à saúde pública
global. O volume de genomas virais cresce rapidamente (vigilância genômica, metagenômica ambiental,
estudos de viroma), mas a maioria dos vírus recém-identificados não possui rótulos confiáveis de
risco zoonótico, o que limita métodos supervisionados tradicionais.
Este projeto desenvolve uma abordagem auto-supervisionada baseada em redes JEPA para aprender
representações latentes de genomas virais, hospedeiros e contextos ecológicos, com o objetivo de
priorizar vírus com maior potencial de spillover antes da ocorrência de surtos.
Em vez de reconstruir nucleotídeos ou depender exclusivamente de rótulos escassos, a JEPA aprende a
prever embeddings de regiões genômicas (e de hospedeiros compatíveis) em um espaço latente
compartilhado — capturando relações funcionais e estruturais úteis para inferir risco zoonótico.
Por que JEPA?
Abordagem
Limitação no contexto de spillover
Supervisionada (rótulos zoonótico/não)
Rótulos escassos, incompletos e enviesados; "não zoonótico" pode significar apenas "não estudado".
Generativa / reconstrução (ex.: autoencoders, MLM nucleotídeo a nucleotídeo)
Gasta capacidade modelando ruído de baixo nível em vez de semântica funcional.
JEPA (predição em espaço latente)
Aprende relações latentes entre partes dos dados sem reconstrução literal e com baixa dependência de rótulos — ideal para vírus pouco caracterizados.
Objetivos
Geral: desenvolver uma abordagem JEPA para aprender representações latentes de genomas virais,
hospedeiros e contextos ecológicos, apoiando a predição e priorização de vírus com potencial de spillover.
Específicos (resumo): coletar e curar genomas virais públicos; integrar metadados de hospedeiros,
taxonomia e ecologia; construir representações (k-mers, embeddings Transformer); implementar a JEPA
genômica e sua extensão vírus-hospedeiro/multimodal; avaliar embeddings (UMAP/t-SNE, clustering,
vizinhança latente); fazer fine-tuning supervisionado para risco de spillover; comparar com
baselines (k-mers, LSTM, Transformer supervisionado); aplicar interpretabilidade e ablação; e
disponibilizar tudo em repositório público reprodutível.
Arquitetura do pipeline
mermaid
1flowchart LR
2 A[Bases públicas<br/>NCBI Virus · VirusHostDB<br/>VirHostNet · GBIF/WAHIS]--> B[Coleta<br/>scripts/download_*]3 B --> C[Curadoria<br/>dedup · QC · taxonomia]4 C --> D[Representações<br/>k-mers · embeddings]5 D --> E[JEPA genômica<br/>contexto → alvo latente]6 E --> F[Extensão<br/>vírus-hospedeiro / multimodal]7 F --> G[Fine-tuning<br/>risco de spillover]8 G --> H[Avaliação · baselines<br/>UMAP/t-SNE · SHAP]9 H --> I[Ranking de vírus<br/>prioritários]10 I --> J[Dashboard · relatório<br/>GitHub · Hugging Face]
Código, modelos e documentação publicados em GitHub e Hugging Face Hub, respeitando
normas institucionais de sigilo e propriedade intelectual.
Aviso
Ferramenta de apoio à priorização para vigilância, em estágio de prova de conceito. Não
substitui investigação laboratorial nem decisões de saúde pública. Resultados in silico exigem
validação experimental.
Como citar
bibtex
1@software{camara_jepa_spillover_2026,
2 author = {Câmara, Gabriel Bezerra Motta},
3 title = {JEPA-Spillover: aprendizado preditivo em espaço latente para
4 vigilância genômica de vírus com potencial zoonótico},
5 year = {2026},
6 note = {Instituto Aggeu Magalhães — Fiocruz Pernambuco},
7 url = {https://github.com/gbmotta/jepa-spillover}
8}
Licença
Código sob licença MIT. Dados de terceiros mantêm as licenças e termos de uso de suas
fontes originais.
Instituto Aggeu Magalhães · Fiocruz Pernambuco · PDJ/Fiocruz · 2026