Views
No views yet
pfam_setnet): a Set Transformer encoder over frozen ESM-2 gene embeddings, relative gene positions, padding masks, and a BGC-level Pfam inventory embedding.weighted_pfam_jaccard): learned non-negative Pfam-domain weights used in a weighted set-Jaccard retrieval baseline.1checkpoints/
2 setnet/seed-20260810..20260814/
3 model.safetensors # verified model_state checkpoint
4 config.json
5 pfam_vocab.json
6 phase2_history.json
7 weighted_pfam/seed-20260810..20260814/
8 model.safetensors
9 config.json
10 pfam_vocab.json
11 phase2_history.json
12evaluation/ # per-seed metadata, summaries, group/query outputs, alpha searches
13results/dgx_final/ # aggregate manuscript result tables
14source/ # source snapshot used for training/evaluation/provenance
15provenance/checkpoint_manifest.json| Method | Recall@50 | MRR | MAP | nDCG@50 |
|---|---|---|---|---|
| Raw ESM mean | 0.7946 | 0.2550 | 0.7251 | 0.8078 |
| BGC-SetNet + Pfam | 0.8472 | 0.2786 | 0.7771 | 0.8502 |
| Pfam Jaccard | 0.8788 | 0.3071 | 0.8480 | 0.9042 |
| ESM + BGC-SetNet + Pfam | 0.8769 | 0.3096 | 0.8503 | 0.9058 |
| Weighted Pfam Jaccard | 0.8789 | 0.3069 | 0.8477 | 0.9040 |
model.safetensors files. The split file hash used by the final run is:dc26fae17e54fd2ad41a9e10353b3da3e0aacf3144b64f6ee62e8341b4360555provenance/checkpoint_manifest.json for per-seed original checkpoint hashes, safetensors hashes, parameter counts, selected validation ensemble alpha, model config hashes, and split hashes.1import json
2import torch
3from safetensors.torch import load_file
4
5from source.src.bgc_retrieval.model import ModelConfig, build_model
6
7seed_dir = "checkpoints/setnet/seed-20260810"
8config = json.load(open(f"{seed_dir}/config.json"))["model"]
9model = build_model(ModelConfig.from_dict(config))
10state = load_file(f"{seed_dir}/model.safetensors")
11model.load_state_dict(state)
12model.eval()pfam_setnet, inference expects:gene_embeddings: [batch, genes, 1280] frozen ESM-2 gene embeddingsrelative_positions: [batch, genes] normalized gene positionspadding_mask: [batch, genes] boolean padding maskpfam_tokens: [batch, domains] Pfam IDs encoded with pfam_vocab.json (0 = padding, 1 = unknown)weighted_pfam_jaccard, inference expects only pfam_tokens and returns learned domain weights; pairwise retrieval scores are computed with the model's pairwise_jaccard method.