Views
No views yet
| Metric | Dense (Original) | Sparse (This) | Improvement |
|---|---|---|---|
| Parameters (active) | 44.1M | 22M | 50% reduction |
| Inference (M4 MPS) | 5.1ms | 4.9ms | 4% faster |
| Quality Retention | 100% | 97.3% | Minimal loss |
1from transformers import AutoModel, AutoTokenizer
2import torch
3
4model = AutoModel.from_pretrained("stephenjun8192/chemberta-zinc-sparse50")
5tokenizer = AutoTokenizer.from_pretrained("seyonec/ChemBERTa-zinc-base-v1")
6
7# Encode a drug molecule (Erlotinib — EGFR inhibitor)
8smiles = "COCCOc1cc2ncnc(Nc3cccc(C#C)c3)c2cc1OCCOC"
9inputs = tokenizer(smiles, return_tensors="pt", padding=True, truncation=True)
10
11with torch.no_grad():
12 outputs = model(**inputs)
13 embedding = outputs.last_hidden_state.mean(dim=1) # [1, 768]
14
15print(f"Embedding shape: {embedding.shape}")| Task | Time |
|---|---|
| Single molecule embedding | 4.9ms |
| Batch of 12 molecules | ~45ms |
| Molecular fingerprint + embedding | ~6ms |
| Drug repurposing (full screen) | ~18s |
1@software{pharmacore2026,
2 title={PharmaCore: Apple Silicon-Native AI Drug Discovery},
3 author={Stephen Wu},
4 year={2026},
5 url={https://github.com/reacherwu/PharmaCore}
6}