Views
No views yet
1import torch
2from sae.sae_topk import TopKSAE
3
4# Device
5device = torch.device('cuda' if torch.cuda.is_available() else 'cpu')
6
7# Load the model from Hugging Face
8sae = TopKSAE.from_pretrained('patrikwolf/clip-topk-sae')
9
10# Example: random input vector
11input_dim = sae.input_dim
12clip_embedding = torch.randn(1, input_dim).to(device)
13
14# Forward pass
15with torch.no_grad():
16 output = sae(clip_embedding)
17
18# Access outputs
19reconstruction = output["reconstruction"] # Reconstructed embedding
20activations = output["activated"] # Sparse latent activations
21pre_activations = output["pre_activation"] # Pre-activation values
22active_mask = output["active_mask"] # Binary mask of active neurons
23ghost_loss = output["ghost_loss"] # Auxiliary loss termsae_topk.py on GitHub for model details.Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models
Jonas Hübotter, Patrik Wolf, Alexander Shevchenko, Dennis Jüni, Andreas Krause, Gil Kur
1@misc{hübotter2025specializationgeneralizationunderstandingtesttime,
2 title={Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models},
3 author={Jonas Hübotter and Patrik Wolf and Alexander Shevchenko and Dennis Jüni and Andreas Krause and Gil Kur},
4 year={2025},
5 eprint={2509.24510},
6 archivePrefix={arXiv},
7 primaryClass={cs.LG},
8 url={https://arxiv.org/abs/2509.24510},
9}