Views
No views yet
sam_encoder.pth: SAM ViT-B encoder (95,569,152 params, 364.6 MB)clip_encoder.pth: CLIP-Large encoder (303,177,728 params, 1156.6 MB)projector.pth: Linear projector (2,622,720 params, 10.0 MB)config.json: Model configurationImage (1024×1024) → SAM (95M) → 16× Conv → CLIP (303M) → Projector (3M) → 256 vision tokens1import torch
2from deepencoder import build_sam_vit_b, build_clip_l, MlpProjector
3from easydict import EasyDict as adict
4
5# Load models
6sam = build_sam_vit_b(checkpoint=None)
7sam.load_state_dict(torch.load('sam_encoder.pth'))
8
9clip = build_clip_l()
10clip.load_state_dict(torch.load('clip_encoder.pth'))
11
12projector_cfg = adict({'projector_type': 'linear', 'input_dim': 2048, 'n_embed': 1280})
13projector = MlpProjector(projector_cfg)
14projector.load_state_dict(torch.load('projector.pth'))
15
16# Run encoder
17vision_tokens = encode(image) # [1, 256, 1280]