Views
No views yet


| Model | Params (Inference) | Vision | Text | Patch Size | NaFlex Default Patches |
|---|---|---|---|---|---|
| LocCa ViT-SO400M-16-SigLIP2 | 1.14B | 0.43B | 0.71B | 16x16 | 256 |
pip install torch torchvision timm transformers huggingface-hub safetensors ftfy1import torch
2from transformers import AutoModel
3from PIL import Image
4
5# Load model + processor
6model = AutoModel.from_pretrained("KRAFTON/Raon-VisionEncoder", trust_remote_code=True)
7model = model.to(dtype=torch.bfloat16).eval()
8processor = model.get_processor("KRAFTON/Raon-VisionEncoder")
9
10# Encode image and text
11img_inputs = processor(images=Image.open("assets/photo.jpg"))
12txt_inputs = processor(text=["a cat", "a dog"])
13
14with torch.no_grad():
15 img_feat = model.encode_image(**img_inputs)
16 txt_feat = model.encode_text(**txt_inputs)
17
18 # Compute similarity with learned scale and bias
19 logits = model.logit_scale.exp() * (img_feat @ txt_feat.T) + model.logit_bias
20 probs = logits.softmax(dim=-1)
21 print(probs)| Method | Input | Output |
|---|---|---|
model.encode_image(**inputs) | Processor output (image) | [B, 1152] normalized image features |
model.encode_text(**inputs) | Processor output (text) | [B, 1152] normalized text features |
model.logit_scale | - | Learned temperature parameter |
model.logit_bias | - | Learned bias parameter |
model.get_processor(repo_id) | HuggingFace repo ID | Processor instance |
processor(images=img) | PIL Image | Preprocessed image dict |
processor(text=["a cat"]) | list of strings | Tokenized text dict |