SigLIP-HD is a vision encoder fine-tuned from
SigLIP 2-So400m/16-512px
with
fine-to-coarse supervision.
SigLIP-HD exhibits better performance than SigLIP 2 in MLLMs, especially for OCR scenarios.
1import torch
2from PIL import Image
3from transformers import SiglipVisionModel, AutoImageProcessor
4
5model = SiglipVisionModel.from_pretrained("LiheYoung/SigLIP-HD").eval()
6processor = AutoImageProcessor.from_pretrained("LiheYoung/SigLIP-HD")
7
8image = Image.open("example.jpg").convert("RGB")
9inputs = processor(images=image, return_tensors="pt")
10
11with torch.no_grad():
12 features = model(**inputs, output_hidden_states=True).hidden_states[-1] # (1, 1024, 1152)
1@inproceedings{sigliphd,
2 title={SigLIP-HD by Fine-to-Coarse Supervision},
3 author={Yang, Lihe and Zhao, Zhen and Zhao, Hengshuang},
4 booktitle={ICLR},
5 year={2026}
6}
This work is built upon
SigLIP 2. We sincerely thank the authors for
open-sourcing their excellent vision encoder.