Views
No views yet
google/siglip-base-patch16-256-multilingual for kerasformers. One implementation runs unmodified on TensorFlow / Torch / JAX.SigLIPZeroShotClassify): pass image(s) and text prompts at inference time.1import os
2os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
3
4from kerasformers.models.siglip import (
5 SigLIPProcessor,
6 SigLIPZeroShotClassify,
7)
8
9processor = SigLIPProcessor.from_weights("kerasformers/siglip_base_p16_multilingual_256")
10model = SigLIPZeroShotClassify.from_weights("kerasformers/siglip_base_p16_multilingual_256")
11
12labels = [
13 "a photo of a cat",
14 "a photo of a dog",
15 "a photo of a car",
16 "a photo of a living room",
17]
18inputs = processor(text=labels, image_paths="your_image.jpg")
19output = model(
20 {
21 "images": inputs["images"],
22 "token_ids": inputs["input_ids"],
23 }
24)
25print(output["image_logits"].shape)from_weights("kerasformers/<variant>"):| Variant | Hub |
|---|---|
siglip_base_p16_224 | kerasformers/siglip_base_p16_224 |
siglip_base_p16_256 | kerasformers/siglip_base_p16_256 |
siglip_base_p16_multilingual_256 | kerasformers/siglip_base_p16_multilingual_256 |
siglip_base_p16_384 | kerasformers/siglip_base_p16_384 |
siglip_base_p16_512 | kerasformers/siglip_base_p16_512 |
siglip_large_p16_256 | kerasformers/siglip_large_p16_256 |
siglip_large_p16_384 | kerasformers/siglip_large_p16_384 |
siglip_so400m_p14_224 | kerasformers/siglip_so400m_p14_224 |
siglip_so400m_p14_384 | kerasformers/siglip_so400m_p14_384 |
KERAS_BACKEND before importing Keras / kerasformers.Processor.from_weights(...) so image size and tokenizer match the variant.input_ids to model token_ids. No padding mask is required.hf: prefix, e.g. SigLIPZeroShotClassify.from_weights("hf:google/siglip-base-patch16-256-multilingual").