Views
No views yet
ViTImageClassify for logits or ViTModel for tokens / per-block features via as_backbone=True.timm/vit_tiny_patch16_224.augreg_in21k for zeromodels. One implementation runs unmodified on TensorFlow / Torch / JAX.ViTImageClassify / ViTModel).1import os
2
3os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
4
5from PIL import Image
6from zeromodels.models.vit import ViTImageClassify, ViTModel, ViTImageProcessor
7
8model = ViTImageClassify.from_weights("zeromodels/vit_tiny_patch16_224_augreg_in21k")
9processor = ViTImageProcessor.from_weights("zeromodels/vit_tiny_patch16_224_augreg_in21k")
10
11image = Image.open("your_image.jpg").convert("RGB")
12pixels = processor(image) # resize + normalize (normalization lives in the processor)
13logits = model(pixels, training=False)
14print(logits.shape) # (1, num_classes)
15
16# Feature extraction: the backbone without the classifier head
17backbone = ViTModel.from_weights("zeromodels/vit_tiny_patch16_224_augreg_in21k", as_backbone=True)
18features = backbone(pixels, training=False)from_weights("zeromodels/<variant>"):KERAS_BACKEND before importing Keras / zeromodels.ViTImageClassify returns class logits; ViTModel returns features (as_backbone=True for multi-scale stages).ViTImageClassify.from_weights("hf:timm/vit_tiny_patch16_224.augreg_in21k").license (usually matches the upstream checkpoint).