Views
No views yet
*.pth files are converted TensorRT checkpoints in FP16, to be used via torch2trt:1from torch2trt import TRTModule()
2
3vision_trt = TRTModule()
4vision_trt.load_state_dict(torch.load('vision_trt.pth'))
5text_trt = TRTModule()
6text_trt.load_state_dict(torch.load('text_trt.pth'))1from PIL import Image
2import requests
3from transformers import AutoProcessor, AutoModel
4import torch
5
6model = AutoModel.from_pretrained("google/siglip-large-patch16-384")
7processor = AutoProcessor.from_pretrained("google/siglip-large-patch16-384")
8
9url = "http://images.cocodataset.org/val2017/000000039769.jpg"
10image = Image.open(requests.get(url, stream=True).raw)
11
12texts = ["a photo of 2 cats", "a photo of 2 dogs"]
13inputs = processor(text=texts, images=image, padding="max_length", return_tensors="pt")
14
15with torch.no_grad():
16 outputs = model(**inputs)
17
18logits_per_image = outputs.logits_per_image
19probs = torch.sigmoid(logits_per_image) # these are the probabilities
20print(f"{probs[0][0]:.1%} that image 0 is '{texts[0]}'")1from transformers import pipeline
2from PIL import Image
3import requests
4
5# load pipe
6image_classifier = pipeline(task="zero-shot-image-classification", model="google/siglip-large-patch16-384")
7
8# load image
9url = 'http://images.cocodataset.org/val2017/000000039769.jpg'
10image = Image.open(requests.get(url, stream=True).raw)
11
12# inference
13outputs = image_classifier(image, candidate_labels=["2 cats", "a plane", "a remote"])
14outputs = [{"score": round(output["score"], 4), "label": output["label"] } for output in outputs]
15print(outputs)
1@misc{zhai2023sigmoid,
2 title={Sigmoid Loss for Language Image Pre-Training},
3 author={Xiaohua Zhai and Basil Mustafa and Alexander Kolesnikov and Lucas Beyer},
4 year={2023},
5 eprint={2303.15343},
6 archivePrefix={arXiv},
7 primaryClass={cs.CV}
8}