Views
No views yet
![]() |
|---|
| Pull figure from BLIP official repo |
1import requests
2from PIL import Image
3from transformers import BlipProcessor, BlipForImageTextRetrieval
4
5processor = BlipProcessor.from_pretrained("Salesforce/blip-itm-base-flickr")
6model = BlipForImageTextRetrieval.from_pretrained("Salesforce/blip-itm-base-flickr")
7
8img_url = 'https://storage.googleapis.com/sfr-vision-language-research/BLIP/demo.jpg'
9raw_image = Image.open(requests.get(img_url, stream=True).raw).convert('RGB')
10
11question = "A woman and a dog sitting together in a beach."
12inputs = processor(raw_image, question, return_tensors="pt")
13
14itm_scores = model(**inputs)[0]
15cosine_score = model(**inputs, use_itm_head=False)[0]1import requests
2from PIL import Image
3from transformers import BlipProcessor, BlipForImageTextRetrieval
4
5processor = BlipProcessor.from_pretrained("Salesforce/blip-itm-base-flickr")
6model = BlipForImageTextRetrieval.from_pretrained("Salesforce/blip-itm-base-flickr").to("cuda")
7
8img_url = 'https://storage.googleapis.com/sfr-vision-language-research/BLIP/demo.jpg'
9raw_image = Image.open(requests.get(img_url, stream=True).raw).convert('RGB')
10
11question = "A woman and a dog sitting together in a beach."
12inputs = processor(raw_image, question, return_tensors="pt").to("cuda")
13
14itm_scores = model(**inputs)[0]
15cosine_score = model(**inputs, use_itm_head=False)[0]float16)1import torch
2import requests
3from PIL import Image
4from transformers import BlipProcessor, BlipForImageTextRetrieval
5
6processor = BlipProcessor.from_pretrained("Salesforce/blip-itm-base-flickr")
7model = BlipForImageTextRetrieval.from_pretrained("Salesforce/blip-itm-base-flickr", torch_dtype=torch.float16).to("cuda")
8
9img_url = 'https://storage.googleapis.com/sfr-vision-language-research/BLIP/demo.jpg'
10raw_image = Image.open(requests.get(img_url, stream=True).raw).convert('RGB')
11
12question = "A woman and a dog sitting together in a beach."
13inputs = processor(raw_image, question, return_tensors="pt").to("cuda", torch.float16)
14
15itm_scores = model(**inputs)[0]
16cosine_score = model(**inputs, use_itm_head=False)[0]@misc{https://doi.org/10.48550/arxiv.2201.12086,
doi = {10.48550/ARXIV.2201.12086},
url = {https://arxiv.org/abs/2201.12086},
author = {Li, Junnan and Li, Dongxu and Xiong, Caiming and Hoi, Steven},
keywords = {Computer Vision and Pattern Recognition (cs.CV), FOS: Computer and information sciences, FOS: Computer and information sciences},
title = {BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation},
publisher = {arXiv},
year = {2022},
copyright = {Creative Commons Attribution 4.0 International}
}