Views
No views yet
| Model | Description | Data Type |
|---|---|---|
reevaluate-clip | Fine-tuned on images, query texts, and description texts | Image+Text |
Image: artefact imageDescription text: BLIP-generated natural language portion + meatadata portionQuery text: User query-like text1from transformers import CLIPProcessor, CLIPModel
2from PIL import Image
3
4model = CLIPModel.from_pretrained("xuemduan/reevaluate-clip")
5processor = CLIPProcessor.from_pretrained("xuemduan/reevaluate-clip")
6
7image = Image.open("artefact.jpg")
8text = "yellow flower paintings"
9
10image_embeds = model.get_image_features(**processor(images=image, return_tensors="pt"))
11text_embeds = model.get_text_features(**processor(text=[text], return_tensors="pt"))
12
13# normalize
14image_embeds = image_embeds / image_embeds.norm(dim=-1, keepdim=True)
15text_embeds = text_embeds / text_embeds.norm(dim=-1, keepdim=True)
16
17similarity = (image_embeds @ text_embeds.T)
18print(similarity)