Views
No views yet
facebook/metaclip-b16-400m (CLIP-like architecture)CLIPModel from the transformers libraryCLIPProcessor (handles both image and text preprocessing)1from transformers import CLIPProcessor, CLIPModel
2from PIL import Image
3import requests
4import torch
5
6model_id = "Mihara-bot/metaclip-b16-400m-medtrinity_Full"
7
8processor = CLIPProcessor.from_pretrained(model_id)
9model = CLIPModel.from_pretrained(model_id)
10
11# Example image & text
12url = "https://your-image-url"
13image = Image.open(requests.get(url, stream=True).raw).convert("RGB")
14texts = ["a medical image of ...", "a normal image of ..."]
15
16inputs = processor(
17 text=texts,
18 images=image,
19 return_tensors="pt",
20 padding="max_length",
21 truncation=True,
22 max_length=77,
23)
24
25with torch.no_grad():
26 outputs = model(
27 pixel_values=inputs["pixel_values"],
28 input_ids=inputs["input_ids"],
29 attention_mask=inputs["attention_mask"],
30 )
31
32image_embeds = outputs.image_embeds # (batch, dim)
33text_embeds = outputs.text_embeds # (batch, dim)
34
35# Calculate similarity
36logits_per_image = image_embeds @ text_embeds.t()
37probs = logits_per_image.softmax(dim=-1)
38print(probs)@misc{zhuang2025chipsefficientclipadaptation,
title={CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection},
author={Xinlin Zhuang and Yichen Li and Xiwei Liu and Haolin Yang and Yifan Lu and Ziyun Zou and Yulong Li and Huifa Li and Dongliang Chen and Qinglei Wang and Weiyang Liu and Ying Qian and Jiangming Shi and Imran Razzak},
year={2025},
eprint={2511.18519},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2511.18519},
}