Views
No views yet
pip install pillow requests sentencepiece transformers torch timm1import io
2import requests
3from PIL import Image
4import torch
5from transformers import AutoImageProcessor, AutoModel, AutoTokenizer
6
7HF_MODEL_PATH = 'line-corporation/clip-japanese-base'
8device = "cuda" if torch.cuda.is_available() else "cpu"
9tokenizer = AutoTokenizer.from_pretrained(HF_MODEL_PATH, trust_remote_code=True)
10processor = AutoImageProcessor.from_pretrained(HF_MODEL_PATH, trust_remote_code=True)
11model = AutoModel.from_pretrained(HF_MODEL_PATH, trust_remote_code=True).to(device)
12
13image = Image.open(io.BytesIO(requests.get('https://images.pexels.com/photos/2253275/pexels-photo-2253275.jpeg?auto=compress&cs=tinysrgb&dpr=3&h=750&w=1260').content))
14image = processor(image, return_tensors="pt").to(device)
15text = tokenizer(["犬", "猫", "象"]).to(device)
16
17with torch.no_grad():
18 image_features = model.get_image_features(**image)
19 text_features = model.get_text_features(**text)
20 text_probs = (100.0 * image_features @ text_features.T).softmax(dim=-1)
21
22print("Label probs:", text_probs)
23# [[1., 0., 0.]]| Model | Image Encoder Params | Text Encoder params | STAIR Captions (R@1) | Recruit Datasets (acc@1) | ImageNet-1K (acc@1) |
|---|---|---|---|---|---|
| Ours | 86M(Eva02-B) | 100M(BERT) | 0.30 | 0.89 | 0.58 |
| Stable-ja-clip | 307M(ViT-L) | 100M(BERT) | 0.24 | 0.77 | 0.68 |
| Rinna-ja-clip | 86M(ViT-B) | 100M(BERT) | 0.13 | 0.54 | 0.56 |
| Laion-clip | 632M(ViT-H) | 561M(XLM-RoBERTa) | 0.30 | 0.83 | 0.58 |
| Hakuhodo-ja-clip | 632M(ViT-H) | 100M(BERT) | 0.21 | 0.82 | 0.46 |
@misc{clip-japanese-base,
title = {CLIP Japanese Base},
author={Shuhei Yokoo and Shuntaro Okada and Peifei Zhu and Shuhei Nishimura and Naoki Takayama}
url = {https://huggingface.co/line-corporation/clip-japanese-base},
}