Views
No views yet
pip install pillow requests sentencepiece transformers torch timm1import io
2import requests
3from PIL import Image
4import torch
5from transformers import AutoImageProcessor, AutoModel, AutoTokenizer
6
7HF_MODEL_PATH = 'line-corporation/clip-japanese-base-v2'
8device = "cuda" if torch.cuda.is_available() else "cpu"
9tokenizer = AutoTokenizer.from_pretrained(HF_MODEL_PATH, trust_remote_code=True)
10processor = AutoImageProcessor.from_pretrained(HF_MODEL_PATH, trust_remote_code=True)
11model = AutoModel.from_pretrained(HF_MODEL_PATH, trust_remote_code=True).to(device)
12
13image = Image.open(io.BytesIO(requests.get('https://images.pexels.com/photos/2253275/pexels-photo-2253275.jpeg?auto=compress&cs=tinysrgb&dpr=3&h=750&w=1260').content))
14image = processor(image, return_tensors="pt").to(device)
15text = tokenizer(["犬", "猫", "象"]).to(device)
16
17with torch.no_grad():
18 image_features = model.get_image_features(**image)
19 text_features = model.get_text_features(**text)
20 text_probs = (100.0 * image_features @ text_features.T).softmax(dim=-1)
21
22print("Label probs:", text_probs)
23# [[1., 0., 0.]]| Model | Params | Avg. | ImageNet-1k (acc@1) | Recruit Datasets (acc@1) | WAON (acc@1) | STAIR Captions (R@1) |
|---|---|---|---|---|---|---|
| clip-japanese-base-v2 | 196M | 0.708 | 0.666 | 0.913 | 0.975 | 0.277 |
| clip-japanese-base | 196M | 0.673 | 0.580 | 0.884 | 0.934 | 0.293 |
| llm-jp/waon-siglip2-base-path16-256 | 375M | 0.664 | 0.555 | 0.872 | 0.951 | 0.276 |
| google/siglip2-base-patch16-224 | 375M | 0.517 | 0.579 | 0.802 | 0.871 | 0.126 |
| google/siglip2-so400m-patch14-224 | 1135M | 0.642 | 0.643 | 0.837 | 0.925 | 0.163 |
@misc{clip-japanese-base-v2,
title = {CLIP Japanese Base V2},
author={Shuntaro Okada, Shuhei Yokoo, Kei Mukaiyama, Peifei Zhu and Shuhei Nishimura}
url = {https://huggingface.co/line-corporation/clip-japanese-base-v2},
}