Traditional text embedding models, such as
jina-embeddings-v2-base-en, excel in text-to-text retrieval but incapable of cross-modal tasks. Models like
openai/clip-vit-base-patch32 effectively align image and text embeddings but are not optimized for text-to-text retrieval due to their training methodologies and context limitations.
1!pip install transformers einops timm pillow
2from transformers import AutoModel
3
4# Initialize the model
5model = AutoModel.from_pretrained('jinaai/jina-clip-v1', trust_remote_code=True)
6
7# New meaningful sentences
8sentences = ['A blue cat', 'A red cat']
9
10# Public image URLs
11image_urls = [
12 'https://i.pinimg.com/600x315/21/48/7e/21487e8e0970dd366dafaed6ab25d8d8.jpg',
13 'https://i.pinimg.com/736x/c9/f2/3e/c9f23e212529f13f19bad5602d84b78b.jpg'
14]
15
16# Encode text and images
17text_embeddings = model.encode_text(sentences)
18image_embeddings = model.encode_image(image_urls) # also accepts PIL.image, local filenames, dataURI
19
20# Compute similarities
21print(text_embeddings[0] @ text_embeddings[1].T) # text embedding similarity
22print(text_embeddings[0] @ image_embeddings[0].T) # text-image cross-modal similarity
23print(text_embeddings[0] @ image_embeddings[1].T) # text-image cross-modal similarity
24print(text_embeddings[1] @ image_embeddings[0].T) # text-image cross-modal similarity
25print(text_embeddings[1] @ image_embeddings[1].T)# text-image cross-modal similarity
1# !pip install -U sentence-transformers
2from sentence_transformers import SentenceTransformer
3
4# Initialize the model
5model = SentenceTransformer('jinaai/jina-clip-v1', trust_remote_code=True)
6
7# New meaningful sentences
8sentences = ['A blue cat', 'A red cat']
9
10# Public image URLs
11image_urls = [
12 'https://i.pinimg.com/600x315/21/48/7e/21487e8e0970dd366dafaed6ab25d8d8.jpg',
13 'https://i.pinimg.com/736x/c9/f2/3e/c9f23e212529f13f19bad5602d84b78b.jpg'
14]
15
16text_embeddings = model.encode(sentences)
17image_embeddings = model.encode(image_urls)
1import { AutoTokenizer, CLIPTextModelWithProjection, AutoProcessor, CLIPVisionModelWithProjection, RawImage, cos_sim } from '@xenova/transformers';
2
3// Load tokenizer and text model
4const tokenizer = await AutoTokenizer.from_pretrained('jinaai/jina-clip-v1');
5const text_model = await CLIPTextModelWithProjection.from_pretrained('jinaai/jina-clip-v1');
6
7// Load processor and vision model
8const processor = await AutoProcessor.from_pretrained('Xenova/clip-vit-base-patch32');
9const vision_model = await CLIPVisionModelWithProjection.from_pretrained('jinaai/jina-clip-v1');
10
11// Run tokenization
12const texts = ['A blue cat', 'A red cat'];
13const text_inputs = tokenizer(texts, { padding: true, truncation: true });
14
15// Compute text embeddings
16const { text_embeds } = await text_model(text_inputs);
17
18// Read images and run processor
19const urls = [
20 'https://i.pinimg.com/600x315/21/48/7e/21487e8e0970dd366dafaed6ab25d8d8.jpg',
21 'https://i.pinimg.com/736x/c9/f2/3e/c9f23e212529f13f19bad5602d84b78b.jpg'
22];
23const image = await Promise.all(urls.map(url => RawImage.read(url)));
24const image_inputs = await processor(image);
25
26// Compute vision embeddings
27const { image_embeds } = await vision_model(image_inputs);
28
29// Compute similarities
30console.log(cos_sim(text_embeds[0].data, text_embeds[1].data)) // text embedding similarity
31console.log(cos_sim(text_embeds[0].data, image_embeds[0].data)) // text-image cross-modal similarity
32console.log(cos_sim(text_embeds[0].data, image_embeds[1].data)) // text-image cross-modal similarity
33console.log(cos_sim(text_embeds[1].data, image_embeds[0].data)) // text-image cross-modal similarity
34console.log(cos_sim(text_embeds[1].data, image_embeds[1].data)) // text-image cross-modal similarity
Join our
Discord community and chat with other community members about ideas.
1@misc{2405.20204,
2 Author = {Andreas Koukounas and Georgios Mastrapas and Michael Günther and Bo Wang and Scott Martens and Isabelle Mohr and Saba Sturua and Mohammad Kalim Akram and Joan Fontanals Martínez and Saahil Ognawala and Susana Guzman and Maximilian Werk and Nan Wang and Han Xiao},
3 Title = {Jina CLIP: Your CLIP Model Is Also Your Text Retriever},
4 Year = {2024},
5 Eprint = {arXiv:2405.20204},
6}
There was a bug in Transformers library between 4.40.x to 4.41.1. You can update transformers to >4.41.2 or <=4.40.0
Our emperical study shows that text-text cosine similarity is normally larger than text-image cosine similarity!
If you want to merge two scores, we recommended 2 ways:
1# pseudo code
2query_document_mean = np.mean(cos_sim_text_texts)
3query_document_std = np.std(cos_sim_text_texts)
4text_image_mean = np.mean(cos_sim_text_images)
5text_image_std = np.std(cos_sim_text_images)
6
7query_document_sim_normalized = (cos_sim_query_documents - query_document_mean) / query_document_std
8text_image_sim_normalized = (cos_sim_text_images - text_image_mean) / text_image_std