Views
No views yet
'resized_height':680 , 'resized_width':680 (see below) to fit VRAM based on GPU resources.1import torch
2from transformers import AutoProcessor, Qwen2VLForConditionalGeneration
3from qwen_vl_utils import process_vision_info
4
5min_pixels = 1*28*28
6max_pixels = 2560*28*28
7
8processor = AutoProcessor.from_pretrained("MrLight/dse-qwen2-2b-mrl-v1", min_pixels=min_pixels, max_pixels=max_pixels)
9model = Qwen2VLForConditionalGeneration.from_pretrained('MrLight/dse-qwen2-2b-mrl-v1', attn_implementation="flash_attention_2", torch_dtype=torch.bfloat16).to('cuda:0').eval()
10processor.tokenizer.padding_side = "left"
11model.padding_side = "left"
12
13def get_embedding(last_hidden_state: torch.Tensor, dimension: int) -> torch.Tensor:
14 reps = last_hidden_state[:, -1]
15 reps = torch.nn.functional.normalize(reps[:, :dimension], p=2, dim=-1)
16 return reps1from PIL import Image
2queries = ["Where can we see Llama?", "What is the LLaMA AI model?"]
3query_messages = []
4for query in queries:
5 message = [
6 {
7 'role': 'user',
8 'content': [
9 {'type': 'image', 'image': Image.new('RGB', (28, 28)), 'resized_height':1 , 'resized_width':1}, # need a dummy image here for an easier process.
10 {'type': 'text', 'text': f'Query: {query}'},
11 ]
12 }
13 ]
14 query_messages.append(message)
15query_texts = [
16 processor.apply_chat_template(msg, tokenize=False, add_generation_prompt=True) + "<|endoftext|>"
17 for msg in query_messages
18]
19query_image_inputs, query_video_inputs = process_vision_info(query_messages)
20query_inputs = processor(text=query_texts, images=query_image_inputs, videos=query_video_inputs, padding='longest', return_tensors='pt').to('cuda:0')
21cache_position = torch.arange(0, len(query_texts))
22query_inputs = model.prepare_inputs_for_generation(**query_inputs, cache_position=cache_position, use_cache=False)
23with torch.no_grad():
24 output = model(**query_inputs, return_dict=True, output_hidden_states=True)
25query_embeddings = get_embedding(output.hidden_states[-1], 1536) # adjust dimensionality for efficiency trade-off, e.g. 5121import requests
2from io import BytesIO
3
4# URLs of the images
5url1 = "https://huggingface.co/Tevatron/dse-phi3-docmatix-v2/resolve/main/animal-llama.png"
6url2 = "https://huggingface.co/Tevatron/dse-phi3-docmatix-v2/resolve/main/meta-llama.png"
7
8# Download and open images
9response1 = requests.get(url1)
10response2 = requests.get(url2)
11
12doc_image1 = Image.open(BytesIO(response1.content))
13doc_image2 = Image.open(BytesIO(response2.content))
14
15doc_images = [doc_image1, doc_image2]
16doc_messages = []
17for doc in doc_images:
18 message = [
19 {
20 'role': 'user',
21 'content': [
22 {'type': 'image', 'image': doc}, #'resized_height':680 , 'resized_width':680} # adjust the image size for efficiency trade-off
23 {'type': 'text', 'text': 'What is shown in this image?'}
24 ]
25 }
26 ]
27 doc_messages.append(message)
28doc_texts = [
29 processor.apply_chat_template(msg, tokenize=False, add_generation_prompt=True) + "<|endoftext|>"
30 for msg in doc_messages
31]
32doc_image_inputs, doc_video_inputs = process_vision_info(doc_messages)
33doc_inputs = processor(text=doc_texts, images=doc_image_inputs, videos=doc_video_inputs, padding='longest', return_tensors='pt').to('cuda:0')
34cache_position = torch.arange(0, len(doc_texts))
35doc_inputs = model.prepare_inputs_for_generation(**doc_inputs, cache_position=cache_position, use_cache=False)
36with torch.no_grad():
37 output = model(**doc_inputs, return_dict=True, output_hidden_states=True)
38doc_embeddings = get_embedding(output.hidden_states[-1], 1536) # adjust dimensionality for efficiency trade-off e.g. 512
391from torch.nn.functional import cosine_similarity
2num_queries = query_embeddings.size(0)
3num_passages = doc_embeddings.size(0)
4
5for i in range(num_queries):
6 query_embedding = query_embeddings[i].unsqueeze(0)
7 similarities = cosine_similarity(query_embedding, doc_embeddings)
8 print(f"Similarities for Query {i+1}: {similarities.cpu().float().numpy()}")Tevatron/msmarco-passage-aug, thus the model can also effectively encode document as text input.1doc_texts = [
2 "The llama (/ˈlɑːmə/; Spanish pronunciation: [ˈʎama] or [ˈʝama]) (Lama glama) is a domesticated South American camelid, widely used as a meat and pack animal by Andean cultures since the pre-Columbian era.",
3 "Llama (acronym for Large Language Model Meta AI, and formerly stylized as LLaMA) is a family of autoregressive large language models (LLMs) released by Meta AI starting in February 2023.[2][3] The latest version is Llama 3.1, released in July 2024.[4]"
4]
5doc_messages = []
6for doc in doc_texts:
7 message = [
8 {
9 'role': 'user',
10 'content': [
11 {'type': 'image', 'image': Image.new('RGB', (28, 28)), 'resized_height':1 , 'resized_width':1}, # need a dummy image here for an easier process.
12 {'type': 'text', 'text': f'Document: {doc}'}
13 ]
14 }
15 ]
16 doc_messages.append(message)
17doc_texts = [
18 processor.apply_chat_template(msg, tokenize=False, add_generation_prompt=True) + "<|endoftext|>"
19 for msg in doc_messages
20]
21doc_image_inputs, doc_video_inputs = process_vision_info(doc_messages)
22doc_inputs = processor(text=doc_texts, images=doc_image_inputs, videos=doc_video_inputs, padding='longest', return_tensors='pt').to('cuda:0')
23cache_position = torch.arange(0, len(doc_texts))
24doc_inputs = model.prepare_inputs_for_generation(**doc_inputs, cache_position=cache_position, use_cache=False)
25with torch.no_grad():
26 output = model(**doc_inputs, return_dict=True, output_hidden_states=True)
27doc_embeddings = get_embedding(output.hidden_states[-1], 1536) # adjust dimensionality for efficiency trade-off e.g. 512
28
29for i in range(num_queries):
30 query_embedding = query_embeddings[i].unsqueeze(0)
31 similarities = cosine_similarity(query_embedding, doc_embeddings)
32 print(f"Similarities for Query {i+1}: {similarities.cpu().float().numpy()}")