Views
No views yet




1git clone https://github.com/deepglint/UniME.git
2cd UniME
3conda create -n uniME python=3.10 -y
4conda activate uniME
5pip install -r requirements.txt1import torch
2from PIL import Image
3from torch.nn import functional as F
4from transformers import LlavaNextProcessor, LlavaNextForConditionalGeneration
5
6
7base_model_path="DeepGlint-AI/UniME-LLaVA-1.6-7B"
8img_prompt = "[INST] <image>\nSummary above image in one word: [/INST]"
9text_prompt = "[INST] <sent>\nSummary above sentence in one word: [/INST]"
10
11text = "A man is crossing the street with a red car parked nearby."
12image_path = "figures/demo.png"
13input_texts = text_prompt.replace('<sent>', text)
14input_image_prompt = img_prompt
15input_image = [Image.open(image_path)]
16
17transform = LlavaNextProcessor.from_pretrained(base_model_path)
18model = LlavaNextForConditionalGeneration.from_pretrained(base_model_path, device_map="cuda", torch_dtype=torch.float16, low_cpu_mem_usage=True)
19transform.tokenizer.padding_side = "left"
20transform.tokenizer.padding = True
21
22inputs_text = transform(text=input_texts,
23 images=None,
24 return_tensors="pt",
25 padding=True)
26for key in inputs_text: inputs_text[key] = inputs_text[key].to("cuda")
27inputs_image = transform(text=input_image_prompt,
28 images=input_image,
29 return_tensors="pt",
30 padding=True).to("cuda")
31
32with torch.no_grad():
33 emb_text = model(**inputs_text, output_hidden_states=True, return_dict=True).hidden_states[-1][:, -1, :]
34 emb_image = model(**inputs_image, output_hidden_states=True, return_dict=True).hidden_states[-1][:, -1, :]
35 emb_text = F.normalize(emb_text, dim=-1)
36 emb_image = F.normalize(emb_image, dim=-1)
37 Score = emb_image @ emb_text.T
38print("Score: ", Score)

1@misc{gu2025breakingmodalitybarrieruniversal,
2 title={Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs},
3 author={Tiancheng Gu and Kaicheng Yang and Ziyong Feng and Xingjun Wang and Yanzhao Zhang and Dingkun Long and Yingda Chen and Weidong Cai and Jiankang Deng},
4 year={2025},
5 eprint={2504.17432},
6 archivePrefix={arXiv},
7 primaryClass={cs.CV},
8 url={https://arxiv.org/abs/2504.17432},
9}