Views
No views yet
1import torch
2from transformers import AutoModelForSequenceClassification, AutoTokenizer
3
4tokenizer = AutoTokenizer.from_pretrained('qilowoq/bge-reranker-v2-m3-en-ru')
5model = AutoModelForSequenceClassification.from_pretrained('qilowoq/bge-reranker-v2-m3-en-ru')
6model.eval()
7
8pairs = [('How many people live in Berlin?', 'Berlin has a population of 3,520,031 registered inhabitants in an area of 891.82 square kilometers.'),
9 ('Какая площадь Берлина?', 'Площадь Берлина составляет 891,8 квадратных километров.')]
10with torch.no_grad():
11 inputs = tokenizer(pairs, padding=True, truncation=True, return_tensors='pt')
12 scores = model(**inputs, return_dict=True).logits.view(-1, ).float()
13 print(scores)1@misc{li2023making,
2 title={Making Large Language Models A Better Foundation For Dense Retrieval},
3 author={Chaofan Li and Zheng Liu and Shitao Xiao and Yingxia Shao},
4 year={2023},
5 eprint={2312.15503},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL}
8}
9@misc{chen2024bge,
10 title={BGE M3-Embedding: Multi-Lingual, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation},
11 author={Jianlv Chen and Shitao Xiao and Peitian Zhang and Kun Luo and Defu Lian and Zheng Liu},
12 year={2024},
13 eprint={2402.03216},
14 archivePrefix={arXiv},
15 primaryClass={cs.CL}
16}