Views
No views yet
| Task | Improvement using sdadas/mmlw-retrieval-roberta-large retriever | Improvement using BAAI/bge-multilingual-gemma2 retriever |
|---|---|---|
| eprawnik | 70.70 ⟶ 76.43 (+5.73) | 73.24 ⟶ 82.36 (+9.12) |
| abczdrowie | 53.50 ⟶ 58.20 (+4.70) | 55.12 ⟶ 61.37 (+6.25) |
| specprawnik | 43.84 ⟶ 46.06 (+2.22) | 52.00 ⟶ 55.74 (+3.74) |
| zapytajfizyka | 96.10 ⟶ 97.44 (+1.34) | 96.09 ⟶ 97.48 (+1.39) |
| arguana | 63.12 ⟶ 67.42 (+4.30) | 63.78 ⟶ 67.53 (+3.75) |
| quora | 66.61 ⟶ 72.26 (+5.65) | 66.30 ⟶ 74.55 (+8.25) |
| Model | Parameters | Context | opi-urzedowe | ezd-qa | ezd-ir-chunked |
|---|---|---|---|---|---|
| sdadas/polish-reranker-large-ranknet | 435M | 512 | 85.0 | 78.2 | 79.9 |
| sdadas/polish-reranker-roberta-v2 | 435M | 512 | 86.0 | 78.2 | 83.0 |
| Qwen/Qwen3-Reranker-4B | 4B | 32768 | 77.4 | 72.4 | 80.6 |
| Qwen/Qwen3-Reranker-8B | 8B | 32768 | 84.1 | 79.9 | 84.8 |
| BAAI/bge-reranker-v2-m3 | 568M | 8192 | 78.8 | 74.3 | 85.4 |
| sdadas/polish-reranker-roberta-v3 | 443M | 8192 | 86.3 | 80.1 | 86.7 |
1import torch
2from transformers import AutoTokenizer, AutoModelForSequenceClassification
3import numpy as np
4
5query = "Jak dożyć 100 lat?"
6answers = [
7 "Trzeba zdrowo się odżywiać i uprawiać sport.",
8 "Trzeba pić alkohol, imprezować i jeździć szybkimi autami.",
9 "Gdy trwała kampania politycy zapewniali, że rozprawią się z zakazem niedzielnego handlu."
10]
11
12model_name = "sdadas/polish-reranker-roberta-v3"
13tokenizer = AutoTokenizer.from_pretrained(model_name)
14model = AutoModelForSequenceClassification.from_pretrained(
15 model_name,
16 dtype=torch.bfloat16,
17 device_map="cuda"
18)
19texts = [f"{query}</s></s>{answer}" for answer in answers]
20tokens = tokenizer(texts, padding="longest", max_length=8192, truncation=True, return_tensors="pt").to("cuda")
21output = model(**tokens)
22results = output.logits.detach().cpu().float().numpy()
23results = np.squeeze(results)
24print(results.tolist())1import torch.nn
2from sentence_transformers import CrossEncoder
3
4query = "Jak dożyć 100 lat?"
5answers = [
6 "Trzeba zdrowo się odżywiać i uprawiać sport.",
7 "Trzeba pić alkohol, imprezować i jeździć szybkimi autami.",
8 "Gdy trwała kampania politycy zapewniali, że rozprawią się z zakazem niedzielnego handlu."
9]
10
11model = CrossEncoder(
12 "sdadas/polish-reranker-roberta-v3",
13 default_activation_function=torch.nn.Identity(),
14 max_length=8192,
15 device="cuda",
16 model_kwargs={"dtype": torch.bfloat16}
17)
18results = model.predict([[query, answer] for answer in answers])
19print(results.tolist())1@inproceedings{dadas2024assessing,
2 title={Assessing generalization capability of text ranking models in Polish},
3 author={Dadas, S{\l}awomir and Grȩbowiec, Ma{\l}gorzata},
4 booktitle={International Conference on Artificial Intelligence and Soft Computing},
5 pages={37--49},
6 year={2024},
7 organization={Springer}
8}