Views
No views yet
pip install -U sentence-transformers1from sentence_transformers import CrossEncoder
2
3reranker_model = CrossEncoder('DiTy/cross-encoder-russian-msmarco', max_length=512, device='cuda')
4
5query = ["как часто нужно ходить к стоматологу?"]
6documents = [
7 "Минимальный обязательный срок посещения зубного врача – раз в год, но специалисты рекомендуют делать это чаще – раз в полгода, а ещё лучше – раз в квартал. При таком сроке легко отследить любые начинающиеся проблемы и исправить их сразу же.",
8 "Основная причина заключается в истончении поверхностного слоя зуба — эмали, которая защищает зуб от механических, химических и температурных воздействий. Под эмалью расположен дентин, который более мягкий по своей структуре и пронизан множеством канальцев. При повреждении эмали происходит оголение дентинных канальцев. Раздражение с них начинает передаваться на нервные окончания в зубе и возникают болевые ощущения. Чаще всего дентин оголяется в придесневой области зубов, поскольку эмаль там наиболее тонкая и стирается быстрее.",
9 "Стоматолог, также известный как стоматолог-хирург, является медицинским работником, который специализируется на стоматологии, отрасли медицины, специализирующейся на зубах, деснах и полости рта.",
10 "Дядя Женя работает врачем стоматологом",
11 "Плоды малины употребляют как свежими, так и замороженными или используют для приготовления варенья, желе, мармелада, соков, а также ягодного пюре. Малиновые вина, наливки, настойки, ликёры обладают высокими вкусовыми качествами.",
12]
13
14predict_result = reranker_model.predict([[query[0], documents[0]]])
15print(predict_result)
16# `array([0.88126713], dtype=float32)`
17
18rank_result = reranker_model.rank(query[0], documents)
19print(rank_result)
20# `[{'corpus_id': 0, 'score': 0.88126713},
21# {'corpus_id': 2, 'score': 0.001042091},
22# {'corpus_id': 3, 'score': 0.0010417715},
23# {'corpus_id': 1, 'score': 0.0010344835},
24# {'corpus_id': 4, 'score': 0.0010244923}]`1import torch
2from transformers import AutoTokenizer, AutoModelForSequenceClassification
3
4model = AutoModelForSequenceClassification.from_pretrained('DiTy/cross-encoder-russian-msmarco')
5tokenizer = AutoTokenizer.from_pretrained('DiTy/cross-encoder-russian-msmarco')
6
7features = tokenizer(["как часто нужно ходить к стоматологу?", "как часто нужно ходить к стоматологу?"], ["Минимальный обязательный срок посещения зубного врача – раз в год, но специалисты рекомендуют делать это чаще – раз в полгода, а ещё лучше – раз в квартал. При таком сроке легко отследить любые начинающиеся проблемы и исправить их сразу же.", "Дядя Женя работает врачем стоматологом"], padding=True, truncation=True, return_tensors='pt')
8
9model.eval()
10with torch.no_grad():
11 scores = model(**features).logits
12 print(scores)
13# `tensor([[ 1.6871],
14# [-6.8700]])`