Views
No views yet
Transformers format.1import torch
2from transformers import AutoModelForSequenceClassification, BertTokenizer
3model_name = 'cointegrated/rubert-base-cased-dp-paraphrase-detection'
4model = AutoModelForSequenceClassification.from_pretrained(model_name).cuda()
5tokenizer = BertTokenizer.from_pretrained(model_name)
6
7def compare_texts(text1, text2):
8 batch = tokenizer(text1, text2, return_tensors='pt').to(model.device)
9 with torch.inference_mode():
10 proba = torch.softmax(model(**batch).logits, -1).cpu().numpy()
11 return proba[0] # p(non-paraphrase), p(paraphrase)
12
13print(compare_texts('Сегодня на улице хорошая погода', 'Сегодня на улице отвратительная погода'))
14# [0.7056226 0.2943774]
15print(compare_texts('Сегодня на улице хорошая погода', 'Отличная погодка сегодня выдалась'))
16# [0.16524374 0.8347562 ]max_seq_length=64.
This model, however, uses model_max_length=512.
Therefore, the results on long texts may be inadequate.