Views
No views yet
1from transformers import AutoTokenizer
2from model import (
3 BERTContrastiveLearning_simcse,
4 BERTContrastiveLearning_simcse_w,
5 BERTContrastiveLearning_samp,
6 BERTContrastiveLearning_samp_w,
7)
8
9str_list = data["string"].tolist() # Your list of strings here
10tokenizer = AutoTokenizer.from_pretrained("emilyalsentzer/Bio_ClinicalBERT")
11tokenized_inputs = tokenizer(
12 str_list, padding=True, max_length=50, truncation=True, return_tensors="pt"
13)
14input_ids = tokenized_inputs["input_ids"]
15attention_mask = tokenized_inputs["attention_mask"]
16
17model1 = BERTContrastiveLearning_simcse.load_from_checkpoint(ckpt1).eval()
18model2 = BERTContrastiveLearning_simcse_w.load_from_checkpoint(ckpt2).eval()
19model3 = BERTContrastiveLearning_samp.load_from_checkpoint(ckpt3).eval()
20model4 = BERTContrastiveLearning_samp_w.load_from_checkpoint(ckpt4).eval()
21
22cls, _ = model(input_ids, attention_mask) # embeddings