Views
No views yet
1from transformers import AutoTokenizer
2from model_architecture import FormalBertModel
3import torch
4
5def tokenizetext(text,tokenizer):
6 return tokenizer(text, return_tensors="pt", padding="max_length",truncation=True).to("cuda")
7
8
9test_text=["hello world","welcome world","another example text for testing"]
10tokenizer = AutoTokenizer.from_pretrained("sentence-transformers/all-MiniLM-L6-v2",max_length=10000)
11model_bert = FormalBertModel.from_pretrained("model_bert_anime_finetuned_plz_3").cuda()
12
13
14with torch.amp.autocast(device_type='cuda', dtype=torch.bfloat16):
15
16tokenized_texts=tokenizetext(test_text,tokenizer)
17predictions = model_bert(**tokenized_texts)1datasetd=pd.read_csv("anime_summaries.csv")
2accurate_predictions=0
3wrong_predictions=0
4samples=10000
5for i in range(samples):
6 print(f"Sample {i+1}/{samples}")
7 sample= datasetd.sample(1)
8 text1=sample["synopsis"].values[0]
9 text2=sample["summary"].values[0]
10
11 value,similartexts=do_search(text2, textvdict, model_bert, tokenizer,num_k=5)
12 if text1 in similartexts:
13 accurate_predictions+=1
14 else:
15 wrong_predictions+=1