Views
No views yet
1from transformers import AutoTokenizer, AutoModel
2import torch
3import re
4
5# Load tokenizer and model
6
7tokenizer = AutoTokenizer.from_pretrained("virtual-human-chc/prot_xlnet", use_fast=False)
8model = AutoModel.from_pretrained("virtual-human-chc/prot_xlnet").eval()
9
10device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
11model = model.to(device)
12
13# Example protein sequences
14sequences = ["A E T C Z A O", "S K T Z P"]
15sequences = [re.sub(r"[UZOB]", "X", sequence) for sequence in sequences]
16
17# Tokenize and extract embeddings
18inputs = tokenizer(sequences, padding=True, return_tensors="pt")
19# In case of GPU
20inputs = {k: v.to(device) for k, v in inputs.items()}
21
22with torch.no_grad():
23 outputs = model(**inputs)
24
25print(outputs.last_hidden_state)