Views
No views yet
1from transformers import PreTrainedTokenizerFast, BertForMaskedLM
2
3model = BertForMaskedLM.from_pretrained("LofiAmazon/BarcodeBERT-Entire-BOLD")
4model.eval()
5
6tokenizer = PreTrainedTokenizerFast.from_pretrained("LofiAmazon/BarcodeBERT-Entire-BOLD")
7
8# The DNA sequence you want to predict.
9# There should be a space after every 4 characters.
10# The sequence may also have unknown characters which are not A,C,T,G.
11# The maximum DNA sequence length (not counting spaces) should be 660 characters
12dna_sequence = "AACA ATGT ATTT A-T- TTCG CCCT TGTG AATT TATT ..."
13
14inputs = tokenizer(dna_sequence, return_tensors="pt")
15
16# Obtain a DNA embedding, which is a vector of length 768.
17# The embedding is a representation of this DNA sequence in the model's latent space.
18embedding = model(**inputs).hidden_states[-1].mean(1).squeeze()