Views
No views yet
1from transformers import EncoderDecoderModel, RobertaTokenizer, pipeline
2protein_tokenizer = RobertaTokenizer.from_pretrained("gokceuludogan/WarmMolGenOne")
3mol_tokenizer = RobertaTokenizer.from_pretrained("seyonec/PubChem10M_SMILES_BPE_450k")
4model = EncoderDecoderModel.from_pretrained("gokceuludogan/WarmMolGenOne")
5inputs = protein_tokenizer("MENTENSVDSKSIKNLEPKIIHGSESMDSGISLDNSYKMDYPEMGLCIIINNKNFHKSTG", >>> return_tensors="pt")
6outputs = model.generate(**inputs, decoder_start_token_id=mol_tokenizer.bos_token_id,
7 eos_token_id=mol_tokenizer.eos_token_id, pad_token_id=mol_tokenizer.eos_token_id,
8 max_length=128, num_return_sequences=5, do_sample=True, top_p=0.95)
9mol_tokenizer.batch_decode(outputs, skip_special_tokens=True)
10# Sample output
11# ['Cn1cc(nn1)-c1ccccc1NS(=O)(=O)c1ccc2[nH]ccc2c1',
12# 'CC(C)(C)c1[se]nc2sc(cc12)C(O)=O',
13# '[O-][N+](=O)c1ccc(CN2CCC(CC2)NC(=O)c2cccc3ccccc23)cc1',
14# 'OC(=O)CNC(=O)CCC\\C=C\\CN1[C@@H](Cc2cn(nn2)-c2ccccc2)C(=O)N[C@@H](CCCN2C(S)=NC(C)(C2=O)c2ccc(F)cc2)C1=O',
15# 'OCC1(CCC1)C(=O)NCC1CCN(CC1)c1nc(c(s1)-c1ccc2OCOc2c1)C(O)=O']1@article{10.1093/bioinformatics/btac482,
2 author = {Uludoğan, Gökçe and Ozkirimli, Elif and Ulgen, Kutlu O. and Karalı, Nilgün Lütfiye and Özgür, Arzucan},
3 title = "{Exploiting Pretrained Biochemical Language Models for Targeted Drug Design}",
4 journal = {Bioinformatics},
5 year = {2022},
6 doi = {10.1093/bioinformatics/btac482},
7 url = {https://doi.org/10.1093/bioinformatics/btac482}
8}