Views
No views yet
molcrawl-compounds-gpt2-large pre-trained model.[SEP] token (id=13) is used as the end-of-sequence marker.1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model = AutoModelForCausalLM.from_pretrained("kojima-lab/molcrawl-compounds-guacamol-gpt2-large")
5tokenizer = AutoTokenizer.from_pretrained("kojima-lab/molcrawl-compounds-guacamol-gpt2-large")
6
7# Generate SMILES string
8prompt = "CC(=O)O"
9input_ids = tokenizer.encode(prompt, return_tensors="pt")
10with torch.no_grad():
11 output_ids = model.generate(
12 input_ids,
13 max_new_tokens=50,
14 do_sample=True,
15 temperature=0.8,
16 eos_token_id=tokenizer.convert_tokens_to_ids("[SEP]"), # [SEP] is EOS for compounds
17 pad_token_id=0,
18 )
19print(tokenizer.decode(output_ids[0], skip_special_tokens=True))
201@misc{molcrawl_compounds_guacamol_gpt2_large,
2 title={molcrawl-compounds-guacamol-gpt2-large},
3 author={{RIKEN}},
4 year={2026},
5 publisher={{Hugging Face}},
6 url={{https://huggingface.co/kojima-lab/molcrawl-compounds-guacamol-gpt2-large}}
7}