Views
No views yet
1from transformers import pipeline, RobertaTokenizerFast
2tokenizer = RobertaTokenizerFast.from_pretrained('roberta-base', max_len=512)
3text = "Let us try this model to see if it <mask>."
4fill_mask = pipeline(
5 "fill-mask",
6 model='EMBO/bio-lm',
7 tokenizer=tokenizer
8)
9fill_mask(text)roberta-base tokenizer.python -m lm.train /data/json/oapmc_abstracts_figs/ MLMper_device_train_batch_size: 16per_device_eval_batch_size: 16learning_rate: 5e-05weight_decay: 0.0adam_beta1: 0.9adam_beta2: 0.999adam_epsilon: 1e-08max_grad_norm: 1.0trainset: 'loss': 0.8653350830078125
validation set: 'eval_loss': 0.8192330598831177, 'eval_recall': 0.8154601116513597recall: 0.814471959728645