Views
No views yet
GENEPROD_ROLES configuration to perform pure context-dependent semantic role classification of bioentities.1from transformers import pipeline, RobertaTokenizerFast, RobertaForTokenClassification
2example = """<s>The <mask> overexpression in cells caused an increase in <mask> expression.</s>"""
3tokenizer = RobertaTokenizerFast.from_pretrained('roberta-base', max_len=512)
4model = RobertaForTokenClassification.from_pretrained('EMBO/sd-geneprod-roles')
5ner = pipeline('ner', model, tokenizer=tokenizer)
6res = ner(example)
7for r in res:
8 print(r['word'], r['entity'])roberta-base tokenizer.per_device_train_batch_size: 16per_device_eval_batch_size: 16learning_rate: 0.0001weight_decay: 0.0adam_beta1: 0.9adam_beta2: 0.999adam_epsilon: 1e-08max_grad_norm: 1.0sklearn.metrics: precision recall f1-score support
CONTROLLED_VAR 0.81 0.86 0.83 7835
MEASURED_VAR 0.82 0.85 0.84 9330
micro avg 0.82 0.85 0.83 17165
macro avg 0.82 0.85 0.83 17165
weighted avg 0.82 0.85 0.83 17165
{'test_loss': 0.03846803680062294, 'test_accuracy_score': 0.9854472664459946, 'test_precision': 0.8156312625250501, 'test_recall': 0.8535974366443344, 'test_f1': 0.8341825841897008, 'test_runtime': 58.7369, 'test_samples_per_second': 122.206, 'test_steps_per_second': 1.924}