Views
No views yet
1from transformers import AutoModelForTokenClassification, AutoTokenizer
2from transformers import pipeline
3import re
4import string
5
6tokenizer = AutoTokenizer.from_pretrained("osiria/deberta-base-italian-uncased-ner")
7model = AutoModelForTokenClassification.from_pretrained("osiria/deberta-base-italian-uncased-ner", num_labels = 5)
8
9text = "mi chiamo marco rossi, vivo a roma e lavoro per l'agenzia spaziale italiana nella missione prisma"
10
11for p in string.punctuation:
12 text = text.replace(p, " " + p + " ")
13
14ner = pipeline("ner", model=model, tokenizer=tokenizer)
15ner(text, aggregation_strategy="simple")
16
17[{'entity_group': 'PER',
18 'score': 0.9929623,
19 'word': 'marco rossi',
20 'start': 9,
21 'end': 21},
22 {'entity_group': 'LOC',
23 'score': 0.9898509,
24 'word': 'roma',
25 'start': 31,
26 'end': 36},
27 {'entity_group': 'ORG',
28 'score': 0.9905911,
29 'word': 'agenzia spaziale italiana',
30 'start': 53,
31 'end': 79},
32 {'entity_group': 'MISC',
33 'score': 0.92474234,
34 'word': 'missione prisma',
35 'start': 85,
36 'end': 101}]