Views
No views yet
dbmdz/bert-base-italian-uncased using Masked Language Modeling (MLM) with Whole Word Masking (WWM).dbmdz/bert-base-italian-uncased[MASK] prediction)1from transformers import AutoTokenizer, AutoModelForMaskedLM
2import torch
3
4model_name = "InfocubeSrl/LexCube"
5
6tokenizer = AutoTokenizer.from_pretrained(model_name)
7model = AutoModelForMaskedLM.from_pretrained(model_name)
8
9# Examples with [MASK]
10examples = [
11 "[MASK] il Decreto Legislativo 18 agosto 2000, n. 267 (Testo Unico delle leggi sull'ordinamento degli Enti Locali)",
12 "ACQUISITI, ai sensi dell'art. [MASK] del D.Lgs. 267/2000, i pareri favorevoli di regolarità tecnica e di regolarità contabile",
13 "Visto gli art. [MASK] e 42 del D.Lgs n.267/2000, Testo unico degli enti locali.",
14 "DI DICHIARARE la presente deliberazione immediatamente [MASK] ai sensi dell'art. 134, comma 4, del D.Lgs. n. 267/2000."
15]
16
17for text in examples:
18 inputs = tokenizer(text, return_tensors="pt")
19 outputs = model(**inputs)
20
21 # Find mask token position
22 mask_index = (inputs["input_ids"][0] == tokenizer.mask_token_id).nonzero(as_tuple=True)[0]
23
24 # Get top prediction
25 predicted_id = outputs.logits[0, mask_index].argmax(dim=-1)
26 predicted_token = tokenizer.decode(predicted_id)
27
28 print(f"Input: {text}")
29 print(f"Prediction: {predicted_token}\n")
30