Views
No views yet
1from transformers import AutoModelForMaskedLM, AutoTokenizer
2import torch
3
4model = AutoModelForMaskedLM.from_pretrained("yhavinga/dmbert-dutchl-512h-22l-1350000")
5tokenizer = AutoTokenizer.from_pretrained("yhavinga/dmbert-dutchl-512h-22l-1350000")
6
7# Example: Fill-mask (note: no space before <mask>)
8text = "Amsterdam is de<mask> van Nederland."
9inputs = tokenizer(text, return_tensors="pt")
10
11with torch.no_grad():
12 outputs = model(**inputs)
13
14# Get predictions for mask token
15mask_idx = (inputs.input_ids == tokenizer.mask_token_id).nonzero(as_tuple=True)[1][0]
16logits = outputs.logits[0, mask_idx]
17probs = torch.nn.functional.softmax(logits, dim=-1)
18top_k = torch.topk(probs, k=5)
19
20print("Top predictions:")
21for prob, idx in zip(top_k.values, top_k.indices):
22 print(f" {tokenizer.decode([idx])}: {prob:.1%}")1{
2 "hidden_size": 512,
3 "num_hidden_layers": 22,
4 "num_attention_heads": 8,
5 "intermediate_size": 3072,
6 "vocab_size": 32128,
7 "max_position_embeddings": 8192,
8 "global_attn_every_n_layers": 3,
9 "local_attention": 128
10}<mask> token:<mask> without preceding space for best results