Views
No views yet
yhavinga/dutch-llama-tokenizer (SentencePiece, Dutch-optimized)yhavinga/mc4_nl_cleaned (full config)1from transformers import AutoTokenizer, ModernBertForMaskedLM
2
3model = ModernBertForMaskedLM.from_pretrained("yhavinga/dmbert-dutchl-1024h-22l-2000000")
4tokenizer = AutoTokenizer.from_pretrained("yhavinga/dmbert-dutchl-1024h-22l-2000000")
5
6# Masked language modeling
7inputs = tokenizer("Amsterdam is de<mask> van Nederland.", return_tensors="pt")
8outputs = model(**inputs)
9predictions = tokenizer.decode(outputs.logits[0, 4].topk(5).indices[0])
10# Expected: "hoofdstad" (capital)1024h-22L-2) differs from the earlier 1024h-22L variant:| Parameter | 1024h-22L | 1024h-22L-2 (this model) |
|---|---|---|
intermediate_size | 4096 | 1536 |
tokenizer | jhu-clsp/mmBERT-small | yhavinga/dutch-llama-tokenizer |
vocab_size | 256,000 | 32,128 |
1@model{dmbert_dutchl_1024h,
2 title={Dutch ModernBERT 1024h-22L},
3 author={Yeb Havinga},
4 year={2025},
5 publisher={Hugging Face},
6 url={https://huggingface.co/yhavinga/dmbert-dutchl-1024h-22l-2000000}
7}