Views
No views yet
[MASK]. No token-type ids.answerdotai/ModernBERT-base for zeromodels. One implementation runs unmodified on TensorFlow / Torch / JAX.ModernBertMaskedLM, modernbert_base). Task heads (sequence / token classify, QA, multiple choice) load via hf: fine-tunes.1import os
2os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
3
4from zeromodels.models.modernbert import ModernBertMaskedLM, ModernBertTokenizer
5
6mlm = ModernBertMaskedLM.from_weights("zeromodels/modernbert_base")
7tokenizer = ModernBertTokenizer.from_weights("zeromodels/modernbert_base")
8
9inputs = tokenizer("The capital of France is [MASK].")
10logits = mlm(inputs) # (1, L, vocab_size)
11mask = int((inputs["input_ids"][0] == tokenizer.mask_token_id).argmax())
12print(tokenizer.decode([int(logits[0, mask].argmax())]))from_weights("zeromodels/<variant>"):| Variant | Hub | layers | embed_dim |
|---|---|---|---|
modernbert_base | zeromodels/modernbert_base | 22 | 768 |
modernbert_large | zeromodels/modernbert_large | 28 | 1024 |
from_weights("zeromodels/modernbert_base") (or on the fly via the hf: prefix). The pretrained backbone is shared; task heads not stored in this checkpoint start randomly initialized, ready for fine-tuning (or load a hf: fine-tune).| Class | Task |
|---|---|
ModernBertModel | Encoder backbone |
ModernBertMaskedLM | Masked language modeling (fill-mask) |
ModernBertSequenceClassify | Sequence classification |
ModernBertTokenClassify | Token classification (NER / POS) |
ModernBertQnA | Extractive question answering |
ModernBertMultipleChoice | Multiple choice |
1from zeromodels.models.modernbert import ModernBertSequenceClassify
2model = ModernBertSequenceClassify.from_weights("zeromodels/modernbert_base")KERAS_BACKEND before importing Keras / zeromodels.ModernBertTokenizer.from_weights(...) so tokenization matches.[MASK] (not <mask>).input_ids / attention_mask.hf: prefix, e.g. ModernBertMaskedLM.from_weights("hf:answerdotai/ModernBERT-base").