Views
No views yet
<mask>), and padding-offset position ids.FacebookAI/roberta-base for zeromodels. One implementation runs unmodified on TensorFlow / Torch / JAX.RobertaMaskedLM, base). Task heads load via hf: fine-tunes.1import os
2os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
3
4from zeromodels.models.roberta import RobertaMaskedLM, RobertaTokenizer
5
6mlm = RobertaMaskedLM.from_weights("zeromodels/roberta_base")
7tokenizer = RobertaTokenizer.from_weights("zeromodels/roberta_base")
8
9inputs = tokenizer("The capital of France is <mask>.")
10logits = mlm(inputs) # (1, L, vocab_size)
11mask = int((inputs["input_ids"][0] == tokenizer.mask_token_id).argmax())
12print(tokenizer.decode([int(logits[0, mask].argmax())]))from_weights("zeromodels/<variant>"):| Variant | Hub |
|---|---|
roberta_base | zeromodels/roberta_base |
roberta_large | zeromodels/roberta_large |
from_weights("zeromodels/roberta_base") (or on the fly via the hf: prefix). The pretrained backbone is shared; task heads not stored in this checkpoint start randomly initialized, ready for fine-tuning (or load a hf: fine-tune).| Class | Task |
|---|---|
RobertaModel | Encoder backbone |
RobertaMaskedLM | Masked language modeling (fill-mask) |
RobertaSequenceClassify | Sequence classification |
RobertaTokenClassify | Token classification (NER / POS) |
RobertaQnA | Extractive question answering |
RobertaMultipleChoice | Multiple choice |
1from zeromodels.models.roberta import RobertaSequenceClassify
2model = RobertaSequenceClassify.from_weights("zeromodels/roberta_base")KERAS_BACKEND before importing Keras / zeromodels.RobertaTokenizer.from_weights(...) so BPE vocab matches.<mask> (not [MASK]).hf: prefix, e.g. RobertaMaskedLM.from_weights("hf:FacebookAI/roberta-base").