Views
No views yet
[MASK].google/electra-small-generator for zeromodels. One implementation runs unmodified on TensorFlow / Torch / JAX.1import os
2os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
3
4from zeromodels.models.electra import ElectraMaskedLM, ElectraTokenizer
5
6mlm = ElectraMaskedLM.from_weights("zeromodels/electra_small_generator")
7tokenizer = ElectraTokenizer.from_weights("zeromodels/electra_small_generator")
8
9inputs = tokenizer("The capital of France is [MASK].")
10logits = mlm(inputs) # (1, L, vocab_size)
11mask = int((inputs["input_ids"][0] == tokenizer.mask_token_id).argmax())
12print(tokenizer.decode([int(logits[0, mask].argmax())]))from_weights("zeromodels/<variant>"):| Size | Discriminator (encoder / downstream) | Generator (masked-LM) |
|---|---|---|
| small | zeromodels/electra_small_discriminator | zeromodels/electra_small_generator |
| base | zeromodels/electra_base_discriminator | zeromodels/electra_base_generator |
| large | zeromodels/electra_large_discriminator | zeromodels/electra_large_generator |
from_weights("zeromodels/electra_small_generator") (or on the fly via the hf: prefix). The pretrained backbone is shared; task heads not stored in this checkpoint start randomly initialized, ready for fine-tuning (or load a hf: fine-tune).| Class | Task |
|---|---|
ElectraMaskedLM | Masked language modeling (fill-mask) |
1from zeromodels.models.electra import ElectraMaskedLM
2model = ElectraMaskedLM.from_weights("zeromodels/electra_small_generator")KERAS_BACKEND before importing Keras / zeromodels.ElectraTokenizer.from_weights(...) so WordPiece tokenization matches.hf: prefix, e.g. ElectraModel.from_weights("hf:google/electra-small-generator").