Views
No views yet
gelu_new
activations, a tied output head, and a byte-level BPE tokenizer. This is the
124M variant, a base completion model (no chat template).openai-community/gpt2 for
zeromodels. One implementation runs unmodified on
TensorFlow / Torch / JAX.1import os
2os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
3
4from zeromodels.models.gpt2 import GPT2TextGenerate, GPT2Tokenizer
5
6model = GPT2TextGenerate.from_weights("zeromodels/gpt2")
7tokenizer = GPT2Tokenizer.from_weights("zeromodels/gpt2")
8
9inputs = tokenizer("The meaning of life is")
10outputs = model.generate(**inputs, max_new_tokens=40)
11print(tokenizer.decode(outputs[0]))from_weights("zeromodels/<variant>"):| Variant | Hub | Params |
|---|---|---|
gpt2 | zeromodels/gpt2 | 124M |
gpt2_medium | zeromodels/gpt2_medium | 355M |
gpt2_large | zeromodels/gpt2_large | 774M |
gpt2_xl | zeromodels/gpt2_xl | 1.5B |
KERAS_BACKEND before importing Keras / zeromodels.hf: prefix, e.g.
GPT2TextGenerate.from_weights("hf:openai-community/gpt2").