This model uses the
MorPiece tokenizer, a split-based tokenizer (
cristianochesi/morpiece)
1from transformers import GPT2LMHeadModel, GPT2Tokenizer
2
3# Load model and tokenizer
4model = GPT2LMHeadModel.from_pretrained("NeTS-lab/babylm-mop-10m-gpt2")
5tokenizer = GPT2Tokenizer.from_pretrained("NeTS-lab/babylm-mop-10m-gpt2")
6
7# Generate text
8input_text = "The child played with"
9inputs = tokenizer.encode(input_text, return_tensors="pt")
10outputs = model.generate(inputs, max_length=50, do_sample=True, temperature=0.8)
11generated_text = tokenizer.decode(outputs[0], skip_special_tokens=True)
12print(generated_text)
1{
2 "activation_function": "gelu_new",
3 "architectures": ["GPT2LMHeadModel"],
4 "attn_pdrop": 0.1,
5 "embd_pdrop": 0.1,
6 "layer_norm_epsilon": 1e-05,
7 "n_ctx": 1024,
8 "n_embd": 768,
9 "n_head": 12,
10 "n_layer": 12,
11 "vocab_size": 23405
12}
1@misc{babylm2025-gpt2-morpiece,
2 title={undereview},
3 author={[Your Name]},
4 year={2025},
5 url={https://huggingface.co/NeTS-lab/babylm-mop-10m-gpt2}
6}
1@misc{morpiece2024,
2 title={MorPiece: Morphologically-aware Piece Tokenization},
3 author={Cristiano Chesi & NeTS Lab},
4 year={2024},
5 url={https://github.com/cristianochesi/morpiece}
6}
For questions about this model or the training process, please [
cristiano.chesi@iusspavia.it].