Views
No views yet
| Hyperparameter | Value |
|---|---|
| Architecture | GPT-2 (decoder-only) |
| Layers | 2 |
| Hidden size | 256 |
| Attention heads | 4 |
| FFN inner size | 1 024 |
| Context length | 512 |
| Vocabulary size | 183 (byte-level BPE) |
| Total params | ~1.76 M |
| Non-embedding params | ~1.58 M |
1from transformers import GPT2LMHeadModel, PreTrainedTokenizerFast
2
3tokenizer = PreTrainedTokenizerFast.from_pretrained("gvadhul/gpt2-2layer-1m")
4model = GPT2LMHeadModel.from_pretrained("gvadhul/gpt2-2layer-1m")
5
6inputs = tokenizer("Hello world", return_tensors="pt")
7out = model.generate(**inputs, max_new_tokens=20)
8print(tokenizer.decode(out[0]))