Views
No views yet
| Parameter | Value |
|---|---|
| Parameters | 2,723,712 |
| Layers | 6 |
| Heads | 6 |
| Embedding Dim | 192 |
| Context Length | 256 |
| Vocab Size | 93 (character-level) |
| Training Iters | 2000 |
| dtype | float16 |
1import torch, json
2from model import GPTConfig, GPT
3
4# Load config
5with open('config.json') as f:
6 cfg = json.load(f)
7
8# Build model
9conf = GPTConfig(
10 vocab_size=cfg['vocab_size'], block_size=cfg['block_size'],
11 n_layer=cfg['n_layer'], n_head=cfg['n_head'], n_embd=cfg['n_embd'],
12 dropout=cfg['dropout'], bias=cfg['bias']
13)
14model = GPT(conf)
15model.load_state_dict(torch.load('pytorch_model.bin', map_location='cpu'))
16model.eval()
17
18# Tokenize & generate
19from char_tokenizer import encode, decode
20prompt = "Once upon a time"
21ids = torch.tensor([encode(prompt)], dtype=torch.long)
22out = model.generate(ids, max_new_tokens=200, temperature=0.8, top_k=40)
23print(decode(out[0].tolist()))