Views
No views yet
| Property | Value |
|---|---|
| Parameters | 109,923,072 (110M) |
| Architecture | Transformer (RMSNorm, SwiGLU, RoPE) |
| Layers | 12 |
| Heads | 12 |
| Embedding dim | 768 |
| Context length | 512 tokens |
| Vocab size | 16,000 |
| Tokenizer | BPE (SentencePiece) |
| Training steps | 24,000 |
1import torch
2import json
3from core.model import GPT
4from core.bpe_tokenizer import BPETokenizer
5
6# Load model
7checkpoint = torch.load("model.pt", map_location="cpu")
8with open("config.json") as f:
9 cfg = json.load(f)
10
11tokenizer = BPETokenizer.load("tokenizer.json")
12
13model = GPT(
14 vocab_size=cfg["vocab_size"],
15 n_layer=cfg["n_layer"],
16 n_head=cfg["n_head"],
17 n_embd=cfg["n_embd"],
18 block_size=cfg["block_size"],
19 dropout=0.0,
20)
21model.load_state_dict(checkpoint)
22model.eval()
23
24# Generate text
25prompt = "Հայաստան"
26ids = tokenizer.encode(prompt)
27context = torch.tensor([ids], dtype=torch.long)
28output = model.generate(context, max_new_tokens=200, temperature=0.8, top_k=40)
29print(tokenizer.decode(output[0].tolist()))