Views
No views yet
| Property | Value |
|---|---|
| Architecture | Llama-style (Pre-RMSNorm + RoPE + SwiGLU + GQA) |
| Parameters | 336.1M |
| Layers | 24 |
| Hidden dim | 1024 |
| Attention heads | 16 (query) / 4 (KV) |
| Context length | 1024 tokens |
| Vocab size | 32,000 |
| Tokenizer | SentencePiece (32K vocab) |
| Training tokens | 0.00B |
| Training steps | 11,500 |
| Validation loss | 1.2686 |
| Validation perplexity | 3.6 |
1import torch
2from modern_llm_model import ModernGPT, ModelConfig
3
4# Load model
5checkpoint = torch.load("pytorch_model.pt", map_location="cuda")
6config = ModelConfig(**checkpoint["config"])
7model = ModernGPT(config).cuda()
8model.load_state_dict(checkpoint["model"])
9model.eval()
10
11# Generate
12import sentencepiece as spm
13sp = spm.SentencePieceProcessor()
14sp.load("tokenizer.model")
15
16tokens = sp.encode("The future of AI is")
17x = torch.tensor([tokens], dtype=torch.long, device="cuda")
18output = model.generate(x, max_new_tokens=100, temperature=0.7, top_k=40)
19print(sp.decode(output[0].tolist()))1{
2 "base_checkpoint": "modern_checkpoints/best_model.pt",
3 "tokenizer_path": "wiki.model",
4 "max_steps": 15000,
5 "batch_size": 4,
6 "grad_accum_steps": 8,
7 "block_size": 1024,
8 "lr": 2e-05,
9 "min_lr": 2e-06,
10 "warmup_steps": 500,
11 "weight_decay": 0.01,
12 "beta1": 0.9,
13 "beta2": 0.95,
14 "grad_clip": 1.0,
15 "eval_interval": 500,
16 "eval_iters": 30,
17 "log_interval": 25,
18 "checkpoint_interval": 2000,
19 "checkpoint_dir": "sft_v2_checkpoints",
20 "patience": 15,
21 "min_delta": 0.001,
22 "use_amp": true,
23 "compile_model": true,
24 "datasets": "alpaca,slimorca",
25 "val_split": 0.05,
26 "max_samples": 0,
27 "wandb_project": "llm-training",
28 "wandb_run_name": "aarav-gpt-zg2-sft-v2",
29 "wandb_enabled": true
30}