Views
No views yet
| Component | Value |
|---|---|
| Architecture | LLaMA-style (RoPE + RMSNorm + SwiGLU) |
| Parameters | ~33.9M |
| Layers | 8 |
| Attention Heads | 8 |
| Embedding Dim | 512 |
| Training Context | 512 tokens |
| Max Context (RoPE) | 5,000,000 tokens |
| Vocabulary | 16,000 BPE tokens |
| FFN Activation | SwiGLU |
| Normalization | RMSNorm |
| Position Encoding | RoPE (theta=5000000.0) |
| Best Eval Loss | 0.12973198837134986 |
1import torch
2from config import cfg
3from model import SDLCSLM
4from tokenizers import Tokenizer
5
6# Load
7checkpoint = torch.load("pytorch_model.bin", map_location="cpu")
8model = SDLCSLM()
9model.load_state_dict(checkpoint)
10model.eval()
11
12tokenizer = Tokenizer.from_file("tokenizer.json")
13
14# Generate
15prompt = "<bos><|system|>You are SDLC-SLM.<|user|>What is CI/CD?<|assistant|>"
16ids = torch.tensor([tokenizer.encode(prompt).ids])
17out = model.generate(ids, max_new_tokens=256, temperature=0.8, top_k=50)
18print(tokenizer.decode(out[0].tolist()))