Views
No views yet
| parameters | 517,795,840 |
| layers | 24 |
| hidden size | 1280 |
| attention heads | 20 (head dim 64, MHA) |
| MLP | SwiGLU, inner 3456 |
| norm | RMSNorm, pre-norm |
| positions | RoPE (theta 10000) |
| context length | 1024 |
| vocab | 32,768 (byte-level BPE, trained on this corpus) |
| embeddings | tied |
| precision | bf16 |
| metric | value |
|---|---|
| validation perplexity | 7.912 |
| bits per byte | n/a |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tok = AutoTokenizer.from_pretrained("thesreedath/slm-500m-base")
4model = AutoModelForCausalLM.from_pretrained("thesreedath/slm-500m-base")
5
6ids = tok("The plaintiff alleges that the defendant", return_tensors="pt")
7out = model.generate(**ids, max_new_tokens=60, do_sample=True, top_k=50,
8 temperature=0.8, min_new_tokens=40)
9print(tok.decode(out[0], skip_special_tokens=True))min_new_tokens matters: a base model will otherwise sometimes emit EOS
immediately.