Views
No views yet
| Detail | Value |
|---|---|
| Model Architecture | LlamaForCausalLM (Decoder-Only Transformer) |
| Parameter Count | ~500M |
| Training Type | Trained from Scratch (Random Initialization) |
| Tokenizer | Custom BPE, Vocab Size 32,000 |
| Sequence Length | 4096 tokens |
| Attention Type | Grouped Query Attention (GQA) |
| Parameter | Value |
|---|---|
| Number of Layers | 24 |
| Hidden Size (d) | 1280 |
| Intermediate Size ($\text{d}_{\text{ff}}$) | 3456 |
| Attention Heads | 20 (Query) / 5 (Key/Value) |
| Activation Function | SiLU (silu) |
| Normalization | RMS Norm (rms_norm_eps: 1e-06) |
| Position Embeddings | Rotary Positional Embeddings (RoPE, theta: 10000) |
sample_5b_tokens)ap-\npear) and character-confusion errors (deatli, lie for "he").final/ subfolder.import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
REPO = "haykgrigorian/TimeCapsuleLLM-English-1800-1875-v3-mini-eval"
tok = AutoTokenizer.from_pretrained(REPO, subfolder="final")
model = AutoModelForCausalLM.from_pretrained(REPO, subfolder="final", dtype=torch.bfloat16).eval()