Views
No views yet
| Detail | Value |
|---|---|
| Model Architecture | LlamaForCausalLM (Decoder-Only Transformer) |
| Parameter Count | ~318 Million (318M) |
| Training Type | Trained from Scratch (Random Initialization) |
| Tokenizer | Custom BPE, Vocab Size 32,000 |
| Sequence Length | 1024 tokens |
| Attention Type | Grouped Query Attention (GQA) |
| Parameter | Value |
|---|---|
| Number of Layers | 20 |
| Hidden Size (d) | 1024 |
| Intermediate Size ($\text{d}_{\text{ff}}$) | 2752 |
| Attention Heads | 16 (Query) / 8 (Key/Value) |
| Activation Function | SiLU (silu) |
| Normalization | RMS Norm (rms_norm_eps: 1e-05) |
| Position Embeddings | Rotary Positional Embeddings (RoPE) |