Views
No views yet
| Component | Value |
|---|---|
| Tokenizer | QED-B1 tokenizer |
| Vocabulary size | 48,000 |
| Model type | Decoder-only Transformer |
| Parameters | ~107M |
| Hidden size | 768 |
| Layers | 12 |
| Attention heads | 12 |
| KV heads | 4 |
| Attention | GQA |
| Intermediate FFN size | 1792 |
| Activation | SwiGLU |
| Normalization | RMSNorm |
| Position encoding | RoPE |
| Context length | 2048 |
| RoPE theta | 10000 |
1from infer import load_model, load_tokenizer, run
2
3model = load_model("QED-Base-v2.pt")
4tokenizer = load_tokenizer("tok.model")
5
6text = run("Once upon a time", model, tokenizer, max_new_tokens=100)
7print(text)