Views
No views yet
| Layers | 24 |
| Hidden | 1536 |
| Heads | 12 (MHA) |
| FFN | 4096 (SwiGLU / silu) |
| Pos. enc. | RoPE (θ=10000) |
| Norm | RMSNorm |
| Embeddings | tied |
| Vocab | 50304 (gpt2 tokenizer) |
| Seq len | 2048 |
| Dtype | bf16 |
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3mid = "ftajwar/d24-climbmix-dolmino-midtrain-100b"
4tok = AutoTokenizer.from_pretrained(mid)
5model = AutoModelForCausalLM.from_pretrained(mid, torch_dtype=torch.bfloat16).cuda().eval()
6ids = tok("The first three prime numbers are", return_tensors="pt").to("cuda")
7print(tok.decode(model.generate(**ids, max_new_tokens=40)[0], skip_special_tokens=True))--append-eod during data prep. It is a base completion model —
prompt it with plain text, not chat turns.