Views
No views yet
d18, d24, …)
lives under base_checkpoints/<tag>/ and shares a single tokenizer.d18 at step 6000| Depth | Step | Layers | d_model | Heads (Q/KV) | Vocab | Context |
|---|---|---|---|---|---|---|
d18 | 6000 | 18 | 1152 | 9/9 | 32768 | 2048 |
SSSL,
value embeddings (ResFormer-style), smear gate, and backout residual. Trained with the
nanochat fork.base_checkpoints/
<tag>/
model_<step>.pt — model weights (torch state dict, bf16)
meta_<step>.json — GPTConfig + training metadata
tokenizer/
tokenizer.pkl — tiktoken BPE encoding (vocab 32768, rustbpe-trained)
token_bytes.pt — per-token byte tensors (needed by SFT dataloader)1from huggingface_hub import snapshot_download
2import os
3
4snapshot_download(
5 repo_id="fdeantoni/max-babbelaar-base",
6 repo_type="model",
7 allow_patterns=["base_checkpoints/d18/**", "tokenizer/**"],
8 local_dir=os.path.expanduser("~/.cache/nanochat"),
9 local_dir_use_symlinks=False,
10)1NANOCHAT_BASE_DIR=~/.cache/nanochat \
2torchrun --standalone --nproc_per_node=N \
3 -m scripts.chat_sft \
4 --model-tag=d18 \
5 --sft-file /path/to/sft_train.jsonl<|bos|> <|user_start|> <|user_end|> <|assistant_start|> <|assistant_end|>
<|python_start|> <|python_end|> <|output_start|> <|output_end|>.tokenizer/tokenizer.pkl. Load within the nanochat project with:1from nanochat.tokenizer import get_tokenizer # reads NANOCHAT_BASE_DIR/tokenizer/tokenizer.pkl
2tokenizer = get_tokenizer()