Views
No views yet
| File | Architecture | Tokenizer | Steps | Overall PPL | Purpose |
|---|---|---|---|---|---|
neox-a.pt | GPT-NeoX 410M (436M params) | structok-64k (merge barriers) | 20,000 | 19.4 | Merge-barrier model (NeoX) |
neox-b.pt | GPT-NeoX 410M (436M params) | standard-64k (no barriers) | 20,000 | 19.5 | Standard-BPE control (NeoX) |
llama-a.pt | Llama 410M (405M params, GQA 4:1) | structok-64k (merge barriers) | 40,000 | ~23 | Merge-barrier model (Llama) |
llama-b.pt | Llama 410M (405M params, GQA 4:1) | standard-64k (no barriers) | 40,000 | ~21 | Standard-BPE control (Llama) |
structok-64k.json: 65,539 vocab, 16 merge barriers (no delimiter character can participate in BPE merges)standard-64k.json: 65,536 vocab, standard BPE (no barriers)1import torch
2from transformers import AutoConfig
3
4# Load checkpoint
5checkpoint = torch.load("neox-a.pt", map_location="cpu")
6# Checkpoint contains: model_state_dict, optimizer_state_dict, step, config1python eval_ablation_v4_excess.py --model-a neox-a.pt --model-b neox-b.pt
2python eval_llama_ablation.py --model-a llama-a.pt --model-b llama-b.pt1@article{blackwell2026mergebarriers,
2 title={Merge Barriers in BPE Tokenization: How Tokenizer Design Causally Determines Attention Head Specialization},
3 author={Blackwell, Dayna},
4 year={2026},
5 url={https://github.com/blackwell-systems/merge-barriers}
6}