Tokenizer Study | LLaMA 130M | SentencePiece (T5 Tokenizer: t5-base)
Pre-Training: C4 [~2.054B tokens (BPE), ~2.00B tokens (SentencePiece)]
Tokenizer: SentencePiece (T5 Tokenizer, t5-base)
Evals:
Perplexity
- SentencePiece (T5): 27.17
Bits-per-byte
- SentencePiece (T5): 0.438
Checkpoints:
- 80K steps (Local steps 10K; 8 grad accumulations)
-
Path: /model_10000
-
Evals:
-
Perplexity: 30.366
-
Bits-per-byte: 0.4528