scripts/train_tokenizer_20b.py in the AksaraLLM repo| ID | Token |
|---|---|
| 0 | <|pad|> |
| 1 | <|bos|> |
| 2 | <|eos|> |
| 3 | <|unk|> |
| 4 | <|system|> |
| 5 | <|user|> |
| 6 | <|assistant|> |
| 7 | <|tool|> |
| 8 | <|im_start|> |
| 9 | <|im_end|> |
| 10 | <|fim_prefix|> |
| 11 | <|fim_middle|> |
| 12 | <|fim_suffix|> |
| 13 | <|endoftext|> |
<|reserved_N|> for future expansion without breaking already-pretrained checkpoints.| Language | Fertility | Target |
|---|---|---|
| English web | 1.280 | ≤ 1.40 |
| Indonesian wiki | 1.357 | ≤ 1.60 |
| Indonesian web (CulturaX) | 1.215 | ≤ 1.60 |
| Malay wiki | 1.368 | ≤ 1.60 |
| Javanese wiki | 1.657 | ≤ 1.80 |
1from transformers import AutoTokenizer
2tok = AutoTokenizer.from_pretrained("Ezekiel999/aksara-tokenizer-20b")
3ids = tok("Halo dunia, saya AksaraLLM.", add_special_tokens=False).input_ids
4# → 8 tokens