| Parameter | Value |
|---|---|
| Vocab size | 32,000 |
| Model | BPE (Byte-Pair Encoding) |
| Pre-tokenizer | ByteLevel |
| Normalizer | NFC Unicode |
| min_frequency | 3 |
| Training data | Vietnamese Wikipedia (~4M lines) |
| Token | ID |
|---|---|
[UNK] | 0 |
[PAD] | 1 |
[BOS] | 2 |
[EOS] | 3 |
[MASK] | 4 |
1from transformers import PreTrainedTokenizerFast
2tokenizer = PreTrainedTokenizerFast.from_pretrained("KienCAS/vietnamese-bpe-32k")
3encoded = tokenizer("Tiếng Việt là ngôn ngữ của người Việt.", return_tensors="pt")
4decoded = tokenizer.decode(encoded['input_ids'][0], skip_special_tokens=True)