Views
No views yet
1from transformers import AutoTokenizer
2
3# Load the tokenizer
4tokenizer = AutoTokenizer.from_pretrained("Benjamin-png/bert-tokenizer-swahili")
5
6# Example usage
7text = "Habari za asubuhi"
8encoded = tokenizer(text)
9print(encoded.tokens)1Input: "Habari za asubuhi"
2Tokens: ['[CLS]', 'habari', 'za', 'asubuhi', '[SEP]']
3
4Input: "Ninafurahi kukutana nawe"
5Tokens: ['[CLS]', 'ninafurahi', 'kukutana', 'nawe', '[SEP]']
6
7Input: "Karibu Tanzania"
8Tokens: ['[CLS]', 'karibu', 'tanzania', '[SEP]']1@misc{swahili-bert-tokenizer,
2 author = {Benjamin-png},
3 title = {BERT WordPiece Tokenizer for Swahili},
4 year = {2025},
5 publisher = {HuggingFace},
6 howpublished = {\url{https://huggingface.co/Benjamin-png/bert-tokenizer-swahili}}
7}