Views
No views yet
BertTokenizerFast built by extending the original bert-base-multilingual-cased with a large Dhivehi corpus. It retains full compatibility with English and other languages while adding wordpiece-level support for Dhivehi script.1from transformers import BertTokenizerFast
2
3tokenizer = BertTokenizerFast.from_pretrained("alakxender/bert-dhivehi-tokenizer-extended")
4
5text = "ދިވެހި މަޅި ރޯކުރަނީ The quick brown fox"
6tokens = tokenizer.tokenize(text)
7print(tokens)['ދިވެހި', 'މަޅި', 'ރޯ', '##ކުރަނީ', 'The', 'quick', 'brown', 'f', '##ox']bert-base-multilingual-casedBertTokenizerFast[PAD], [UNK], [CLS], [SEP], [MASK]| Language | Stock BERT | Extended Tokenizer |
|---|---|---|
| English | Perfect | Perfect |
| Dhivehi | UNKs | Full Coverage |