Views
No views yet
[CLS]: Start-of-sequence token for classification tasks.[SEP]: Separator token for multi-segment inputs.[PAD]: Padding token.[MASK]: Masking token used for training masked language models.[UNK]: Token for unknown words.transformers library:1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("hugohow/creole_reunion_tokenizer")
4
5# Example of tokenization
6text = "Comment i lé zot tout ?"
7tokens = tokenizer.encode(text)
8print(tokens)