Views
No views yet
CHAR) vs. subword tokenization (BPE)PHON) vs. orthographic data (TXT)SPACELESS) vs. keeps whitespace1from transformers import AutoTokenizer
2tokenizer = AutoTokenizer.from_pretrained('phonemetransformers/babble-tokenizers', subfolder='BABYLM-TOKENIZER-CHAR-TXT')