Views
No views yet
tokenizers library to use this tokenizer.1pip install transformers
2git clone https://github.com/huggingface/tokenizers.git
3cd tokenizers
4git checkout bigscience_fork
5cd bindings/python
6pip install setuptools_rust
7pip install -e .1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("bigscience-catalogue-data-dev/byte-level-bpe-tokenizer-no-norm-250k-whitespace-and-eos-regex-alpha-v3-dedup-lines-articles")