1from tokenizers.implementations import ByteLevelBPETokenizer
2from tokenizers.processors import BertProcessing
3
4tokenizer = ByteLevelBPETokenizer("./vocab.json", "./merges.txt")
5tokenizer._tokenizer.post_processor = BertProcessing(
6 ("</s>", tokenizer.token_to_id("</s>")),
7 ("<s>", tokenizer.token_to_id("<s>")),
8)
9tokenizer.enable_truncation(max_length=512)