Views
No views yet
cl100k_base: as HF MLM tokenizerRobertaTokenizerFast1from pathlib import Path
2from transformers import RobertaTokenizerFast, AutoTokenizer
3
4repo_id = "BEE-spoke-data/cl100k_base-mlm"
5tk = AutoTokenizer.from_pretrained(repo_id)
6len(tk)
7# 1002661input_text = "i love memes"
2tokenized_ids = tk.encode(input_text)
3decoded_tokens = tk.convert_ids_to_tokens(tokenized_ids)
4
5print(f"for input '{input_text}' -> {tokenized_ids} -> {decoded_tokens}")
6# for input 'i love memes' -> [100277, 72, 3021, 62277, 100278] -> ['<s>', 'i', 'Ġlove', 'Ġmemes', '</s>']